跳到主要内容

全部菜单

在自己的电脑上运行 LLM

5 款工具, 最后更新 2026-09-16

本地 LLM 首先要看的不是选哪个工具,而是哪个模型装得进你的内存。同名模型因量化方式不同,体积可以差好几倍;对话越长,KV 缓存占的内存越多。下面这些工具也正是按处理内存问题的方式来区分的:有的先测硬件再挑模型,有的把权重从 SSD 流式加载,有的只为某一个模型深度优化。

韩语是由模型决定的,而不是工具。服务器有韩语界面,但模型写不好韩语也没用。所以下面的韩语条目看的是各工具默认针对的模型,在官方模型卡里怎么描述韩语。

确认方式. 于 2026 年 9 月 14 日阅读各工具的 GitHub README 和官方模型卡(Google、DeepSeek、Qwen、Hugging Face)后整理。实际安装并运行过的条目标为「已实际安装」,其余为「依据文档」。每秒 token 数只转录 README 连同机器一起给出的数值。

一览比较

安装Omlx依据文档Magnitude依据文档Turbo Fieldfare依据文档Ds4依据文档Airllm依据文档
安装.dmg 或 brew,macOS 15 以上一行 npmXcode 26 源码构建 + 15GB 模型make 构建,下载专用 GGUFpip install airllm
韩语管理界面有韩语README 未提及Gemma 4 模型卡未单独点名韩语DeepSeek V4 模型卡未列语言README 未提及韩语
关键限制仅 MLX 格式,仅 Apple Silicon推理后端未公开,Windows 走 WSLmacOS 26,只跑 Gemma 4 26B-A4BMetal 基准为 96GB 以上的 Mac逐层从磁盘加载,速度慢

Omlx

在菜单栏管理的 Apple Silicon LLM 推理服务 21,850依据文档

适合这种情况. 想把一台 Apple Silicon Mac 当成多个应用或团队共用的 API 服务器的时候。在菜单栏而不是终端里管理。

安装过程

  1. 仅支持 macOS 15 以上的 Apple Silicon(M1 起)。不支持 Intel Mac、Windows、Linux。
  2. 下载 .dmg 拖进「应用程序」即可,应用内可自动更新。Homebrew:先 brew tap jundot/omlx,再 brew install jundot/omlx/omlx。
  3. 源码安装在 Python 3.11 到 3.13 下执行 pip install -e .;要用 MCP 就加上 ".[mcp]"。
  4. 只接受 MLX 格式的模型。可在管理界面直接搜索并下载 Hugging Face 上的 MLX 模型。

韩语可用性

README 写明管理界面支持包括韩语在内的 8 种语言。韩语输出质量取决于你加载的模型。示例中用的 Qwen3.5 系列在公开资料里把韩语列为主要语言之一,但无论哪个模型,都应先看模型卡的语言一栏再决定。

实际限制

  • 仅支持 MLX,GGUF 文件无法使用。
  • 内存上限默认为「系统内存减去 8GB」,超出后先卸载最久未用的模型。
  • GLM-5.2、MiniMax M3 等新模型的自定义内核仅靠 pip install 无法构建,需要完整的 Xcode。
  • 同时兼容 OpenAI 和 Anthropic 两种 API 格式。Apache 2.0。

确认日期 2026-09-14, 确认: 依据文档. 根据官方文档和 README 撰写,未实际安装试用。

Magnitude

按硬件挑选本地模型的推理服务 4,619依据文档

适合这种情况. 不知道该选哪个模型的时候。它会测量你的设备,筛出能跑的模型,并接进你已经在用的编码代理。

安装过程

  1. 一行 npm i -g @magnitudedev/cli 即可。README 没有写 Node.js 版本要求。
  2. 可在 macOS、Linux、Windows(WSL)上运行,覆盖 Apple Silicon、NVIDIA、AMD GPU 和纯 CPU 设备。
  3. 安装后会测量芯片、内存和带宽,列出能运行的模型和预估每秒 token 数,再下载并运行你选的模型。

韩语可用性

README 没有任何语言相关说明。它按速度、准确率、内存给模型排序,所以需要韩语的话,得从推荐列表里自己挑把韩语列入支持语言的模型(如 Qwen、Gemma 系列)。韩语界面也未能确认。

实际限制

  • README 没有说明使用哪种推理后端(llama.cpp、MLX 等)。
  • Windows 需通过 WSL。
  • 可接入 Pi、OpenCode、Hermes、OpenClaw、Codex、Claude Code、Oh My Pi、Cline,一个都不用的话有自带的 harness。Apache 2.0。没有 token 费用、API 密钥和请求限额。

确认日期 2026-09-14, 确认: 依据文档. 根据官方文档和 README 撰写,未实际安装试用。

Turbo Fieldfare

M系列MacBook上约2GB内存跑Gemma 4 26B-A4B。 6,766依据文档

适合这种情况. 想在 8GB MacBook Air 这种小内存的 M 系列 Mac 上跑一次 26B 级模型的时候。

安装过程

  1. 需要 macOS 26(Metal 4)和 Apple Silicon。验证基准机器是 8GB 的 M2 MacBook Air。
  2. 只支持源码构建:在 Xcode 26、Swift 6.2 以上执行 swift build -c release,然后运行 .build/release/TurboFieldfareMac。
  3. 点应用里的 Download 按钮会下载模型并重新打包成 .gturbo 格式:传输约 15GB,安装后约 14.3GB,图像包再加 1.1GB。
  4. Mac 应用、CLI 和 OpenAI 兼容的 Chat Completions 服务器共用同一个模型文件夹。

韩语可用性

模型固定为 Gemma 4 26B-A4B 一个。Google 的模型卡写明用 140 多种语言预训练,但没有单独点名韩语。README 没有语言相关说明。

实际限制

  • 内存至少 8GB;「约 2GB」指的是权重加 4K KV 缓存。磁盘需留出 15GB 以上。
  • README 给出的速度:8GB M2 MacBook Air 上 5.1 到 6.3 tok/s,24GB M5 Pro 上 31 到 35 tok/s。
  • 支持文本,图像在 M2 以上可选,不支持音频和视频。M1 只能处理文本。
  • 服务器仅限本机回环,没有鉴权和 TLS。Apache 2.0,模型权重遵循 Gemma 条款。

确认日期 2026-09-14, 确认: 依据文档. 根据官方文档和 README 撰写,未实际安装试用。

Ds4

专为 DeepSeek V4 打造的本地推理引擎。 22,494依据文档

适合这种情况. 手里有 96GB 以上的 Mac 或 DGX Spark 这类大机器,想把 DeepSeek V4 跑到最快的时候。

安装过程

  1. 在仓库根目录选择 make(Metal)、make cuda-spark(DGX Spark)、make strix-halo(AMD Strix Halo)或 make cuda-generic(多 GPU CUDA)之一。
  2. 模型通过 ./download_model.sh ds4f-q2 这类命令下载项目自制的 GGUF。它不是通用 GGUF 运行器,别处的 GGUF 用不了。
  3. ds4-server 在 http://127.0.0.1:8000 提供服务,CLI 是交互式对话,ds4-agent 是带工具调用的编码代理。

韩语可用性

DeepSeek V4 Flash 的官方模型卡没有列出支持语言,只给了中文和英文基准(CMMLU、C-Eval 等)。它也支持 GLM 5.x、Qwen3.8,但这个工具的 README 没有语言相关说明。韩语质量应视为未确认。

实际限制

  • Metal 的基准机器是 96GB 以上的 Mac,更小的机器用 SSD 流式加载。即使 128GB 机器,跑完整的 GLM 5.x 也需要 SSD 流式加载。
  • DeepSeek V4 Flash 总参数 284B、激活 13B。Qwen3.8 Flash Next 的 Q2 版主权重 41.73GiB,外加 95.37GiB 的 n-gram。
  • README 自称测试版质量,含图像的会话目前还不能保存。
  • MIT 许可证;DeepSeek V4 Flash 模型也是 MIT。

确认日期 2026-09-14, 确认: 依据文档. 根据官方文档和 README 撰写,未实际安装试用。

Airllm

一块 4GB 显卡跑 700 亿参数模型。 34,488依据文档

适合这种情况. 显存只有 4GB,却需要至少跑一次 70B 级模型的时候。比起速度,更在乎能不能跑起来的实验用途。

安装过程

  1. 执行 pip install airllm。要用 4 位、8 位压缩,再执行 pip install -U bitsandbytes。
  2. 在 Mac 上需要同时安装 mlx 和 torch,且只支持 Apple Silicon。
  3. 部分模型需要特定的 transformers 构建(例如 Qwen3.8-Flash-Next 需要 git 最新版)。下载受限模型需要 Hugging Face 令牌。

韩语可用性

支持 Llama、Qwen、DeepSeek、Mistral、Gemma、ChatGLM、Baichuan、Yi 等多种模型系列。README 点名介绍了好几个中文模型,但完全没提韩语。需要韩语的话,得先在目标模型的模型卡里确认支持情况再选。它是一个库,没有界面。

实际限制

  • 一次只把一层放到 GPU 上,其余从磁盘流式加载,所以慢。README 只说压缩后快 3 倍,没有给出绝对速度。
  • 模型按层拆分存储,非常占磁盘;空间不足会以 MetadataIncompleteBuffer 错误中止。
  • 部分模型没有填充 token,需要手动设置;Kimi K3 必须使用 CUDA 12。
  • CPU 推理只有一句话提及,没有细节。Apache-2.0。

确认日期 2026-09-14, 确认: 依据文档. 根据官方文档和 README 撰写,未实际安装试用。