跳到主要內容

全部選單

在自己的電腦上執行 LLM

5 款工具, 最後更新 2026-09-16

本地 LLM 首先要看的不是選哪個工具,而是哪個模型裝得進你的記憶體。同名模型因量化方式不同,體積可以差好幾倍;對話越長,KV 快取佔的記憶體越多。下面這些工具也正是按處理記憶體問題的方式來區分的:有的先測硬體再挑模型,有的把權重從 SSD 串流載入,有的只為某一個模型深度最佳化。

韓語是由模型決定的,而不是工具。伺服器有韓語介面,但模型寫不好韓語也沒用。所以下面的韓語條目看的是各工具預設針對的模型,在官方模型卡裡怎麼描述韓語。

確認方式. 於 2026 年 9 月 14 日閱讀各工具的 GitHub README 和官方模型卡(Google、DeepSeek、Qwen、Hugging Face)後整理。實際安裝並執行過的條目標為「已實際安裝」,其餘為「依據文件」。每秒 token 數只轉錄 README 連同機器一起給出的數值。

一覽比較

安裝Omlx依據文件Magnitude依據文件Turbo Fieldfare依據文件Ds4依據文件Airllm依據文件
安裝.dmg 或 brew,macOS 15 以上一行 npmXcode 26 原始碼建置 + 15GB 模型make 建置,下載專用 GGUFpip install airllm
韓語管理介面有韓語README 未提及Gemma 4 模型卡未單獨點名韓語DeepSeek V4 模型卡未列語言README 未提及韓語
關鍵限制僅 MLX 格式,僅 Apple Silicon推理後端未公開,Windows 走 WSLmacOS 26,只跑 Gemma 4 26B-A4BMetal 基準為 96GB 以上的 Mac逐層從磁碟載入,速度慢

Omlx

從選單列操作的 Apple Silicon LLM 推論伺服器 21,850依據文件

適合這種情況. 想把一台 Apple Silicon Mac 當成多個應用或團隊共用的 API 伺服器的時候。在選單列而不是終端機裡管理。

安裝過程

  1. 僅支援 macOS 15 以上的 Apple Silicon(M1 起)。不支援 Intel Mac、Windows、Linux。
  2. 下載 .dmg 拖進「應用程式」即可,應用內可自動更新。Homebrew:先 brew tap jundot/omlx,再 brew install jundot/omlx/omlx。
  3. 原始碼安裝在 Python 3.11 到 3.13 下執行 pip install -e .;要用 MCP 就加上 ".[mcp]"。
  4. 只接受 MLX 格式的模型。可在管理介面直接搜尋並下載 Hugging Face 上的 MLX 模型。

韓語可用性

README 寫明管理介面支援包括韓語在內的 8 種語言。韓語輸出品質取決於你載入的模型。範例中用的 Qwen3.5 系列在公開資料裡把韓語列為主要語言之一,但無論哪個模型,都應先看模型卡的語言一欄再決定。

實際限制

  • 僅支援 MLX,GGUF 檔案無法使用。
  • 記憶體上限預設為「系統記憶體減去 8GB」,超出後先卸載最久未用的模型。
  • GLM-5.2、MiniMax M3 等新模型的自訂核心僅靠 pip install 無法建置,需要完整的 Xcode。
  • 同時相容 OpenAI 和 Anthropic 兩種 API 格式。Apache 2.0。

確認日期 2026-09-14, 確認: 依據文件. 根據官方文件和 README 撰寫,未實際安裝試用。

Magnitude

依硬體挑選本地模型的推論伺服器 4,619依據文件

適合這種情況. 不知道該選哪個模型的時候。它會測量你的裝置,篩出能跑的模型,並接進你已經在用的編碼代理。

安裝過程

  1. 一行 npm i -g @magnitudedev/cli 即可。README 沒有寫 Node.js 版本需求。
  2. 可在 macOS、Linux、Windows(WSL)上執行,涵蓋 Apple Silicon、NVIDIA、AMD GPU 和純 CPU 裝置。
  3. 安裝後會測量晶片、記憶體和頻寬,列出能執行的模型和預估每秒 token 數,再下載並執行你選的模型。

韓語可用性

README 沒有任何語言相關說明。它按速度、準確率、記憶體給模型排序,所以需要韓語的話,得從推薦清單裡自己挑把韓語列入支援語言的模型(如 Qwen、Gemma 系列)。韓語介面也未能確認。

實際限制

  • README 沒有說明使用哪種推理後端(llama.cpp、MLX 等)。
  • Windows 需透過 WSL。
  • 可接入 Pi、OpenCode、Hermes、OpenClaw、Codex、Claude Code、Oh My Pi、Cline,一個都不用的話有自帶的 harness。Apache 2.0。沒有 token 費用、API 金鑰和請求限額。

確認日期 2026-09-14, 確認: 依據文件. 根據官方文件和 README 撰寫,未實際安裝試用。

Turbo Fieldfare

M 系列 MacBook 上約 2GB 記憶體跑 Gemma 4 26B-A4B。 6,766依據文件

適合這種情況. 想在 8GB MacBook Air 這種小記憶體的 M 系列 Mac 上跑一次 26B 級模型的時候。

安裝過程

  1. 需要 macOS 26(Metal 4)和 Apple Silicon。驗證基準機器是 8GB 的 M2 MacBook Air。
  2. 只支援原始碼建置:在 Xcode 26、Swift 6.2 以上執行 swift build -c release,然後執行 .build/release/TurboFieldfareMac。
  3. 點應用裡的 Download 按鈕會下載模型並重新打包成 .gturbo 格式:傳輸約 15GB,安裝後約 14.3GB,影像包再加 1.1GB。
  4. Mac 應用、CLI 和 OpenAI 相容的 Chat Completions 伺服器共用同一個模型資料夾。

韓語可用性

模型固定為 Gemma 4 26B-A4B 一個。Google 的模型卡寫明用 140 多種語言預訓練,但沒有單獨點名韓語。README 沒有語言相關說明。

實際限制

  • 記憶體至少 8GB;「約 2GB」指的是權重加 4K KV 快取。磁碟需留出 15GB 以上。
  • README 給出的速度:8GB M2 MacBook Air 上 5.1 到 6.3 tok/s,24GB M5 Pro 上 31 到 35 tok/s。
  • 支援文字,影像在 M2 以上可選,不支援音訊和影片。M1 只能處理文字。
  • 伺服器僅限本機回送,沒有驗證和 TLS。Apache 2.0,模型權重遵循 Gemma 條款。

確認日期 2026-09-14, 確認: 依據文件. 根據官方文件和 README 撰寫,未實際安裝試用。

Ds4

專為 DeepSeek V4 打造的本地推論引擎。 22,494依據文件

適合這種情況. 手裡有 96GB 以上的 Mac 或 DGX Spark 這類大機器,想把 DeepSeek V4 跑到最快的時候。

安裝過程

  1. 在儲存庫根目錄選擇 make(Metal)、make cuda-spark(DGX Spark)、make strix-halo(AMD Strix Halo)或 make cuda-generic(多 GPU CUDA)之一。
  2. 模型透過 ./download_model.sh ds4f-q2 這類指令下載專案自製的 GGUF。它不是通用 GGUF 執行器,別處的 GGUF 用不了。
  3. ds4-server 在 http://127.0.0.1:8000 提供服務,CLI 是互動式對話,ds4-agent 是帶工具呼叫的編碼代理。

韓語可用性

DeepSeek V4 Flash 的官方模型卡沒有列出支援語言,只給了中文和英文基準(CMMLU、C-Eval 等)。它也支援 GLM 5.x、Qwen3.8,但這個工具的 README 沒有語言相關說明。韓語品質應視為未確認。

實際限制

  • Metal 的基準機器是 96GB 以上的 Mac,更小的機器用 SSD 串流載入。即使 128GB 機器,跑完整的 GLM 5.x 也需要 SSD 串流載入。
  • DeepSeek V4 Flash 總參數 284B、啟用 13B。Qwen3.8 Flash Next 的 Q2 版主權重 41.73GiB,外加 95.37GiB 的 n-gram。
  • README 自稱測試版品質,含影像的工作階段目前還不能儲存。
  • MIT 授權;DeepSeek V4 Flash 模型也是 MIT。

確認日期 2026-09-14, 確認: 依據文件. 根據官方文件和 README 撰寫,未實際安裝試用。

Airllm

一張 4GB 顯示卡跑 700 億參數模型。 34,488依據文件

適合這種情況. 顯示記憶體只有 4GB,卻需要至少跑一次 70B 級模型的時候。比起速度,更在乎能不能跑起來的實驗用途。

安裝過程

  1. 執行 pip install airllm。要用 4 位元、8 位元壓縮,再執行 pip install -U bitsandbytes。
  2. 在 Mac 上需要同時安裝 mlx 和 torch,且只支援 Apple Silicon。
  3. 部分模型需要特定的 transformers 建置(例如 Qwen3.8-Flash-Next 需要 git 最新版)。下載受限模型需要 Hugging Face 權杖。

韓語可用性

支援 Llama、Qwen、DeepSeek、Mistral、Gemma、ChatGLM、Baichuan、Yi 等多種模型系列。README 點名介紹了好幾個中文模型,但完全沒提韓語。需要韓語的話,得先在目標模型的模型卡裡確認支援情況再選。它是一個函式庫,沒有介面。

實際限制

  • 一次只把一層放到 GPU 上,其餘從磁碟串流載入,所以慢。README 只說壓縮後快 3 倍,沒有給出絕對速度。
  • 模型按層拆分儲存,非常佔磁碟;空間不足會以 MetadataIncompleteBuffer 錯誤中止。
  • 部分模型沒有填充 token,需要手動設定;Kimi K3 必須使用 CUDA 12。
  • CPU 推理只有一句話提及,沒有細節。Apache-2.0。

確認日期 2026-09-14, 確認: 依據文件. 根據官方文件和 README 撰寫,未實際安裝試用。