본문 바로가기

전체 메뉴

내 컴퓨터에서 LLM 돌리기

도구 5개, 마지막 수정 2026-09-16

로컬 LLM은 어떤 도구를 고르느냐보다 어떤 모델이 내 메모리에 들어가는지를 먼저 따져야 합니다. 같은 이름의 모델도 양자화에 따라 크기가 몇 배씩 달라지고, 대화가 길어질수록 KV 캐시가 메모리를 더 차지합니다. 아래 도구도 메모리 문제를 다루는 방식에 따라 나뉩니다. 하드웨어를 재서 모델을 골라 주는 도구, 가중치를 SSD에서 흘려 넣는 도구, 특정 모델 하나에 맞춰 최적화한 도구입니다.

한국어는 도구가 아니라 모델이 좌우합니다. 서버에 한국어 UI가 있어도 모델이 한국어를 제대로 쓰지 못하면 소용이 없습니다. 따라서 아래 한국어 항목에서는 각 도구가 기본으로 겨냥하는 모델의 공식 카드에 한국어가 어떻게 적혀 있는지 살펴봤습니다.

확인 방법. 2026년 9월 14일에 각 도구의 GitHub README와 모델의 공식 카드(Google, DeepSeek, Qwen, Hugging Face)를 읽고 정리했습니다. 직접 설치해 돌린 항목에는 「직접 설치」 표시를 붙였고, 나머지는 「문서 기준」입니다. 초당 토큰 수는 README가 장비와 함께 밝힌 수치만 옮겼습니다.

한눈에 비교

설치Omlx문서 기준Magnitude문서 기준Turbo Fieldfare문서 기준Ds4문서 기준Airllm문서 기준
설치.dmg 또는 brew, macOS 15 이상npm 한 줄Xcode 26 소스 빌드 + 모델 15GBmake 빌드, 전용 GGUF 내려받기pip install airllm
한국어관리 화면 UI에 한국어 있음README에 언급 없음Gemma 4 카드에 한국어 개별 언급 없음DeepSeek V4 카드에 언어 미기재README에 한국어 언급 없음
핵심 제약MLX 형식만, 애플 실리콘 전용추론 백엔드 미공개, Windows는 WSLmacOS 26, Gemma 4 26B-A4B 하나만Metal 기준 96GB 이상 맥층별 디스크 로딩이라 느림

Omlx

메뉴 막대에서 관리하는 애플 실리콘용 LLM 추론 서버 21,850문서 기준

이런 경우에. 애플 실리콘 맥 한 대를 여러 앱이나 팀이 함께 쓰는 API 서버로 두고 싶을 때. 터미널이 아니라 메뉴 막대에서 관리합니다.

설치 과정

  1. macOS 15 이상, 애플 실리콘(M1부터)에서만 쓸 수 있습니다. 인텔 맥, Windows, Linux는 지원하지 않습니다.
  2. .dmg를 받아 응용 프로그램 폴더에 끌어다 놓으면 끝이며, 앱 안에서 업데이트할 수 있습니다. Homebrew에서는 brew tap jundot/omlx를 실행한 뒤 brew install jundot/omlx/omlx를 실행합니다.
  3. 소스 설치는 Python 3.11~3.13에서 pip install -e .으로 하며, MCP를 쓰려면 ".[mcp]"를 붙입니다.
  4. 모델은 MLX 형식만 받습니다. 관리 화면에서 Hugging Face의 MLX 모델을 검색해 바로 내려받을 수 있습니다.

한국어 사용성

README에는 관리 화면 UI가 한국어를 포함한 8개 언어를 지원한다고 적혀 있습니다. 한국어 출력 품질은 올리는 모델이 좌우합니다. 예시로 든 Qwen3.5 계열은 공개 자료에서 한국어를 주요 언어에 넣지만, 어떤 모델이든 카드의 언어 항목을 먼저 확인한 뒤 고르는 편이 낫습니다.

실제 제약

  • MLX 전용이어서 GGUF 파일은 쓸 수 없습니다.
  • 메모리 상한의 기본값은 「시스템 RAM에서 8GB를 뺀 값」이며, 이를 넘으면 오래 쓰지 않은 모델부터 내립니다.
  • GLM-5.2, MiniMax M3 같은 최신 모델용 커스텀 커널은 pip install만으로 만들 수 없고 전체 Xcode가 필요합니다.
  • OpenAI와 Anthropic의 두 API 형식을 모두 흉내 냅니다. Apache 2.0.

확인일 2026-09-14, 확인: 문서 기준. 공식 문서와 README를 읽고 적었습니다. 직접 설치해 보지는 않았습니다.

Magnitude

하드웨어에 맞는 로컬 모델을 골라 돌리는 오픈소스 추론 서버 4,619문서 기준

이런 경우에. 어떤 모델을 골라야 할지 모를 때. 장비를 재서 실행할 수 있는 모델을 추려 주고, 이미 쓰고 있는 코딩 에이전트에 연결합니다.

설치 과정

  1. npm i -g @magnitudedev/cli 한 줄이면 됩니다. README에는 Node.js 버전 요구 사항이 없습니다.
  2. macOS, Linux, Windows(WSL)에서 작동하며 애플 실리콘, NVIDIA, AMD GPU, CPU 전용 장비를 모두 대상으로 삼습니다.
  3. 설치한 뒤 칩, 메모리, 대역폭을 재서 실행할 수 있는 모델과 예상 초당 토큰을 보여 주고, 고른 모델을 내려받아 실행합니다.

한국어 사용성

README에는 언어 관련 설명이 없습니다. 속도, 정확도, 메모리를 기준으로 모델을 줄 세우는 도구이므로 한국어가 필요하다면 추천 목록에서 한국어를 지원 목록에 둔 모델(Qwen, Gemma 계열 등)을 직접 골라야 합니다. 한국어 UI도 확인하지 못했습니다.

실제 제약

  • 어떤 추론 백엔드(llama.cpp, MLX 등)를 쓰는지 README에서 밝히지 않습니다.
  • Windows에서는 WSL을 거칩니다.
  • Pi, OpenCode, Hermes, OpenClaw, Codex, Claude Code, Oh My Pi, Cline에 연결할 수 있고, 아무것도 쓰지 않으면 자체 하네스를 이용할 수 있습니다. Apache 2.0. 토큰 요금, API 키, 요청 한도가 없습니다.

확인일 2026-09-14, 확인: 문서 기준. 공식 문서와 README를 읽고 적었습니다. 직접 설치해 보지는 않았습니다.

Turbo Fieldfare

M시리즈 맥북에서 Gemma 4 26B-A4B를 램 약 2GB로 돌립니다. 6,766문서 기준

이런 경우에. 8GB 맥북 에어처럼 메모리가 작은 M 시리즈 맥에서 26B급 모델을 한 번 돌려 보고 싶을 때.

설치 과정

  1. macOS 26(Metal 4)과 애플 실리콘이 필요합니다. 검증 기준 장비는 8GB M2 맥북 에어입니다.
  2. 소스 빌드만 지원합니다. Xcode 26, Swift 6.2 이상에서 swift build -c release를 실행한 뒤 .build/release/TurboFieldfareMac을 실행합니다.
  3. 앱의 Download 버튼을 누르면 모델을 받아 .gturbo 형식으로 다시 묶습니다. 전송량은 약 15GB, 설치 후 용량은 약 14.3GB이며 이미지 팩은 1.1GB가 더 필요합니다.
  4. Mac 앱, CLI, OpenAI 호환 Chat Completions 서버가 같은 모델 폴더를 함께 사용합니다.

한국어 사용성

모델은 Gemma 4 26B-A4B 하나로 고정돼 있습니다. Google의 모델 카드에는 140개 이상 언어로 사전 학습했다고 적혀 있지만, 한국어를 따로 이름 붙이지는 않았습니다. README에는 언어 관련 설명이 없습니다.

실제 제약

  • RAM은 최소 8GB가 필요하며, 「약 2GB」는 가중치와 4K KV 캐시 기준입니다. 저장 공간은 15GB 넘게 비워야 합니다.
  • README가 밝힌 속도는 8GB M2 맥북 에어에서 5.1~6.3 tok/s, 24GB M5 Pro에서 31~35 tok/s입니다.
  • 텍스트는 지원하고 이미지는 M2 이상에서 선택할 수 있지만, 오디오와 비디오는 지원하지 않습니다. M1은 텍스트 전용입니다.
  • 서버는 루프백 전용이며 인증과 TLS가 없습니다. Apache 2.0, 모델 가중치는 Gemma 약관을 따릅니다.

확인일 2026-09-14, 확인: 문서 기준. 공식 문서와 README를 읽고 적었습니다. 직접 설치해 보지는 않았습니다.

Ds4

DeepSeek V4 를 겨냥한 로컬 추론 엔진. 22,494문서 기준

이런 경우에. 96GB 이상 맥이나 DGX Spark 같은 큰 장비가 있고, DeepSeek V4를 최대한 빠르게 돌리고 싶을 때.

설치 과정

  1. 저장소 루트에서 make(Metal), make cuda-spark(DGX Spark), make strix-halo(AMD Strix Halo), make cuda-generic(CUDA 다중 GPU) 가운데 하나를 고릅니다.
  2. 모델은 ./download_model.sh ds4f-q2처럼 프로젝트가 직접 만든 GGUF를 받습니다. 범용 GGUF 러너가 아니어서 다른 곳의 GGUF는 쓸 수 없습니다.
  3. ds4-server는 http://127.0.0.1:8000 에서 서버로 작동하고, CLI는 대화형으로 쓰며, ds4-agent는 도구 호출 기능을 갖춘 코딩 에이전트로 사용합니다.

한국어 사용성

DeepSeek V4 Flash의 공식 카드는 지원 언어를 밝히지 않고 중국어, 영어 벤치마크(CMMLU, C-Eval 등)만 제시합니다. GLM 5.x, Qwen3.8도 지원하지만 이 도구의 README에는 언어 관련 설명이 없습니다. 한국어 품질은 확인되지 않은 상태로 두는 편이 맞습니다.

실제 제약

  • Metal 기준 장비는 96GB 이상 맥이며, 그보다 작으면 SSD 스트리밍으로 실행합니다. 128GB 장비에서도 GLM 5.x 전체 모델은 SSD 스트리밍이 필요합니다.
  • DeepSeek V4 Flash는 전체 284B, 활성 13B 파라미터입니다. Qwen3.8 Flash Next Q2는 주 가중치 41.73GiB에 n-gram 95.37GiB가 붙습니다.
  • README에서 스스로 베타 품질이라고 밝히고 있으며, 이미지가 든 세션은 아직 저장할 수 없습니다.
  • MIT 라이선스. DeepSeek V4 Flash 모델도 MIT.

확인일 2026-09-14, 확인: 문서 기준. 공식 문서와 README를 읽고 적었습니다. 직접 설치해 보지는 않았습니다.

Airllm

4GB GPU 한 장으로 700억 파라미터를 돌립니다. 34,488문서 기준

이런 경우에. GPU 메모리가 4GB뿐인데 70B급 모델을 한 번은 돌려 봐야 할 때. 속도보다 실행 가능 여부가 중요한 실험용입니다.

설치 과정

  1. pip install airllm을 실행합니다. 4비트, 8비트 압축을 쓰려면 pip install -U bitsandbytes를 추가로 실행합니다.
  2. 맥에서는 mlx와 torch가 모두 필요하며 애플 실리콘만 지원합니다.
  3. 일부 모델에는 특정 transformers 빌드가 필요합니다(예: Qwen3.8-Flash-Next는 git 최신판). 게이트된 모델을 받으려면 Hugging Face 토큰이 있어야 합니다.

한국어 사용성

Llama, Qwen, DeepSeek, Mistral, Gemma, ChatGLM, Baichuan, Yi 등 다양한 모델 계열을 지원합니다. README는 중국어 모델을 여럿 이름 붙여 소개하지만 한국어는 언급하지 않습니다. 한국어가 필요하다면 해당 모델의 카드에서 지원 여부를 확인한 뒤 골라야 합니다. 라이브러리이므로 UI는 없습니다.

실제 제약

  • 한 번에 한 층만 GPU에 올리고 나머지는 디스크에서 흘려 넣는 방식이라 느립니다. README에는 압축하면 3배 빨라진다고만 적혀 있고 절대 속도는 나와 있지 않습니다.
  • 모델을 층별로 나눠 저장하므로 디스크가 많이 필요하며, 공간이 부족하면 MetadataIncompleteBuffer 오류로 멈춥니다.
  • 일부 모델은 패딩 토큰이 없어 직접 설정해야 하며, Kimi K3는 CUDA 12가 필수입니다.
  • CPU 추론은 한 줄만 언급돼 있고 자세한 설명은 없습니다. Apache-2.0.

확인일 2026-09-14, 확인: 문서 기준. 공식 문서와 README를 읽고 적었습니다. 직접 설치해 보지는 않았습니다.