본문 바로가기

전체 메뉴

slotstream

SSD 에서 전문가 가중치를 흘려 넣어 125B MoE 모델을 애플 실리콘 맥에서 돌립니다.

웹사이트
github.com
언어
영어
등록일
16일 전
스타
373
포크
23

carloslfu/slotstream ↗, Swift, MIT, 최근 커밋 1일 전

Qwen3.8-Flash-Next 의 3.8 GB 트렁크만 메모리에 붙들어 두고 나머지 전문가 가중치는 SSD 에서 슬롯 단위로 흘려 넣습니다. 슬롯 개수를 그 기기의 실제 메모리에 맞추기 때문에 105 GB 짜리 모델이 48 GB 맥북 프로에서 초당 12 토큰 남짓으로 돌고, 시동에 2초쯤 걸립니다. Python 없이 Swift 바이너리 하나로 배포하며 Ollama 와 OpenAI 챗 API 를 그대로 받으므로 쓰던 도구를 고칠 일이 없습니다. 애플 실리콘과 macOS 14 이상, 빈 디스크 110 GB 가 필요합니다. MIT 라이선스입니다.

이 제품이 마음에 드세요?