- 語言
- 英語
- 發布於
- 16天前
- 複刻
- 23
carloslfu/slotstream ↗, Swift, MIT, 最近提交 1天前
只把 Qwen3.8-Flash-Next 的 3.8 GB 主幹常駐記憶體,其餘專家權重依插槽從 SSD 串流載入。插槽數量按機器的實際記憶體決定,於是 105 GB 的模型能在 48 GB 的 MacBook Pro 上跑到每秒 12 個詞元左右,啟動只要 2 秒。不依賴 Python,以單一 Swift 執行檔發布,並直接支援 Ollama 與 OpenAI 的聊天介面,現有工具不必改。需要 Apple Silicon、macOS 14 以上與約 110 GB 可用磁碟。MIT 授權。