- 语言
- 英语
- 发布于
- 16天前
- 复刻
- 23
carloslfu/slotstream ↗, Swift, MIT, 最近提交 1天前
只把 Qwen3.8-Flash-Next 的 3.8 GB 主干常驻内存,其余专家权重按槽位从 SSD 流式载入。槽位数量按机器的实际内存来定,于是 105 GB 的模型能在 48 GB 的 MacBook Pro 上跑到每秒 12 个词元左右,启动只要 2 秒。不依赖 Python,以单个 Swift 二进制分发,并直接支持 Ollama 和 OpenAI 的聊天接口,现有工具不用改。需要 Apple Silicon、macOS 14 以上和约 110 GB 空闲磁盘。MIT 许可证。