跳到主要内容
抢先遇见新产品的地方

Shoehorn

按你实际的内存把模型量化到刚好装下

AI3天前
分类
AI
语言
英语
发布于
3天前

预设的量化档位不了解你面前这台机器。挑一个装得下的,等于白扔几百兆的质量余量;挑高一档,往往到加载时才发现塞不进去。shoehorn 从你真正拥有的内存出发,先减去推理本身要占的部分,再针对剩下的额度求解逐张量的混合精度分配。按项目自己的说法,结果能贴到预算的舍入误差之内,有时精确到字节:519.2 MiB 的额度用掉 519.2 MiB,只剩 13 KB。安装走 Homebrew tap,支持 Apple Silicon 的 Mac,以及配 NVIDIA 或 AMD 显卡的 x86-64 Linux。站点上还有一个挑选页,会在 Hugging Face 下载量最高的模型里找出符合你预算的,按这份内存能换来的质量排序,整个过程都在浏览器里完成。

喜欢这个产品吗?