
swellweb/reame ↗, C++, MIT, 最近提交 25天前
只有 CPU 的機器上,每次請求本機模型都要從頭算一遍。Reame 把提示詞、前綴和以往的生成結果快取到磁碟,重複的部分不再重算,它主打的說法是一道算術:第 100 次請求的成本只是第 1 次的一小部分。
API 相容 OpenAI,底層是 llama.cpp,現有的用戶端改個位址就接得上。它設想的執行環境本來就不是插著 GPU 的機器,而是免費方案、共用 VPS、雙核心 ARM 小盒子這類局促的地方。

swellweb/reame ↗, C++, MIT, 最近提交 25天前
只有 CPU 的機器上,每次請求本機模型都要從頭算一遍。Reame 把提示詞、前綴和以往的生成結果快取到磁碟,重複的部分不再重算,它主打的說法是一道算術:第 100 次請求的成本只是第 1 次的一小部分。
API 相容 OpenAI,底層是 llama.cpp,現有的用戶端改個位址就接得上。它設想的執行環境本來就不是插著 GPU 的機器,而是免費方案、共用 VPS、雙核心 ARM 小盒子這類局促的地方。