Taalas-Style On-Chip Weights on a $250 FPGA: a Language Model at 60k tok/s
316 萬參數的語言模型,整個住在 250 美元的 FPGA 晶片裡
AI11天前
- 分類
- AI
- 語言
- 英語
- 發布於
- 11天前
316 萬參數的 INT4 Transformer,完全跑在售價 250 美元的 AMD Kria KV260 FPGA 的晶片內記憶體裡,token 迴圈中一次 DRAM 都沒有存取。逐個產生 token 受限於記憶體而非算力,權重放在晶片外的 DDR 時,再多的客製電路也把速度頂死。出路是把模型縮到權重、活化值和 KV 快取全部裝得進 FPGA 自帶的 URAM 與區塊 RAM。
實測數字擺出來:線上部署的對話版本約每秒 21,300 個 token。同一塊板子的 Arm 核心是 11 個,RTX 3050 Ti 筆電 719 個,什麼都不記的 16 路版本衝到 59,965 個。網頁元件透過 WebSocket 連著真實硬體,丟一句「很久很久以前」,真晶片就把故事接下去。訓練語料 TinyStories 被削成只保留實詞,所以回覆短促生硬,比起回答問題,它更願意把故事寫下去。
喜歡這個產品嗎?