跳到主要內容
搶先遇見新產品的地方
T

Taalas-Style On-Chip Weights on a $250 FPGA: a Language Model at 60k tok/s

316 萬參數的語言模型,整個住在 250 美元的 FPGA 晶片裡

AI11天前
分類
AI
語言
英語
發布於
11天前

316 萬參數的 INT4 Transformer,完全跑在售價 250 美元的 AMD Kria KV260 FPGA 的晶片內記憶體裡,token 迴圈中一次 DRAM 都沒有存取。逐個產生 token 受限於記憶體而非算力,權重放在晶片外的 DDR 時,再多的客製電路也把速度頂死。出路是把模型縮到權重、活化值和 KV 快取全部裝得進 FPGA 自帶的 URAM 與區塊 RAM。

實測數字擺出來:線上部署的對話版本約每秒 21,300 個 token。同一塊板子的 Arm 核心是 11 個,RTX 3050 Ti 筆電 719 個,什麼都不記的 16 路版本衝到 59,965 個。網頁元件透過 WebSocket 連著真實硬體,丟一句「很久很久以前」,真晶片就把故事接下去。訓練語料 TinyStories 被削成只保留實詞,所以回覆短促生硬,比起回答問題,它更願意把故事寫下去。

喜歡這個產品嗎?