跳到主要內容

全部選單

FrontierHarness Eval

同一模型下比較 9 種編碼框架:通過率相近,成本相差 17.5 倍

AI15天前
分類
AI
語言
英語
發布於
15天前

FrontierHarness Eval 在固定模型與執行環境的前提下,用相同的軟體工程任務比較 9 種編碼框架的 12 種設定。全部 360 次試驗都從同一個檢查點重新開始,沒有哪次執行能靠預熱的快取佔便宜。通過率集中在 50.0% 到 66.7% 的窄區間內,而每項任務的成本中位數從 1.05 美元到 18.34 美元,相差 17.5 倍。公開的圖表把每種框架的成本、速度和通過率畫在一起。

喜歡這個產品嗎?