- 分類
- AI
- 語言
- 英語
- 發布於
- 15天前
FrontierHarness Eval 在固定模型與執行環境的前提下,用相同的軟體工程任務比較 9 種編碼框架的 12 種設定。全部 360 次試驗都從同一個檢查點重新開始,沒有哪次執行能靠預熱的快取佔便宜。通過率集中在 50.0% 到 66.7% 的窄區間內,而每項任務的成本中位數從 1.05 美元到 18.34 美元,相差 17.5 倍。公開的圖表把每種框架的成本、速度和通過率畫在一起。
喜歡這個產品嗎?
FrontierHarness Eval 在固定模型與執行環境的前提下,用相同的軟體工程任務比較 9 種編碼框架的 12 種設定。全部 360 次試驗都從同一個檢查點重新開始,沒有哪次執行能靠預熱的快取佔便宜。通過率集中在 50.0% 到 66.7% 的窄區間內,而每項任務的成本中位數從 1.05 美元到 18.34 美元,相差 17.5 倍。公開的圖表把每種框架的成本、速度和通過率畫在一起。