跳到主要内容

全部菜单

FrontierHarness Eval

同一模型下比较 9 种编码框架:通过率相近,成本相差 17.5 倍

AI15天前
分类
AI
语言
英语
发布于
15天前

FrontierHarness Eval 在固定模型与运行环境的前提下,用相同的软件工程任务比较 9 种编码框架的 12 种配置。全部 360 次试验都从同一个检查点重新开始,没有哪次运行能靠预热的缓存占便宜。通过率集中在 50.0% 到 66.7% 的窄区间内,而每个任务的成本中位数从 1.05 美元到 18.34 美元,相差 17.5 倍。公开的图表把每种框架的成本、速度和通过率画在一起。

喜欢这个产品吗?