跳到正文
原文
AGI Hunt· PawelHuryn·· 4 小时前AI 评分36

Paweł Huryn 自建 Bug Hunt 基准测试得出不同结论:GPT-6.1 Sol 表现回升

自建 Bug Hunt 基准测试出不同结论

AI 导读

Paweł Huryn 的 Bug Hunt 基准测试显示,GPT-6.1 Sol 表现回升,Muse + Contributor 仍是对多数任务足够强且最便宜的选择。该基准测量模型在真实代码仓库中发现并修复疑难 bug 的能力,结果与其他榜单不同。

来源:AGI Hunt · agihunt.info