跳到正文
原文
AGI Hunt· PawelHuryn·· 3 小时前AI 评分41

自建 Bug Hunt 基准得出不同结论:GPT-6.1 Sol 可修复疑难 Bug

自建Bug Hunt基准得出不同结论:GPT-6.1 Sol可修复疑难Bug

AI 导读

Paweł Huryn 用自建的 Bug Hunt Benchmark 测试模型在真实代码仓库中发现并修复疑难 bug 的能力,得出与现有榜单不同的结论:此前表现受质疑的 GPT-6.1 Sol 能够翻盘修复,Muse 系模型仍是最便宜的主力选择。该结果引发社区对现有基准测试能否真实反映模型代码调试能力的讨论。

来源:AGI Hunt · agihunt.info