Bug Hunt 自建基准实测:Sonnet 5.5 夺魁
先了解这件事
2026年10月7日,AGI Hunt 报道 Paweł Huryn 自建 Bug Hunt Benchmark,用 2 个真实代码仓库中 105 个 2026 年初前沿模型均未发现的 bug,实测新模型发现并修复疑难 bug 的能力。结果显示,Sonnet 5.5 拿下满分档夺魁;Opus 5.5 性能追平 Fable 5.1,而成本仅为其三分之二;此前表现受质疑的 GPT-6.1 Sol 表现回升、能够翻盘修复,并比 GPT-5.6 便宜 10 倍;Muse + Contributor 仍是对多数任务足够强且最便宜的选择。他还据此核算了各家订阅计划的真实 API 价格。该基准得出的结论与其他榜单不同,引发社区对现有基准测试能否真实反映模型代码调试能力的讨论。
AI 根据报道生成 · 2 小时前更新
事件进展
- 10月7日 18:31 · 1 篇报道自建Bug Hunt基准:GPT-6.1 Sol可修复疑难BugAGI Hunt:自建 Bug Hunt 基准得出不同结论:GPT-6.1 Sol 可修复疑难 Bug
- 10月7日 18:17 · 2 篇报道Bug Hunt:Opus 5.5 追平 Fable 5.1AGI Hunt:Paweł Huryn 自建 Bug Hunt 基准测试得出不同结论:GPT-6.1 Sol 表现回升
报道时间线
沿着报道,了解事件的不同侧面。
- AGI Hunt自建 Bug Hunt 基准得出不同结论:GPT-6.1 Sol 可修复疑难 Bug
Paweł Huryn 用自建的 Bug Hunt Benchmark 测试模型在真实代码仓库中发现并修复疑难 bug 的能力,得出与现有榜单不同的结论:此前表现受质疑的 GPT-6.1 Sol 能够翻盘修复,Muse 系模型仍是最便宜的主力选择。该结果引发社区对现有基准测试能否真实反映模型代码调试能力的讨论。
- AGI HuntPaweł Huryn 自建 Bug Hunt 基准实测新模型,Sonnet 5.5 满分档夺魁
Paweł Huryn 自建 Bug Hunt Benchmark,用 2 个真实仓库中 105 个 2026 年初前沿模型均未发现的 bug 实测新模型,Sonnet 5.5 拿下满分档夺魁。结果显示 Opus 5.5 性能追平 Fable 5.1 而成本仅为其三分之二,GPT-6.1 Sol 比 GPT-5.6 便宜 10 倍。他还据此核算了各家订阅计划的真实 API 价格。
- AGI HuntPaweł Huryn 自建 Bug Hunt 基准测试得出不同结论:GPT-6.1 Sol 表现回升
Paweł Huryn 的 Bug Hunt 基准测试显示,GPT-6.1 Sol 表现回升,Muse + Contributor 仍是对多数任务足够强且最便宜的选择。该基准测量模型在真实代码仓库中发现并修复疑难 bug 的能力,结果与其他榜单不同。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。