跳到正文
热点事件持续更新

Bug Hunt 自建基准实测:Sonnet 5.5 夺魁

3 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026年10月7日,AGI Hunt 报道 Paweł Huryn 自建 Bug Hunt Benchmark,用 2 个真实代码仓库中 105 个 2026 年初前沿模型均未发现的 bug,实测新模型发现并修复疑难 bug 的能力。结果显示,Sonnet 5.5 拿下满分档夺魁;Opus 5.5 性能追平 Fable 5.1,而成本仅为其三分之二;此前表现受质疑的 GPT-6.1 Sol 表现回升、能够翻盘修复,并比 GPT-5.6 便宜 10 倍;Muse + Contributor 仍是对多数任务足够强且最便宜的选择。他还据此核算了各家订阅计划的真实 API 价格。该基准得出的结论与其他榜单不同,引发社区对现有基准测试能否真实反映模型代码调试能力的讨论。

AI 根据报道生成 · 2 小时前更新

事件进展

2 个进展
  1. 10月7日 18:31 · 1 篇报道
    自建Bug Hunt基准:GPT-6.1 Sol可修复疑难Bug
    AGI Hunt:自建 Bug Hunt 基准得出不同结论:GPT-6.1 Sol 可修复疑难 Bug
  2. 10月7日 18:17 · 2 篇报道
    Bug Hunt:Opus 5.5 追平 Fable 5.1
    AGI Hunt:Paweł Huryn 自建 Bug Hunt 基准测试得出不同结论:GPT-6.1 Sol 表现回升

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. AGI Hunt
    自建 Bug Hunt 基准得出不同结论:GPT-6.1 Sol 可修复疑难 Bug

    Paweł Huryn 用自建的 Bug Hunt Benchmark 测试模型在真实代码仓库中发现并修复疑难 bug 的能力,得出与现有榜单不同的结论:此前表现受质疑的 GPT-6.1 Sol 能够翻盘修复,Muse 系模型仍是最便宜的主力选择。该结果引发社区对现有基准测试能否真实反映模型代码调试能力的讨论。

  2. AGI Hunt
    Paweł Huryn 自建 Bug Hunt 基准实测新模型,Sonnet 5.5 满分档夺魁

    Paweł Huryn 自建 Bug Hunt Benchmark,用 2 个真实仓库中 105 个 2026 年初前沿模型均未发现的 bug 实测新模型,Sonnet 5.5 拿下满分档夺魁。结果显示 Opus 5.5 性能追平 Fable 5.1 而成本仅为其三分之二,GPT-6.1 Sol 比 GPT-5.6 便宜 10 倍。他还据此核算了各家订阅计划的真实 API 价格。

  3. AGI Hunt
    Paweł Huryn 自建 Bug Hunt 基准测试得出不同结论:GPT-6.1 Sol 表现回升

    Paweł Huryn 的 Bug Hunt 基准测试显示,GPT-6.1 Sol 表现回升,Muse + Contributor 仍是对多数任务足够强且最便宜的选择。该基准测量模型在真实代码仓库中发现并修复疑难 bug 的能力,结果与其他榜单不同。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。