热点事件持续更新
SWE-sweep 基准发布:顶尖模型自主找 bug 成功率不足 5%
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
2026年10月1日,Ofir Press 团队发布 SWE-sweep 基准,用于测试语言模型在不被告知哪里出错的前提下,能否自主发现并修复 bug。该基准覆盖 100 个真实仓库、22 种语言、约 4k 个真实缺陷,其中包含 numpy、PHP 解释器、Lean kernel。结果显示,即便是顶尖模型,在该任务上的成功率也不足 5%。作者认为,该基准为未来 agent 设定了北极星目标,是最具挑战性的基准之一。
AI 根据报道生成 · 2 小时前更新
最新进展10月1日 22:47
Ofir Press 团队发布 SWE-sweep 基准,顶尖模型自主找 bug 成功率不足 5%。报道时间线
沿着报道,了解事件的不同侧面。
10月1日
- AGI HuntSWE-sweep 基准发布:顶尖模型无监督找 bug 成功率不足 5%
Ofir Press 团队发布 SWE-sweep 基准,测试语言模型在不被告知哪里出错的前提下能否自主发现并修复 bug,顶尖模型成功率不足 5%。该基准覆盖 100 个真实仓库、22 种语言、约 4k 个真实缺陷,其中包含 numpy、PHP 解释器、Lean kernel。作者认为它给未来 agent 设定了北极星目标,是最具挑战性的基准之一。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。