跳到正文
热点事件持续更新

SWE-sweep 基准发布:顶尖模型自主找 bug 成功率不足 5%

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026年10月1日,Ofir Press 团队发布 SWE-sweep 基准,用于测试语言模型在不被告知哪里出错的前提下,能否自主发现并修复 bug。该基准覆盖 100 个真实仓库、22 种语言、约 4k 个真实缺陷,其中包含 numpy、PHP 解释器、Lean kernel。结果显示,即便是顶尖模型,在该任务上的成功率也不足 5%。作者认为,该基准为未来 agent 设定了北极星目标,是最具挑战性的基准之一。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月1日
  1. AGI Hunt
    SWE-sweep 基准发布:顶尖模型无监督找 bug 成功率不足 5%

    Ofir Press 团队发布 SWE-sweep 基准,测试语言模型在不被告知哪里出错的前提下能否自主发现并修复 bug,顶尖模型成功率不足 5%。该基准覆盖 100 个真实仓库、22 种语言、约 4k 个真实缺陷,其中包含 numpy、PHP 解释器、Lean kernel。作者认为它给未来 agent 设定了北极星目标,是最具挑战性的基准之一。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。