跳到正文
原文
AGI Hunt· OfirPress·· 3 小时前AI 评分51

SWE-sweep 基准发布:顶尖模型无监督找 bug 成功率不足 5%

AI 导读

Ofir Press 团队发布 SWE-sweep 基准,测试语言模型在不被告知哪里出错的前提下能否自主发现并修复 bug,顶尖模型成功率不足 5%。该基准覆盖 100 个真实仓库、22 种语言、约 4k 个真实缺陷,其中包含 numpy、PHP 解释器、Lean kernel。作者认为它给未来 agent 设定了北极星目标,是最具挑战性的基准之一。

来源:AGI Hunt · agihunt.info