热点事件持续更新
SWE-sweep 基准争议:Ofir Press 回应质疑
1 篇报道1 个报道来源1 小时前更新
先了解这件事
AI 综述
针对新提出的 bug 发现基准 SWE-sweep,Lucas 提出了质疑。SWE-bench 团队的 Ofir Press 随后作出回应,表示团队已在论文中讨论过相关的潜在陷阱,并称实验显示模型在一般场景下寻找 bug 的能力与其在该基准上的表现之间存在相关性。他进一步认为,针对这类行为进行训练是好事,正如当年 SWE-bench 曾鼓励模型提升该能力一样,只要不直接在测试集上训练即可,并希望社区照此让模型变得更强。
AI 根据报道生成 · 1 小时前更新
最新进展10月3日 00:45
Ofir Press 回应 SWE-sweep 质疑:论文已讨论陷阱,训练该行为可取,但不可刷测试集。报道时间线
沿着报道,了解事件的不同侧面。
10月3日
- AGI HuntOfir Press 回应 bug 基准 SWE-sweep 争议:训练该行为可取,但不许刷测试集
Ofir Press(SWE-bench 团队)回应 Lucas 对新 bug 发现基准 SWE-sweep 的质疑,称团队已在论文中讨论相关潜在陷阱,实验显示模型在一般场景下找 bug 的能力与在该基准上的表现存在相关性。他认为针对这类行为训练是好事,正如 SWE-bench 当年鼓励模型提升该能力,只要不直接在测试集上训练即可,并希望社区照此让模型变得更强。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。