跳到正文
热点事件持续更新

SWE-sweep 基准争议:Ofir Press 回应质疑

1 篇报道1 个报道来源1 小时前更新

先了解这件事

AI 综述

针对新提出的 bug 发现基准 SWE-sweep,Lucas 提出了质疑。SWE-bench 团队的 Ofir Press 随后作出回应,表示团队已在论文中讨论过相关的潜在陷阱,并称实验显示模型在一般场景下寻找 bug 的能力与其在该基准上的表现之间存在相关性。他进一步认为,针对这类行为进行训练是好事,正如当年 SWE-bench 曾鼓励模型提升该能力一样,只要不直接在测试集上训练即可,并希望社区照此让模型变得更强。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月3日
  1. AGI Hunt
    Ofir Press 回应 bug 基准 SWE-sweep 争议:训练该行为可取,但不许刷测试集

    Ofir Press(SWE-bench 团队)回应 Lucas 对新 bug 发现基准 SWE-sweep 的质疑,称团队已在论文中讨论相关潜在陷阱,实验显示模型在一般场景下找 bug 的能力与在该基准上的表现存在相关性。他认为针对这类行为训练是好事,正如 SWE-bench 当年鼓励模型提升该能力,只要不直接在测试集上训练即可,并希望社区照此让模型变得更强。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。