跳到正文
热点事件持续更新

斯坦福研究:仅2次提交即可刷出榜单虚假冠军

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

2026年10月1日报道,斯坦福团队(Allouah、Duchi、Koyejo)发布研究,指出主流评测榜单的分数披露机制可被利用。研究称,HELM、LiveBench、Open LLM、SWE-bench、Terminal-Bench-Science 等榜单会提供分维度分数,而这些分数在每一次提交中都会泄露测试集信息。攻击者少至 2 次提交即可造出一个榜单冠军,该模型在未见数据上实际表现落后。研究把问题指向榜单反馈机制本身,而非单次评测的偶然误差。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月1日
  1. AGI Hunt精选
    斯坦福研究:仅需 2 次提交即可刷出排行榜虚假冠军

    斯坦福团队(Allouah、Duchi、Koyejo)发布研究,指出 HELM、LiveBench、Open LLM、SWE-bench、Terminal-Bench-Science 等榜单提供的分维度分数会在每次提交中泄露测试集信息,攻击者少至 2 次提交就能造出一个在未见数据上实际落后的榜单冠军。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。