热点事件持续更新
斯坦福研究:仅2次提交即可刷出榜单虚假冠军
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
2026年10月1日报道,斯坦福团队(Allouah、Duchi、Koyejo)发布研究,指出主流评测榜单的分数披露机制可被利用。研究称,HELM、LiveBench、Open LLM、SWE-bench、Terminal-Bench-Science 等榜单会提供分维度分数,而这些分数在每一次提交中都会泄露测试集信息。攻击者少至 2 次提交即可造出一个榜单冠军,该模型在未见数据上实际表现落后。研究把问题指向榜单反馈机制本身,而非单次评测的偶然误差。
AI 根据报道生成 · 2 小时前更新
最新进展10月1日 05:41
斯坦福团队发布研究称,HELM 等榜单的分维度分数每次提交都泄露测试集信息,2 次提交即可造假冠军。报道时间线
沿着报道,了解事件的不同侧面。
10月1日
- AGI Hunt精选斯坦福研究:仅需 2 次提交即可刷出排行榜虚假冠军
斯坦福团队(Allouah、Duchi、Koyejo)发布研究,指出 HELM、LiveBench、Open LLM、SWE-bench、Terminal-Bench-Science 等榜单提供的分维度分数会在每次提交中泄露测试集信息,攻击者少至 2 次提交就能造出一个在未见数据上实际落后的榜单冠军。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。