热点事件持续更新
Decider 模型作者回应刷榜质疑
2 篇报道1 个报道来源1 小时前更新
先了解这件事
AI 综述
Decider 模型登上榜单第一后被质疑存在 benchmaxxing(刷榜)行为。2026 年 10 月 7 日,模型作者公开回应:近期分数提升来自解除 causal mask、去掉因果限制、扩充训练数据等合理改进,而非针对榜单做手脚。作者称该模型在新榜单上仍保持第一,公开榜与私榜(private split)差距极小,并称有些模型在私有集上崩了而自己的没有,以此作为增强并非针对榜单过拟合、成绩真实且具备泛化能力的证据。早先报道称作者账号为 antoinechaffin,后续报道写作 antoine_chaffin;后续报道还提到原帖未指明具体模型与榜单细节。目前进展仍以作者单方面回应为主。
AI 根据报道生成 · 1 小时前更新
最新进展10月7日 03:15
作者再称模型在新榜单保持 top-1、公开集与私有集差距小,并以其他模型私有集崩了作证据。报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- AGI HuntDecider 模型作者回应刷榜质疑:新榜单公私集差距小,称增强非 benchmaxxing
Decider 模型作者 antoine_chaffin 回应 benchmaxxing 质疑,称其模型在新发布的全新排行榜上保持 top-1,且公开集与私有集之间的差距很小。他称有些模型在私有集上崩了而自己的没有,以此作为模型增强并非针对榜单过拟合的证据。原帖未指明具体模型与榜单细节。
- AGI HuntDecider 模型作者回应刷榜质疑:公开私榜差距极小
Decider 模型作者 antoinechaffin 回应 benchmaxxing 刷榜质疑,称近期分数提升源于解除 causal mask 去因果限制、扩充训练数据等合理改进。该模型在新榜单上保持第一,且公开榜与私榜(private split)差距极小,作者据此证明成绩真实且具备泛化能力,并非刷榜。
本事件热度走势
当前热度 10·可比范围峰值 10(10月7日 02:00)·近 24 小时可比范围变化 –
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。