跳到正文
热点事件持续更新

Decider 模型作者回应刷榜质疑

2 篇报道1 个报道来源1 小时前更新

先了解这件事

AI 综述

Decider 模型登上榜单第一后被质疑存在 benchmaxxing(刷榜)行为。2026 年 10 月 7 日,模型作者公开回应:近期分数提升来自解除 causal mask、去掉因果限制、扩充训练数据等合理改进,而非针对榜单做手脚。作者称该模型在新榜单上仍保持第一,公开榜与私榜(private split)差距极小,并称有些模型在私有集上崩了而自己的没有,以此作为增强并非针对榜单过拟合、成绩真实且具备泛化能力的证据。早先报道称作者账号为 antoinechaffin,后续报道写作 antoine_chaffin;后续报道还提到原帖未指明具体模型与榜单细节。目前进展仍以作者单方面回应为主。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. AGI Hunt
    Decider 模型作者回应刷榜质疑:新榜单公私集差距小,称增强非 benchmaxxing

    Decider 模型作者 antoine_chaffin 回应 benchmaxxing 质疑,称其模型在新发布的全新排行榜上保持 top-1,且公开集与私有集之间的差距很小。他称有些模型在私有集上崩了而自己的没有,以此作为模型增强并非针对榜单过拟合的证据。原帖未指明具体模型与榜单细节。

  2. AGI Hunt
    Decider 模型作者回应刷榜质疑:公开私榜差距极小

    Decider 模型作者 antoinechaffin 回应 benchmaxxing 刷榜质疑,称近期分数提升源于解除 causal mask 去因果限制、扩充训练数据等合理改进。该模型在新榜单上保持第一,且公开榜与私榜(private split)差距极小,作者据此证明成绩真实且具备泛化能力,并非刷榜。

本事件热度走势

当前热度 10·可比范围峰值 10(10月7日 02:00)·近 24 小时可比范围变化 –

02.557.51010月7日02:0010月7日03:0010月7日03:0010月7日04:00

趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。