热点事件持续更新
Mark Tenenholtz 质疑 AI 基准榜单可信度
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
2026年10月7日,AGI Hunt 报道了 Mark Tenenholtz 对 AI 基准榜单可信度的质疑。Tenenholtz 认为,大多数超过 2-3 个月仍未饱和的基准,其剩余提升空间多半来自任务本身写得糟糕、评分实现得很差,或两者兼有,而不是模型能力真存在差距。他把这一现象视为对当前 AI 榜单可信度的直接质疑。截至现有报道,这是该事件唯一一篇报道,尚无被质疑榜单方或其他相关方的回应,也没有进一步的后续进展。
AI 根据报道生成 · 2 小时前更新
最新进展10月7日 04:18
Tenenholtz 称旧基准未饱和的余量多源于任务与评分缺陷,而非模型能力差距。报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- AGI HuntMark Tenenholtz:未饱和的旧基准,余量多半来自烂任务和烂评分
Mark Tenenholtz 认为,大多数超过 2-3 个月仍未饱和的基准,剩余提升空间多半来自任务本身写得糟糕、评分实现得很差或两者兼有,而非模型能力真有差距。他把这视为对当前 AI 榜单可信度的直接质疑。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。