跳到正文
热点事件持续更新

Mark Tenenholtz 质疑 AI 基准榜单可信度

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026年10月7日,AGI Hunt 报道了 Mark Tenenholtz 对 AI 基准榜单可信度的质疑。Tenenholtz 认为,大多数超过 2-3 个月仍未饱和的基准,其剩余提升空间多半来自任务本身写得糟糕、评分实现得很差,或两者兼有,而不是模型能力真存在差距。他把这一现象视为对当前 AI 榜单可信度的直接质疑。截至现有报道,这是该事件唯一一篇报道,尚无被质疑榜单方或其他相关方的回应,也没有进一步的后续进展。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. AGI Hunt
    Mark Tenenholtz:未饱和的旧基准,余量多半来自烂任务和烂评分

    Mark Tenenholtz 认为,大多数超过 2-3 个月仍未饱和的基准,剩余提升空间多半来自任务本身写得糟糕、评分实现得很差或两者兼有,而非模型能力真有差距。他把这视为对当前 AI 榜单可信度的直接质疑。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。