跳到正文
热点事件持续更新

Reddit 质疑模型发布基准分上涨与闭源评测

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026-10-01,AGI Hunt 报道称,Reddit 上有用户发帖质疑:模型发布时基准分几乎总在上涨。帖子认为背后可能是感知偏差,也可能是厂商能在不真正提升真实世界表现的情况下「迭代」基准结果。该用户指出,部分基准是专有闭源的,并举例称 Opus 5 的首发基准高于 Fable、GPT Sol 6.1 高于 Astra 或 5.6。同时该用户也承认,最初的 Fable 发布属于实打实的进步,并向掌握内幕的人征集这套循环究竟如何运作。目前该讨论仍停留在社区质疑层面,报道中没有出现厂商回应或第三方核实的结论。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月1日
  1. AGI Hunt
    为什么每次模型发布基准分都涨?Reddit 讨论闭源评测的猫腻

    Reddit 用户发帖质疑:模型发布时基准分几乎总在上涨,背后可能是感知偏差,也可能是厂商能在不真正提升真实世界表现的情况下「迭代」基准结果。帖子指出部分基准专有闭源,举例 Opus 5 首发基准高于 Fable、GPT Sol 6.1 高于 Astra 或 5.6,同时承认最初的 Fable 发布属实打实进步,并向有内幕的人征集这套循环如何运作。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。