热点事件持续更新
Reddit 质疑模型发布基准分上涨与闭源评测
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
2026-10-01,AGI Hunt 报道称,Reddit 上有用户发帖质疑:模型发布时基准分几乎总在上涨。帖子认为背后可能是感知偏差,也可能是厂商能在不真正提升真实世界表现的情况下「迭代」基准结果。该用户指出,部分基准是专有闭源的,并举例称 Opus 5 的首发基准高于 Fable、GPT Sol 6.1 高于 Astra 或 5.6。同时该用户也承认,最初的 Fable 发布属于实打实的进步,并向掌握内幕的人征集这套循环究竟如何运作。目前该讨论仍停留在社区质疑层面,报道中没有出现厂商回应或第三方核实的结论。
AI 根据报道生成 · 2 小时前更新
最新进展10月1日 21:17
2026-10-01 AGI Hunt 报道 Reddit 用户质疑基准分上涨与闭源评测,并征集内幕。报道时间线
沿着报道,了解事件的不同侧面。
10月1日
- AGI Hunt为什么每次模型发布基准分都涨?Reddit 讨论闭源评测的猫腻
Reddit 用户发帖质疑:模型发布时基准分几乎总在上涨,背后可能是感知偏差,也可能是厂商能在不真正提升真实世界表现的情况下「迭代」基准结果。帖子指出部分基准专有闭源,举例 Opus 5 首发基准高于 Fable、GPT Sol 6.1 高于 Astra 或 5.6,同时承认最初的 Fable 发布属实打实进步,并向有内幕的人征集这套循环如何运作。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。