AGI Hunt· doomadah·· 3 小时前AI 评分34
为什么每次模型发布基准分都涨?Reddit 讨论闭源评测的猫腻
AI 导读
Reddit 用户发帖质疑:模型发布时基准分几乎总在上涨,背后可能是感知偏差,也可能是厂商能在不真正提升真实世界表现的情况下「迭代」基准结果。帖子指出部分基准专有闭源,举例 Opus 5 首发基准高于 Fable、GPT Sol 6.1 高于 Astra 或 5.6,同时承认最初的 Fable 发布属实打实进步,并向有内幕的人征集这套循环如何运作。
来源:AGI Hunt · agihunt.info