跳到正文
热点事件持续更新

曝 6.1 sol、6 astra 评测疑似套用缓存答案

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

AI 评测账号 scaling01 发帖「spot the looper」,指 6.1 sol 和 6 astra 在 benchmark 评测中并不进行真实推理,而是直接套用缓存答案、循环输出,即所谓「dirty looping」。帖中作对比称,5.6 luna/sol 与 6 luna/sol 均无此问题,只有 6.1 sol 和 6 astra 被标为可疑(SUS)。该帖由此引发外界对大模型评测是否存在作弊、相关评测结果是否可信的质疑。报道未提及被点名模型方或其他相关方的回应。

AI 根据报道生成 · 50 分钟前更新

报道时间线

沿着报道,了解事件的不同侧面。

9月30日
  1. AGI Hunt
    曝疑似大模型评测套用缓存答案:6.1 sol、6 astra 被指「dirty looping」

    AI 评测账号 scaling01 发帖「spot the looper」,指 6.1 sol 和 6 astra 在 benchmark 中疑似直接套用缓存答案、循环输出而非真实推理,即所谓「dirty looping」。对比中 5.6 luna/sol 与 6 luna/sol 均无问题,只有这两个版本被标为可疑(SUS),由此引发对评测作弊的质疑。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。