AGI Hunt· scaling01·· 1 小时前AI 评分39
曝疑似大模型评测套用缓存答案:6.1 sol、6 astra 被指「dirty looping」
曝疑似大模型在评测中套用缓存答案,跑分网友抓到「dirty looping」
AI 导读
AI 评测账号 scaling01 发帖「spot the looper」,指 6.1 sol 和 6 astra 在 benchmark 中疑似直接套用缓存答案、循环输出而非真实推理,即所谓「dirty looping」。对比中 5.6 luna/sol 与 6 luna/sol 均无问题,只有这两个版本被标为可疑(SUS),由此引发对评测作弊的质疑。
来源:AGI Hunt · agihunt.info