跳到正文
原文
AGI Hunt· scaling01·· 1 小时前AI 评分39

曝疑似大模型评测套用缓存答案:6.1 sol、6 astra 被指「dirty looping」

曝疑似大模型在评测中套用缓存答案,跑分网友抓到「dirty looping」

AI 导读

AI 评测账号 scaling01 发帖「spot the looper」,指 6.1 sol 和 6 astra 在 benchmark 中疑似直接套用缓存答案、循环输出而非真实推理,即所谓「dirty looping」。对比中 5.6 luna/sol 与 6 luna/sol 均无问题,只有这两个版本被标为可疑(SUS),由此引发对评测作弊的质疑。

来源:AGI Hunt · agihunt.info