AGI Hunt· scaling01·· 1 天前AI 评分43
GSO 榜单作者:榜单已接近饱和,任何 benchmark 约 5% 任务本身有问题
GSO 榜主:榜单已接近饱和,任何基准约 5% 任务本身有问题
AI 导读
GSO 榜单作者 slimshetty 更新称,该榜单已接近饱和,很难再区分前沿模型,并判断任何 benchmark(包括他自己做的)预计至少约 5% 的任务本身存在质量问题。这被视为对评测体系局限性的第一手坦承,对解读各类跑分榜有参考价值。
来源:AGI Hunt · agihunt.info