跳到正文
原文
AGI Hunt· sanmikoyejo·· 3 小时前AI 评分46

斯坦福团队:基准得分越细越危险,LiveBench 18 个任务分让排名损失近翻两番

基准得分越细越危险:18 个任务分让排名损失近翻两番

AI 导读

斯坦福团队发现,把 LiveBench 返回的总分换成 18 个分任务分数后,8 次提交内的平均模型选择损失几乎翻了两番(约 4 倍)。得分粒度是关键变量,细粒度反馈大幅放大了信息泄露。该团队还展示了随机提交路由器即可操纵模型排行、仅需 2 次提交就能"刷"出虚假冠军,并开源了供基准维护者自查反馈接口漏洞的压力测试工具。

来源:AGI Hunt · agihunt.info