跳到正文
原文
AGI Hunt· sanmikoyejo·· 3 小时前AI 评分50

斯坦福团队展示基准攻击:随机提交路由器即可操纵模型排行

斯坦福团队展示基准攻击:随机提交路由器即可操纵模型排行

AI 导读

斯坦福 AI Lab 研究者 ysalh 与 Sanmi Koyejo 公布了一种针对基准排名的攻击方法,攻击者提交大量随机路由器、每个路由器在每个 prompt 上于两个现有模型间二选一,即可操纵模型排行。由于基准返回详细的按任务得分,这些弱信号会泄露复用样本上哪些路由选择有效,攻击者据此加权组合出最终路由器,把自选模型抬上榜单。

来源:AGI Hunt · agihunt.info