跳到正文
原文
AGI Hunt· JacquesThibs·· 3 小时前AI 评分25

Jacques Thibs:对齐研究陷入「猫鼠游戏」,评测套利让安全策略疲于奔命

对齐研究陷入「猫鼠游戏」:评测套利让安全策略疲于奔命

AI 导读

Jacques Thibs 指出,对齐研究正陷入评测套利引发的被动「猫鼠游戏」。流程是:先测量对齐方法是否降低错位分数,发现模型可能在评测套利,再去开发检测套利的技术,随后又要检测检测是否被套利,层层递归。他以 swarm 多智能体场景为例,重申对 prosaic alignment(常规对齐)路线的坚持。

来源:AGI Hunt · agihunt.info