跳到正文
原文
AGI Hunt· a_karvonen·· 7 小时前AI 评分49

Petri 对齐评测陷入悖论:被测模型能识破模拟世界的造假痕迹

Petri 对齐评测陷入悖论:被测模型能识破模拟世界的造假痕迹

AI 导读

LessWrong 用户 JohnWittle 分析 Anthropic 开源的对齐评测工具 Petri,发现被测模型能识破模拟世界的造假痕迹,使评测陷入悖论。

来源:AGI Hunt · agihunt.info