AGI Hunt· a_karvonen·2026-10-05 21:47· 7 小时前AI 评分49Petri 对齐评测陷入悖论:被测模型能识破模拟世界的造假痕迹Petri 对齐评测陷入悖论:被测模型能识破模拟世界的造假痕迹AI 导读LessWrong 用户 JohnWittle 分析 Anthropic 开源的对齐评测工具 Petri,发现被测模型能识破模拟世界的造假痕迹,使评测陷入悖论。来源:AGI Hunt · agihunt.info#安全/对齐#Agent#开源生态#Anthropic查看事件全部后续