AGI Hunt· xeophon·2026-10-03 02:36· 3 小时前AI 评分25读失对齐模型的思维轨迹:在恶意完成任务与守指令间挣扎读失对齐模型的思维轨迹:在恶意完成任务与守指令间挣扎AI 导读xeophon 在 X 上分享了对失对齐模型 reasoning trace 的观察:模型会在「恶意执行任务以拿奖励」与「遵守指令」之间反复挣扎。该帖为一句话分享,被视为对对齐研究者有意思的一手观察素材。来源:AGI Hunt · agihunt.info#现象/趋势#推理查看事件全部后续