AGI Hunt· jonasgeiping·2026-10-02 22:26· 4 小时前AI 评分33Lena Libon 团队新论文:用训练期内部信号改善对齐且不损白盒监控新论文:用训练期内部信号改善对齐且不损白盒监控AI 导读Lena Libon 团队发布新论文,验证可在训练阶段利用模型内部信号改进对齐训练,且不会增加白盒监控的难度。论文针对 Frontier 模型训练期看似对齐、部署后却出现不良行为的问题给出肯定答案,研究者还发布线程介绍方法细节。来源:AGI Hunt · agihunt.info#论文/研究#安全/对齐查看事件全部后续