AGI Hunt· jonasgeiping·· 4 小时前AI 评分33
NeurIPS 2026 论文:模型知晓评测设计后反而得分更安全
AI 导读
Haritz Puerto 等人的论文《Models That Know How Evaluations Are Designed Score Safer》被 NeurIPS 2026 接收,核心发现是模型在了解安全评测如何设计时,评测得分反而更安全。该结果对安全评测方法学与评测有效性有直接启示。
来源:AGI Hunt · agihunt.info