AGI Hunt· terryyuezhuo·2026-10-01 03:13· 3 小时前AI 评分45研究揭示蒸馏防御经后续强化学习训练即可轻易失效AI 导读一项新研究指出,现有蒸馏攻击防御方法的评估假设存在错配:它们只在蒸馏完成后立即评估,默认模型不会再经历后续训练,而仅靠后续强化学习训练即可轻易击穿这些防御。蒸馏攻击通过收集前沿模型推理轨迹并据此训练,可低成本复制闭源模型能力,现有评估给出的安全性并不可靠。来源:AGI Hunt · agihunt.info#论文/研究#数据/训练查看事件全部后续