跳到正文
原文
AGI Hunt· terryyuezhuo·· 3 小时前AI 评分45

研究揭示蒸馏防御经后续强化学习训练即可轻易失效

AI 导读

一项新研究指出,现有蒸馏攻击防御方法的评估假设存在错配:它们只在蒸馏完成后立即评估,默认模型不会再经历后续训练,而仅靠后续强化学习训练即可轻易击穿这些防御。蒸馏攻击通过收集前沿模型推理轨迹并据此训练,可低成本复制闭源模型能力,现有评估给出的安全性并不可靠。

来源:AGI Hunt · agihunt.info