跳到正文
热点事件持续更新

研究:蒸馏防御经后续RL训练即可失效

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026年10月1日,AGI Hunt 报道一项新研究指出,现有蒸馏攻击防御方法的评估假设存在错配:这些评估只在蒸馏完成后立即进行,默认模型此后不会再经历后续训练。但研究显示,仅靠后续的强化学习训练即可轻易击穿这些防御。蒸馏攻击通过收集前沿模型的推理轨迹并据此训练,能够以低成本复制闭源模型能力,因此现有评估给出的安全性并不可靠。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月1日
  1. AGI Hunt
    研究揭示蒸馏防御经后续强化学习训练即可轻易失效

    一项新研究指出,现有蒸馏攻击防御方法的评估假设存在错配:它们只在蒸馏完成后立即评估,默认模型不会再经历后续训练,而仅靠后续强化学习训练即可轻易击穿这些防御。蒸馏攻击通过收集前沿模型推理轨迹并据此训练,可低成本复制闭源模型能力,现有评估给出的安全性并不可靠。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。