跳到正文
热点事件持续更新

研究:KL方向与学习率比on-policy更影响蒸馏性能

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026年10月3日,AGI Hunt 报道一项受控的强到弱蒸馏研究:在 Llama3、Qwen2.5 以及科学、医学、算术推理任务上,token 级 KL 方向比 rollout 策略更决定任务表现——forward KL 对 rollout 策略鲁棒,reverse KL 则显著敏感、更偏好学生自生成的 rollout;学习率主要控制遗忘与更新稀疏性。研究还显示,on-policy 数据对更难 Countdown 变体的泛化优势在后续 RLVR 之后并不稳定。目前披露的进展即为该报道中的实验结论,尚无更多后续。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月3日
  1. AGI Hunt
    蒸馏研究:KL 方向与学习率比 on-policy 更影响性能(Llama3 / Qwen2.5)

    受控强到弱蒸馏研究显示,token 级 KL 方向比 rollout 策略更决定任务表现:在 Llama3、Qwen2.5 及科学、医学、算术推理任务上,forward KL 对 rollout 策略鲁棒,reverse KL 显著敏感、更偏好学生自生成 rollout。学习率主要控制遗忘与更新稀疏性;on-policy 数据对更难 Countdown 变体的泛化优势在后续 RLVR 后不稳定。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。