热点事件持续更新
研究:KL方向与学习率比on-policy更影响蒸馏性能
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
2026年10月3日,AGI Hunt 报道一项受控的强到弱蒸馏研究:在 Llama3、Qwen2.5 以及科学、医学、算术推理任务上,token 级 KL 方向比 rollout 策略更决定任务表现——forward KL 对 rollout 策略鲁棒,reverse KL 则显著敏感、更偏好学生自生成的 rollout;学习率主要控制遗忘与更新稀疏性。研究还显示,on-policy 数据对更难 Countdown 变体的泛化优势在后续 RLVR 之后并不稳定。目前披露的进展即为该报道中的实验结论,尚无更多后续。
AI 根据报道生成 · 1 小时前更新
最新进展10月3日 00:17
新研究:reverse KL 对 rollout 策略显著敏感,on-policy 泛化优势在 RLVR 后不稳定。报道时间线
沿着报道,了解事件的不同侧面。
10月3日
- AGI Hunt蒸馏研究:KL 方向与学习率比 on-policy 更影响性能(Llama3 / Qwen2.5)
受控强到弱蒸馏研究显示,token 级 KL 方向比 rollout 策略更决定任务表现:在 Llama3、Qwen2.5 及科学、医学、算术推理任务上,forward KL 对 rollout 策略鲁棒,reverse KL 显著敏感、更偏好学生自生成 rollout。学习率主要控制遗忘与更新稀疏性;on-policy 数据对更难 Countdown 变体的泛化优势在后续 RLVR 后不稳定。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。