跳到正文
原文
AGI Hunt· CambUni·· 3 小时前AI 评分44

蒸馏研究:KL 方向与学习率比 on-policy 更影响性能(Llama3 / Qwen2.5)

蒸馏研究:KL 方向与学习率比 on-policy 更影响性能

AI 导读

受控强到弱蒸馏研究显示,token 级 KL 方向比 rollout 策略更决定任务表现:在 Llama3、Qwen2.5 及科学、医学、算术推理任务上,forward KL 对 rollout 策略鲁棒,reverse KL 显著敏感、更偏好学生自生成 rollout。学习率主要控制遗忘与更新稀疏性;on-policy 数据对更难 Countdown 变体的泛化优势在后续 RLVR 后不稳定。

来源:AGI Hunt · agihunt.info