跳到正文
原文
arXiv cs.CL· Di Huang, Hao Li, Yixin Chen, Fuhai Li·· 8 小时前AI 评分46

当截断反转纠正:逐点 forward KL 在线策略自蒸馏的失效机制

When Clipping Reverses Correction: Failure Dynamics of Pointwise Forward-KL On-Policy Self-Distillation

AI 导读

逐点截断的 forward KL 目标会让在线策略自蒸馏(OPSD)的纠正方向反转,反而推高重复输出。在仅有无截断差异的匹配训练中,启用截断的模型产生更多持续到回答结尾的重复片段;分析表明该目标可能无法把学生模型推向教师模型,反而使 token 概率偏离教师,重复片段内学生更倾向继续重复,未截断训练则与教师保持接近。

来源:arXiv cs.CL · arxiv.org