热点事件持续更新
逐点截断致OPSD在线自蒸馏训练出现重复失败
1 篇报道1 个报道来源7 小时前更新
先了解这件事
AI 综述
针对在线策略自蒸馏(OPSD)训练中出现重复输出的问题,2026年10月1日 arXiv cs.CL 一篇论文给出机制解释:逐点截断的 forward KL 目标会让纠正方向反转,反而推高重复输出。论文在仅存在截断差异的匹配训练中对比发现,启用截断的模型产生更多持续到回答结尾的重复片段;分析表明该目标可能无法把学生模型推向教师模型,反而使 token 概率偏离教师,且在重复片段内学生更倾向继续重复;未截断训练则与教师保持接近。报道未给出具体实验规模与基线数值,早先报道所述的复现条件与评测数据在这些报道中未再出现。
AI 根据报道生成 · 2 小时前更新
最新进展10月1日 12:00
新论文指出逐点截断的 forward KL 目标反转纠正方向,使学生概率偏离教师、加剧重复。报道时间线
沿着报道,了解事件的不同侧面。
10月1日
- arXiv cs.CL当截断反转纠正:逐点 forward KL 在线策略自蒸馏的失效机制
逐点截断的 forward KL 目标会让在线策略自蒸馏(OPSD)的纠正方向反转,反而推高重复输出。在仅有无截断差异的匹配训练中,启用截断的模型产生更多持续到回答结尾的重复片段;分析表明该目标可能无法把学生模型推向教师模型,反而使 token 概率偏离教师,重复片段内学生更倾向继续重复,未截断训练则与教师保持接近。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。