跳到正文
热点事件持续更新

逐点截断致OPSD在线自蒸馏训练出现重复失败

1 篇报道1 个报道来源7 小时前更新

先了解这件事

AI 综述

针对在线策略自蒸馏(OPSD)训练中出现重复输出的问题,2026年10月1日 arXiv cs.CL 一篇论文给出机制解释:逐点截断的 forward KL 目标会让纠正方向反转,反而推高重复输出。论文在仅存在截断差异的匹配训练中对比发现,启用截断的模型产生更多持续到回答结尾的重复片段;分析表明该目标可能无法把学生模型推向教师模型,反而使 token 概率偏离教师,且在重复片段内学生更倾向继续重复;未截断训练则与教师保持接近。报道未给出具体实验规模与基线数值,早先报道所述的复现条件与评测数据在这些报道中未再出现。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月1日
  1. arXiv cs.CL
    当截断反转纠正:逐点 forward KL 在线策略自蒸馏的失效机制

    逐点截断的 forward KL 目标会让在线策略自蒸馏(OPSD)的纠正方向反转,反而推高重复输出。在仅有无截断差异的匹配训练中,启用截断的模型产生更多持续到回答结尾的重复片段;分析表明该目标可能无法把学生模型推向教师模型,反而使 token 概率偏离教师,重复片段内学生更倾向继续重复,未截断训练则与教师保持接近。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。