arXiv cs.CL· Yang Li, Gongle Xue, Yuheng Yuan, Yijia Guo, Shizhe Zhang, Liwen Hu, Lei Ma·· 8 小时前AI 评分39
诊断推理语言模型的 On-Policy Self-Distillation(OPSD)
Diagnosing On-Policy Self-Distillation for Reasoning Language Models
AI 导读
对推理语言模型在线策略自蒸馏(OPSD)的诊断显示,它只在狭窄兼容区间内提升推理。在 0.6B–8B 参数模型上,教师信号取决于推理模式对齐与完整教师前缀,而非仅靠特权语义;其余情况会出现无效长度增长、稳定退化或行为崩溃。token 级分析显示教师信号不稳定、不预测下游表现,作者认为 OPSD 是敏感算法,而非普遍可靠的推理后训练方法。
来源:arXiv cs.CL · arxiv.org