跳到正文
原文
arXiv cs.CL· Bingxi Hou, Guochao Jiang, Guofeng Quan, Weiqing Li, Wenfeng Feng, Guohua Liu, Yuewei Zhang·· 4 小时前AI 评分37

重新思考跨 Tokenizer 在线策略蒸馏:从对齐覆盖率到监督可靠性

Rethinking Cross-Tokenizer On-Policy Distillation: From Alignment Coverage to Supervision Reliability

AI 导读

跨 Tokenizer 在线策略蒸馏(OPD)扩大对齐覆盖未必带来收益:三组异构师生模型在数学推理与代码生成上,严格 1:1 对齐已覆盖大部分学生生成 token。

来源:arXiv cs.CL · arxiv.org