arXiv cs.CL· Bingxi Hou, Guochao Jiang, Guofeng Quan, Weiqing Li, Wenfeng Feng, Guohua Liu, Yuewei Zhang·· 4 小时前AI 评分37
重新思考跨 Tokenizer 在线策略蒸馏:从对齐覆盖率到监督可靠性
Rethinking Cross-Tokenizer On-Policy Distillation: From Alignment Coverage to Supervision Reliability
AI 导读
跨 Tokenizer 在线策略蒸馏(OPD)扩大对齐覆盖未必带来收益:三组异构师生模型在数学推理与代码生成上,严格 1:1 对齐已覆盖大部分学生生成 token。
来源:arXiv cs.CL · arxiv.org