热点事件持续更新
跨分词器OPD研究:监督可靠性优先于对齐覆盖
2 篇报道2 个报道来源1 小时前更新
先了解这件事
AI 综述
2026年10月7日,arXiv cs.CL 收录论文《重新思考跨 Tokenizer 在线策略蒸馏:从对齐覆盖率到监督可靠性》。论文在数学推理与代码生成任务上用三组异构师生模型开展实验,指出跨 Tokenizer OPD 中扩大对齐覆盖未必带来收益:严格 1:1 对齐已覆盖大部分学生生成的 token,据此将关注点从对齐覆盖率转向监督可靠性,主张监督可靠性优先于对齐覆盖。同日 AGI Hunt 报道称该论文发布在 Hugging Face,并补充实验细节:在 3 组异构师生对上,仅将对齐位置的 reverse KL 限制在学生选定的 top-16 共享词包子集,即可达到与全共享词表 OPD 相当的精度;而补上 span log-prob 的 MSE 监督虽实现完全监督覆盖,精度反而下降。
AI 根据报道生成 · 1 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- AGI HuntHugging Face 新论文:跨 tokenizer 在线蒸馏中监督可靠性比覆盖度更关键
Hugging Face 上一项新论文研究异构 tokenizer 间的在线蒸馏(OPD),认为应优先保证监督可靠性而非最大化对齐覆盖。在 3 组异构师生对(数学推理与代码生成)上,将对齐位置的 reverse KL 限制在学生选定的 top-16 共享词包子集,即可达到与全共享词表 OPD 相当的精度;而补上 span log-prob 的 MSE 监督虽实现完全监督覆盖,精度反而下降。
- arXiv cs.CL重新思考跨 Tokenizer 在线策略蒸馏:从对齐覆盖率到监督可靠性
跨 Tokenizer 在线策略蒸馏(OPD)扩大对齐覆盖未必带来收益:三组异构师生模型在数学推理与代码生成上,严格 1:1 对齐已覆盖大部分学生生成 token。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。