热点事件持续更新
受控实验质疑 on-policy 蒸馏收益
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
2026 年 10 月 7 日,arXiv 论文《Rethinking Self-Distillation for Multi-Teacher Capability Merging》公开,通过受控自蒸馏实验重新检验多教师 on-policy 蒸馏(MOPD)。研究指出,MOPD 在主流叙事中的优势多为假象:在受控条件下,普通 SFT 仅用约十五分之一算力即可达到同等精度。该结论对当前以 on-policy 蒸馏为核心的多教师能力合并路线提出质疑。报道未给出更多实验细节与第三方复现情况。
AI 根据报道生成 · 2 小时前更新
最新进展10月7日 12:26
10 月 7 日论文称多教师 on-policy 蒸馏优势多为假象,SFT 用 1/15 算力达同等精度报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- AGI Hunt论文《Rethinking Self-Distillation for Multi-Teacher Capability Merging》受控实验显示 on-policy 蒸馏优势多为假象,SFT 用 1/15 算力达到同等精度
arXiv 论文《Rethinking Self-Distillation for Multi-Teacher Capability Merging》通过受控自蒸馏研究指出,多教师 on-policy 蒸馏(MOPD)的主流优势叙事并不成立。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。