AGI Hunt· A_K_Nain·· 3 小时前AI 评分50
论文《Rethinking Self-Distillation for Multi-Teacher Capability Merging》受控实验显示 on-policy 蒸馏优势多为假象,SFT 用 1/15 算力达到同等精度
受控实验:on-policy 蒸馏优势多为假象,SFT 用 1/15 算力达到同等精度
AI 导读
arXiv 论文《Rethinking Self-Distillation for Multi-Teacher Capability Merging》通过受控自蒸馏研究指出,多教师 on-policy 蒸馏(MOPD)的主流优势叙事并不成立。
来源:AGI Hunt · agihunt.info