跳到正文
热点事件持续更新

受控实验质疑 on-policy 蒸馏收益

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026 年 10 月 7 日,arXiv 论文《Rethinking Self-Distillation for Multi-Teacher Capability Merging》公开,通过受控自蒸馏实验重新检验多教师 on-policy 蒸馏(MOPD)。研究指出,MOPD 在主流叙事中的优势多为假象:在受控条件下,普通 SFT 仅用约十五分之一算力即可达到同等精度。该结论对当前以 on-policy 蒸馏为核心的多教师能力合并路线提出质疑。报道未给出更多实验细节与第三方复现情况。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. AGI Hunt
    论文《Rethinking Self-Distillation for Multi-Teacher Capability Merging》受控实验显示 on-policy 蒸馏优势多为假象,SFT 用 1/15 算力达到同等精度

    arXiv 论文《Rethinking Self-Distillation for Multi-Teacher Capability Merging》通过受控自蒸馏研究指出,多教师 on-policy 蒸馏(MOPD)的主流优势叙事并不成立。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。