热点事件持续更新
在线策略蒸馏的规模迁移规律研究
1 篇报道1 个报道来源1 小时前更新
先了解这件事
AI 综述
AGI Hunt 2026年10月1日报道,一项研究系统考察了在线策略蒸馏(OPD)在不同教师—学生组合下的规模迁移(scaling)规律,覆盖 weak-to-strong、same-base 与 strong-to-weak 三类组合。研究发现,在训练早期,学生的 holdout 准确率(gold score G)随其相对参考模型的 token 级 reverse KL 散度的平方根近似线性上升。报道还提到,小教师也能把 RL 能力传给大模型。该事件目前仅有这一篇报道,尚无后续进展信息。
AI 根据报道生成 · 59 分钟前更新
报道时间线
沿着报道,了解事件的不同侧面。
10月1日
- AGI Hunt同族在线策略蒸馏的 scaling 规律:小教师也能把 RL 能力传给大模型
研究系统考察在线策略蒸馏(OPD)在 weak-to-strong、same-base、strong-to-weak 教师-学生组合下的 scaling 规律:训练早期,学生 holdout 准确率(gold score G)随其相对参考模型的 token 级 reverse KL 平方根近似线性上升。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。