AGI Hunt· zju·· 2 小时前AI 评分46
同族在线策略蒸馏的 scaling 规律:小教师也能把 RL 能力传给大模型
同族在线策略蒸馏的 scaling 规律:小教师也能把 RL 能力传给大模型
AI 导读
研究系统考察在线策略蒸馏(OPD)在 weak-to-strong、same-base、strong-to-weak 教师-学生组合下的 scaling 规律:训练早期,学生 holdout 准确率(gold score G)随其相对参考模型的 token 级 reverse KL 平方根近似线性上升。
来源:AGI Hunt · agihunt.info