跳到正文
原文
AGI Hunt· meta·· 5 小时前AI 评分42

Meta 提出两阶段训练法:先做规则蒸馏再做 RL,缓解奖励黑客

AI 导读

Meta 提出 RP-OPD + RL 两阶段训练框架:先用 rubric 作教师模型的特权上下文做在线蒸馏,得到 token 级稠密监督,再以 rubric 为奖励做 RL。

来源:AGI Hunt · agihunt.info