AGI Hunt· meta·2026-10-07 23:17· 5 小时前AI 评分42Meta 提出两阶段训练法:先做规则蒸馏再做 RL,缓解奖励黑客AI 导读Meta 提出 RP-OPD + RL 两阶段训练框架:先用 rubric 作教师模型的特权上下文做在线蒸馏,得到 token 级稠密监督,再以 rubric 为奖励做 RL。来源:AGI Hunt · agihunt.info#论文/研究#数据/训练#Meta查看事件全部后续