AGI Hunt· lateinteraction·· 3 小时前AI 评分38
Souradip Chakraborty 等提出 Pedagogical RL:用特权信息主动采样而非盲扫 rollout
研究者提出 Pedagogical RL:用特权信息主动采样而非盲扫 rollout
AI 导读
Souradip Chakraborty 等人提出 Pedagogical RL,主张用特权信息主动采样 rollout,而不是靠大量算力盲扫。他们批评典型 RL 算法与 on-policy 蒸馏都是「盲采样器」:只用标准答案、奖励模型给 rollout 打分,却不拿它去找 rollout。这一方向有望提升 RL 后训练的样本效率。
来源:AGI Hunt · agihunt.info