跳到正文
原文
AGI Hunt· lawrennd·· 3 小时前AI 评分35

NeurIPS 2026 论文 Follow the Winners:模仿优胜轨迹替代 PPO/GRPO

AI 导读

Zhenwen Dai 等人的论文 Follow the Winners 被 NeurIPS 2026 接收,提出一种 PPO 和 GRPO 之外的简单 RL 后训练替代方案:从 replay buffer 中采样轨迹,保留「优胜者」并模仿它们,无需 critic,也无需 group rollouts。合作者包括 Joery de Vries 和 Neil Lawrence。

来源:AGI Hunt · agihunt.info