AGI Hunt· teortaxesTex·· 4 小时前AI 评分41
EasyPPO 固定 Critic 解决 PPO 训练崩溃
AI 导读
Xuanyi Zhou 发布 EasyPPO,通过固定 critic 让 PPO 在 LLM 后训练中稳定运行,实现零训练崩溃。该方法不引入新的 actor loss、也不更换策略算法,并针对 actor 与 critic 交互中的两种失效模式给出修复。在编码任务上,EasyPPO 相对标准 PPO 性能提升 14.89%。
来源:AGI Hunt · agihunt.info