AGI Hunt· srush_nlp·· 2 小时前AI 评分40
斯坦福 Tengyu Ma 团队提出 AC2 动作分块批评家方法:RL 训练省 2.5 倍解码算力、超 GRPO
AC2 动作分块批评家方法:RL 训练省 2.5 倍解码算力超 GRPO
AI 导读
斯坦福 Tengyu Ma 团队提出动作分块批评家方法 AC2,按动作块而非整条轨迹分配信用,仅在 critic 足够准时启用更新。用 AC2 在 FineProofs-RL 上训练 Qwen3-4B,在 IMO-ProofBench 上以 2.5 倍更少的解码 FLOPs 超过 GRPO 的 18.5% 峰值验证分,训练步数减少 25%。
来源:AGI Hunt · agihunt.info