跳到正文
原文
AGI Hunt· srush_nlp·· 2 小时前AI 评分40

斯坦福 Tengyu Ma 团队提出 AC2 动作分块批评家方法:RL 训练省 2.5 倍解码算力、超 GRPO

AC2 动作分块批评家方法:RL 训练省 2.5 倍解码算力超 GRPO

AI 导读

斯坦福 Tengyu Ma 团队提出动作分块批评家方法 AC2,按动作块而非整条轨迹分配信用,仅在 critic 足够准时启用更新。用 AC2 在 FineProofs-RL 上训练 Qwen3-4B,在 IMO-ProofBench 上以 2.5 倍更少的解码 FLOPs 超过 GRPO 的 18.5% 峰值验证分,训练步数减少 25%。

来源:AGI Hunt · agihunt.info