跳到正文
原文
arXiv cs.CL· Dongwon Jung, Hemanth Neelgund Ramesh, Yifan Wang, Xiaomin Li, Yuexing Hao, Yu Hu, Muhao Chen, Varun Chandrasekaran, Andrzej Banburski-Fahey, Jaron Lanier·· 4 小时前AI 评分38

ProVer:为智能体强化学习的信用分配定向关键决策

Targeting Pivotal Decisions for Credit Assignment in Agentic Reinforcement Learning

AI 导读

ProVer 通过智能体评判器对比成功与失败轨迹定位关键决策段,再用该段前后续写的成功率差值验证其优势,实现细粒度信用分配。在 ALFWorld、WebShop、SearchQA 上,ProVer 在两种模型规模均取得最佳平均表现,相对 GRPO 分别提升 9.91%(Qwen3.5-2B)和 7.12%(Qwen3.5-4B)。

来源:arXiv cs.CL · arxiv.org