arXiv cs.AI· Hoang Phan, Minh Pham, Chau Pham, Chinmay Hegde, Trung Le, Qi Lei·· 4 小时前AI 评分45
RGPO:用自适应推理依据脚手架学习推理
Rationale-Guided Policy Optimization: Learning to Reason with Adaptive Rationale Scaffolding
AI 导读
RGPO 将 ground-truth rationale 作为临时脚手架,先帮助模型生成改进响应,再仅回传更高奖励的模型生成解,以缓解 RL 奖励稀疏。在纯语言和视觉语言推理任务上,RGPO 持续优于 RLVR 基线,消融显示自适应 rationale 引导是主要增益来源。它不要求 off-policy 数据匹配 RL 任务格式,可稳定训练并提升文本与多模态模型推理性能。
来源:arXiv cs.AI · arxiv.org