跳到正文
热点事件持续更新

RGPO:用理由引导策略优化提升推理

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

围绕“用理由引导策略优化提升推理”这一方向,RGPO 被提出:它把 ground-truth rationale 当作临时脚手架,先借助理由引导模型生成改进后的响应,再只把奖励更高的模型自生成解回传用于训练,以缓解强化学习中的奖励稀疏问题。2026 年 10 月 7 日 arXiv cs.AI 的新报道进一步介绍了 RGPO 的自适应推理依据脚手架设计,称其在纯语言推理与视觉语言推理任务上持续优于 RLVR 基线;消融实验显示,自适应的 rationale 引导是这一增益的主要来源。报道还称,该方法不要求 off-policy 数据与 RL 任务格式相匹配,训练过程稳定,并能同时提升文本模型与多模态模型的推理性能。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv cs.AI
    RGPO:用自适应推理依据脚手架学习推理

    RGPO 将 ground-truth rationale 作为临时脚手架,先帮助模型生成改进响应,再仅回传更高奖励的模型生成解,以缓解 RL 奖励稀疏。在纯语言和视觉语言推理任务上,RGPO 持续优于 RLVR 基线,消融显示自适应 rationale 引导是主要增益来源。它不要求 off-policy 数据匹配 RL 任务格式,可稳定训练并提升文本与多模态模型推理性能。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。