跳到正文
热点事件持续更新

StructRL:长时程VLA在线结构化强化学习

1 篇报道1 个报道来源4 小时前更新

先了解这件事

AI 综述

2026年9月30日,arXiv cs.CV 发布 StructRL,一种面向长时程视觉-语言-动作(VLA)任务的在线结构化强化学习方法。该方法将长时程 VLA 任务拆解为可验证的子任务,仅在前提子任务完成后才给出中间奖励,并按完成速度对奖励进行缩放,由此构建结构化的中间监督信号。在 RoboCasa365 与 LIBERO-Long 两个基准上,结合 GR00T-N1.5 和 pi 0.5 的评测中,StructRL 一致优于所对比的在线 RL 基线。报道称,这表明可验证的结构化中间奖励能够改善长时程 VLA 的后训练。目前代码已公开。截至本次更新,该事件仅有这一篇报道,尚无后续进展或与之冲突的说法。

AI 根据报道生成 · 3 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

9月30日
  1. arXiv cs.CV
    StructRL:面向长时程视觉-语言-动作任务的在线结构化强化学习

    StructRL 将长时程视觉-语言-动作(VLA)任务拆解为可验证子任务,仅在前提子任务完成后才给出中间奖励,并按完成速度缩放奖励,从而构建结构化中间监督。在 RoboCasa365 与 LIBERO-Long 上,结合 GR00T-N1.5 和 pi 0.5 的评测中,StructRL 一致优于所对比的在线 RL 基线,表明可验证的结构化中间奖励能改善长时程 VLA 后训练,代码已公开。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。