热点事件持续更新
StructRL:长时程VLA在线结构化强化学习
1 篇报道1 个报道来源4 小时前更新
先了解这件事
AI 综述
2026年9月30日,arXiv cs.CV 发布 StructRL,一种面向长时程视觉-语言-动作(VLA)任务的在线结构化强化学习方法。该方法将长时程 VLA 任务拆解为可验证的子任务,仅在前提子任务完成后才给出中间奖励,并按完成速度对奖励进行缩放,由此构建结构化的中间监督信号。在 RoboCasa365 与 LIBERO-Long 两个基准上,结合 GR00T-N1.5 和 pi 0.5 的评测中,StructRL 一致优于所对比的在线 RL 基线。报道称,这表明可验证的结构化中间奖励能够改善长时程 VLA 的后训练。目前代码已公开。截至本次更新,该事件仅有这一篇报道,尚无后续进展或与之冲突的说法。
AI 根据报道生成 · 3 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
9月30日
- arXiv cs.CVStructRL:面向长时程视觉-语言-动作任务的在线结构化强化学习
StructRL 将长时程视觉-语言-动作(VLA)任务拆解为可验证子任务,仅在前提子任务完成后才给出中间奖励,并按完成速度缩放奖励,从而构建结构化中间监督。在 RoboCasa365 与 LIBERO-Long 上,结合 GR00T-N1.5 和 pi 0.5 的评测中,StructRL 一致优于所对比的在线 RL 基线,表明可验证的结构化中间奖励能改善长时程 VLA 后训练,代码已公开。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。