arXiv cs.CV· Ziyi Yin, Sangmin Woo, Kang Zhou, Sungyeon Kim, Aosong Feng, Haibo Ding, Jun Huan·· 4 小时前AI 评分37
StructRL:面向长时程视觉-语言-动作任务的在线结构化强化学习
StructRL: Online Structured Reinforcement Learning for Long-Horizon Vision-Language-Action Tasks
AI 导读
StructRL 将长时程视觉-语言-动作(VLA)任务拆解为可验证子任务,仅在前提子任务完成后才给出中间奖励,并按完成速度缩放奖励,从而构建结构化中间监督。在 RoboCasa365 与 LIBERO-Long 上,结合 GR00T-N1.5 和 pi 0.5 的评测中,StructRL 一致优于所对比的在线 RL 基线,表明可验证的结构化中间奖励能改善长时程 VLA 后训练,代码已公开。
来源:arXiv cs.CV · arxiv.org