AGI Hunt· ZhejiangUniversity·· 4 小时前AI 评分42
浙大 PanoVLN:全景视觉语言导航成功率超 SOTA 11.9%,四足机器人实测
AI 导读
浙江大学提出 PanoVLN,用全景观察替代透视图像做视觉语言导航(VLN)。4B 骨干、仅 RGB 输入下,在 R2R-CE 和 RxR-CE Val-Unseen 成功率分别超此前 SOTA 11.9% 和 8.7%。配套置信度引导执行(CGE)策略、多分支训练路线,并融合 RGB 全景的语义与几何特征而不增加视觉 token;四足机器人真实场景实验显示导航更快、停顿更少。
来源:AGI Hunt · agihunt.info