AGI Hunt· MicrosoftResearch·· 3 小时前AI 评分38
微软 DiVeR:决策关键状态加权验证器,提升 VLA 任务成功率
AI 导读
微软研究院提出 DiVeR,用验证器引导 VLA(视觉-语言-动作)策略的测试时扩展:从采样动作表征的离散度估计「决策关键度」,据此重加权验证器学习,聚焦动作分叉最关键的状态,无需步级标注或额外环境交互。在 LIBERO、RoboCasa 基准和 Franka Research 3 真机实验中,DiVeR 一致提升任务成功率,验证器推理开销可忽略。
来源:AGI Hunt · agihunt.info