WorldLine:万小时视频训练的动作驱动模拟器,策略成功率最高提升 21.4 个百分点
WorldLine 是动作驱动的视觉模拟器,用 1 万多小时无动作标注机器人视频学操作动力学,在 RoboTwin 与 AgiBot 上以 74% 平均准确率预测轨迹成败。
WorldLine 是动作驱动的视觉模拟器,用 1 万多小时无动作标注机器人视频学操作动力学,在 RoboTwin 与 AgiBot 上以 74% 平均准确率预测轨迹成败。
浙江大学提出 PanoVLN,用全景观察替代透视图像做视觉语言导航(VLN)。4B 骨干、仅 RGB 输入下,在 R2R-CE 和 RxR-CE Val-Unseen 成功率分别超此前 SOTA 11.9% 和 8.7%。配套置信度引导执行(CGE)策略、多分支训练路线,并融合 RGB 全景的语义与几何特征而不增加视觉 token;四足机器人真实场景实验显示导航更快、停顿更少。
DynamicHOI 提出一种物理感知的 HOI 重建框架,在三个 HOI 数据集上对手和物体重建均取得一致提升。该框架结合几何依据的扩散细化与耦合手-物动力学,通过接触力传递耦合手与物体动力学,并用主动手部驱动力的概率先验抑制机械上不合理的运动。重建轨迹还可用于手部世界模型生成和机器人操作学习。
VLA 策略的潜在接口应暴露哪些骨干层仍不清楚,研究在三个预训练模型、LIBERO 与 CALVIN 上比较单层选择与多层融合,54 组配置中 47 组不及最优单层策略。InfoNCE 在四个代理指标中与策略成功率正相关最一致,用它选层比穷举扫描省 9-33 倍 GPU 算力,平均选择遗憾从最深层的 17.89 个百分点降至 3.71 点。
GeoWind2Plan 以几何条件神经算子预测任务时 3D 城市风场,走廊局部风推理约 3 秒,CFD 约需 8 小时。在 CFD 评估下,顺风、逆风、侧风任务的 UAV 规划能耗分别降低 6.9%、12.7%、4.5%,恢复 CFD 参考节省量的 87.9%、85.7%、75.0%。该工作已被 NeurIPS 2026 接收为 Spotlight。
StructRL 将长时程视觉-语言-动作(VLA)任务拆解为可验证子任务,仅在前提子任务完成后才给出中间奖励,并按完成速度缩放奖励,从而构建结构化中间监督。在 RoboCasa365 与 LIBERO-Long 上,结合 GR00T-N1.5 和 pi 0.5 的评测中,StructRL 一致优于所对比的在线 RL 基线,表明可验证的结构化中间奖励能改善长时程 VLA 后训练,代码已公开。
MATE 是一种确定性的检索后处理流程,把具身智能体检索到的成功轨迹转换为面向执行的记忆,无需额外 LLM 推理。在 134 个 ALFWorld 任务上,MATE 配合 Qwen2.5-14B 与 72B 的任务成功率分别为 81.3% 和 93.3%,token 用量约为原始轨迹的十分之一,其中经核验的动作归一化是恢复检索经验效用的主要机制。
CoDimRecon 是一个智能体框架,能从多视角 RGB 观测重建含刚性、铰接与可变形对象的可编辑 3D 场景,并把曲线、曲面、体分别重建为带半径中心线、带厚度流形壳和水密实体。它用可复用仿真器技能初始化物理模型,以行为测试暴露偏差并触发定向修正;在 Replica 与 ScanNet++ 上重建精度有竞争力,并演示了 rod、shell、solid 三类表示下的机器人交互。
作者称首次将多智能体 VLN 形式化为带依赖与资源约束的协同问题,并发布 MAVLN 基准与 TRISS 协作导航系统。MAVLN 含 11,724 条 episode、145 个场景,覆盖最多四个智能体与三种指令设定,配套约束感知指标。TRISS 由基于 LLM 的子任务调度器、共享拓扑记忆与冲突感知执行机制构成,实验显示其可作为综合基线,调度、规划与执行仍有较大提升空间。
HEIR 是覆盖物体、人际与自我指向交互的图像基准,含 18,730 张图像、六种角色、105 个动作和 437 个名词,用于评估完整参与者-角色集合。
研究团队发布 VLANeXt Family,基于 500+ 控制实验系统重访视觉-语言-动作(VLA)模型的设计空间,提炼出 12 条构建强 VLA 的实用配方。
DexTaG 是 UMass Amherst 与 Genesis AI 发布的灵巧操作训练管线,用人类演示中的触觉读数作为 RL 奖励引导。动捕手套记录含全手触觉的演示,训练覆盖马克笔、锤子等掌内重定向任务,同一任务下单一 retargeting 策略可泛化到保留轨迹。策略蒸馏为无触觉传感器的学生控制器,可零样本部署到真实机器人。
DexAgent 从单个人类视频学习双手灵巧操作,在 11 个真实世界长时程灵巧操作任务上策略执行成功率达 63.6%,最强基线仅 18.2%。该 agentic 的 Human2Sim2Robot 框架依靠可自我进化工具库,平均推理时间 2.1 小时,基线为 3.3 小时。工具库已含 103 个技能和 188 个验证器,论文与项目页已公开。
清华、北航、港大等机构合作的 Uni-VLaT 在预训练 VLA 策略中加入触觉,用于人形机器人移动操作。Back-Tap Walking 任务中拍机器人背部即走、停止拍即停,全程无视觉信号,无触觉时成功率 0%,加触觉后达 85%;在原始触觉输入上加预测目标后,五项任务平均成功率从 68% 提升到 75%,方法可跨 GR00T 和 π0.5 两个 backbone 泛化。
SciHorizon-eLab 是一个智能体式协议到任务编译器,可将自然语言科学实验协议经语义落地、可执行任务合成与多阶段仿真认证编译成保义的具身任务。其构建的基准包含 300 个已认证任务,覆盖多种实验室操作,支持 HIL 任务执行、专家演示复现生成与有序步骤级评估。代表性任务上最强策略平均成功率仅 49.7%,暴露人机与具身智能体协同的明显短板,代码、基准数据与评测工具已公开。
Nicolas Keller 团队发布 Reality Check,这是首个公开的机器人操作(manipulation)评测基准与排行榜,包含 14,400 次真实世界 rollout 测试,覆盖 4 个模型、物体放置等多种任务与数据规模。
苏黎世联邦理工学院软体机器人实验室研制出一款能靠指尖自行行走的机械手,由市面常规仿人机械手改造而来,共五根手指、20 个驱动关节,整机重 818 克。该手在英伟达的艾萨克实验室(NVIDIA's Isaac Lab)仿真平台中用强化学习训练步态,手掌装有电池、基于树莓派(Raspberry Pi)的机载计算机和运动传感器,可完全独立运行。
REVERSAL-BENCH 用连续参数 ρ∈[0,1] 控制可逆性并提供重置 Oracle,覆盖 5 个物理引擎的 8 种操作任务。评估多种策略架构后发现可逆性悬崖:ρ 升高时无重置智能体被永久吸入不可恢复状态,而有回合重置的智能体仍稳定学习。该基准套件、带可恢复性标注的多模拟器数据集与重置 Oracle 已发布,另测试了在不可逆失败前介入的安全护盾。
Google 在 CHI 2026 发布研究原型 AgentHands,将 LLM 的高层推理映射为与语音同步的手势,用于 XR 中空间化的智能体对话。系统通过眼动与场景重建标记物体,由头显本地解析器按词级时间戳把 TTS 与手势动画对齐。在 N=12 的用户研究中,它对照纯语音基线完成兰花养护与 3D 打印机操作任务,空间定位效果显著提升。
Epoch 与 METR 发布长周期编程基准 MirrorCode,测试 AI 在仅有 CLI 访问时重写大型程序的能力,Claude Opus 4.7 用 14 小时、251 美元推理成本完成 METR 估计人类需 2-17 周的任务。
Import AI 第 460 期汇总了社会奖励攻击、Anthropic 的 RSI 迹象和基于 RL 的无人机竞速等多项研究。其中 SocioHack 基准用 72 个沙盒环境测试模型如何钻制度漏洞,RL 训练下模型能以 61.25% 的召回率重新发现历史上被修补的策略。