西门子副总裁:人形机器人须像以往技术浪潮一样在工厂证明自己
西门子工业机械副总裁 Rahul Garg 谈人形机器人在制造业落地时表示,人形机器人须像以往几波技术浪潮一样,靠实际价值赢得工厂车间的一席之地。其视频内容还涉及人形机器人部署到产线所需的能力与条件。
西门子工业机械副总裁 Rahul Garg 谈人形机器人在制造业落地时表示,人形机器人须像以往几波技术浪潮一样,靠实际价值赢得工厂车间的一席之地。其视频内容还涉及人形机器人部署到产线所需的能力与条件。
MindOn Tech 发布物理 AI 机器人 Mind-1,在双臂、移动双臂和人形三种形态上实现快速、流畅的全自主操作。其定位为「以人类速度完成实际工作」,面向真实部署场景,官方强调从演示走向真实工作后,完成任务的速度才是下一阶段竞争点。
WorldLine 是动作驱动的视觉模拟器,用 1 万多小时无动作标注机器人视频学操作动力学,在 RoboTwin 与 AgiBot 上以 74% 平均准确率预测轨迹成败。
浙江大学提出 PanoVLN,用全景观察替代透视图像做视觉语言导航(VLN)。4B 骨干、仅 RGB 输入下,在 R2R-CE 和 RxR-CE Val-Unseen 成功率分别超此前 SOTA 11.9% 和 8.7%。配套置信度引导执行(CGE)策略、多分支训练路线,并融合 RGB 全景的语义与几何特征而不增加视觉 token;四足机器人真实场景实验显示导航更快、停顿更少。
michellelsun 发起面向物理 AI(physical AI)创业者的社群征集,Sethwinterroth 转发该帖,邀请从业者在帖下介绍自己的项目。征集覆盖执行器、灵巧手、具身智能训练数据、自动驾驶实验室、磁性材料、机器人部署层、太空制造、能源与电池、物理世界模型、机器人控制脑机接口与开源机器人基础模型等方向。
DynamicHOI 提出一种物理感知的 HOI 重建框架,在三个 HOI 数据集上对手和物体重建均取得一致提升。该框架结合几何依据的扩散细化与耦合手-物动力学,通过接触力传递耦合手与物体动力学,并用主动手部驱动力的概率先验抑制机械上不合理的运动。重建轨迹还可用于手部世界模型生成和机器人操作学习。
VLA 策略的潜在接口应暴露哪些骨干层仍不清楚,研究在三个预训练模型、LIBERO 与 CALVIN 上比较单层选择与多层融合,54 组配置中 47 组不及最优单层策略。InfoNCE 在四个代理指标中与策略成功率正相关最一致,用它选层比穷举扫描省 9-33 倍 GPU 算力,平均选择遗憾从最深层的 17.89 个百分点降至 3.71 点。
GeoWind2Plan 以几何条件神经算子预测任务时 3D 城市风场,走廊局部风推理约 3 秒,CFD 约需 8 小时。在 CFD 评估下,顺风、逆风、侧风任务的 UAV 规划能耗分别降低 6.9%、12.7%、4.5%,恢复 CFD 参考节省量的 87.9%、85.7%、75.0%。该工作已被 NeurIPS 2026 接收为 Spotlight。
StructRL 将长时程视觉-语言-动作(VLA)任务拆解为可验证子任务,仅在前提子任务完成后才给出中间奖励,并按完成速度缩放奖励,从而构建结构化中间监督。在 RoboCasa365 与 LIBERO-Long 上,结合 GR00T-N1.5 和 pi 0.5 的评测中,StructRL 一致优于所对比的在线 RL 基线,表明可验证的结构化中间奖励能改善长时程 VLA 后训练,代码已公开。
MATE 是一种确定性的检索后处理流程,把具身智能体检索到的成功轨迹转换为面向执行的记忆,无需额外 LLM 推理。在 134 个 ALFWorld 任务上,MATE 配合 Qwen2.5-14B 与 72B 的任务成功率分别为 81.3% 和 93.3%,token 用量约为原始轨迹的十分之一,其中经核验的动作归一化是恢复检索经验效用的主要机制。
CoDimRecon 是一个智能体框架,能从多视角 RGB 观测重建含刚性、铰接与可变形对象的可编辑 3D 场景,并把曲线、曲面、体分别重建为带半径中心线、带厚度流形壳和水密实体。它用可复用仿真器技能初始化物理模型,以行为测试暴露偏差并触发定向修正;在 Replica 与 ScanNet++ 上重建精度有竞争力,并演示了 rod、shell、solid 三类表示下的机器人交互。
作者称首次将多智能体 VLN 形式化为带依赖与资源约束的协同问题,并发布 MAVLN 基准与 TRISS 协作导航系统。MAVLN 含 11,724 条 episode、145 个场景,覆盖最多四个智能体与三种指令设定,配套约束感知指标。TRISS 由基于 LLM 的子任务调度器、共享拓扑记忆与冲突感知执行机制构成,实验显示其可作为综合基线,调度、规划与执行仍有较大提升空间。
HEIR 是覆盖物体、人际与自我指向交互的图像基准,含 18,730 张图像、六种角色、105 个动作和 437 个名词,用于评估完整参与者-角色集合。
哈萨克斯坦总统托卡耶夫会见优必选副总裁钟永,支持优必选在阿拉木图建设面向教育和服务领域的机器人设备制造工厂,该厂将是优必选在中国境外的首个生产基地。优必选已与欧洲、日韩等主要市场客户签约,斩获超 5000 万元海外订单,产品包括商用服务人形机器人 Walker C1 和超仿真人形机器人优世界 U1。
法拉第未来公布“Built in USA”加速计划第二阶段方案,目标今年年底前将机器人工厂投入运营,2027 年第一季度实现首款新 EAI 本体产品下线。该方案还包括推进 Next Futurist、Next Aegis 系列产品下线,并启动向 FCC 申请机器人产品有条件批准。FFAI 已与将更名 FFR 的 AIxC 签署非约束性条款,拟以全股票方式出售机器人资产及业务,估值约 2 亿美元。
研究团队发布 VLANeXt Family,基于 500+ 控制实验系统重访视觉-语言-动作(VLA)模型的设计空间,提炼出 12 条构建强 VLA 的实用配方。
IROS 2026 上,博主 CyberRobooo 发现一款名为 Baymax 的人形机器人,主打「可以拥抱」的温暖交互设计,原型致敬电影《超能陆战队》的大白。文中预测,未来会有更多电影角色被做成真实的人形机器人。
Mark Cuban 在 Polymarket 相关讨论中预测,人形机器人将在 5-10 年内失败。他判断家庭不会采用通用形态机器人,而是重新设计居住空间,围绕洗碗、烘干衣物等特定任务部署专用机器人。帖主以「像机器一样专职洗碗/烘干」的说法调侃回应。
DynaRobotics 展示了轮式机器人 Taku 的全身控制器(WBC),基于 Isaac Sim 的大规模 GPU 并行强化学习训练,获得针对精确移动操作(loco-manipulation)优化的鲁棒控制器。该控制器面向轮式机器人平台,转发者对其应用于轮式机器人表示兴奋。
博主 @gbrulte 分享在伦敦通过 Uber 试乘 Wayve 监督模式自动驾驶,称驾驶平顺、能很好处理旧金山式车流并完成高速并线。他评价 Waymo 仍是当下明显领先者,但 Wayve 势头强劲,在旧金山和拉斯维加斯的乘坐体验好于 Zoox、无路口问题且更平顺,整体接近 Tesla Robotaxi,何时去掉监督是下一步关键。
DexTaG 是 UMass Amherst 与 Genesis AI 发布的灵巧操作训练管线,用人类演示中的触觉读数作为 RL 奖励引导。动捕手套记录含全手触觉的演示,训练覆盖马克笔、锤子等掌内重定向任务,同一任务下单一 retargeting 策略可泛化到保留轨迹。策略蒸馏为无触觉传感器的学生控制器,可零样本部署到真实机器人。
DexAgent 从单个人类视频学习双手灵巧操作,在 11 个真实世界长时程灵巧操作任务上策略执行成功率达 63.6%,最强基线仅 18.2%。该 agentic 的 Human2Sim2Robot 框架依靠可自我进化工具库,平均推理时间 2.1 小时,基线为 3.3 小时。工具库已含 103 个技能和 188 个验证器,论文与项目页已公开。
世界模型创业公司 General Intuition 完成 2.2 亿美元融资,估值 62 亿美元,投资方包括 Valor Equity Partners、Atreides、Seven Seven Six、Point72、Khosla Ventures 和 General Catalyst。
一位六十多岁的农民兼作家在 Reddit 提出思想实验:若 AI 与机器人包揽几乎所有工作、人类只需玩耍,人类将失去作为人性一部分的劳动。他为此起草一条社会契约条款草案——「AI 机器人不得建造或修理 AI 机器人」,为人类保留一块劳动领地。他明确这只是初稿,邀请读者讨论反驳并修改措辞。
AMD 宣布以约 82 亿美元全股票收购空间智能初创公司 World Labs,其创始人李飞飞将加入 AMD 出任执行副总裁兼首席科学家,直接向 CEO 苏姿丰汇报。
推荐理由:这笔 82 亿美元全股票交易把世界模型团队并入芯片厂商,可与 Nvidia 收购 Hugging Face 的生态打法对照。
Flourish 1 家用机器人发布,定价 3555 美元,首批仅 50 台,计划 2026 年 12 月发货。该机器人主打可教学性:用手机 App 引导演示一遍,约 30 分钟、无需写代码即可教会新任务,别人教好的任务 5 秒即可安装复用,并支持语音交互与定时任务。硬件为高 3 英尺 7 英寸、重 44 磅、负载 3.3 磅、续航 12 小时,端侧运行,高级 AI 任务需额外算力。
Microducks 项目首批机器鸭已在法国波尔多开始组装,这批最早的成品将用于测试和演示。项目由此从原型阶段进入实体硬件落地,作者感叹看到它们「活了起来」。
清华、北航、港大等机构合作的 Uni-VLaT 在预训练 VLA 策略中加入触觉,用于人形机器人移动操作。Back-Tap Walking 任务中拍机器人背部即走、停止拍即停,全程无视觉信号,无触觉时成功率 0%,加触觉后达 85%;在原始触觉输入上加预测目标后,五项任务平均成功率从 68% 提升到 75%,方法可跨 GR00T 和 π0.5 两个 backbone 泛化。
Agility Robotics 的机器人在 IROS 的操作演示中展示了从搬运物流箱到熟练抓取和操作多种不同物体的明显进步。演示视频由 Chris Paxtt 及其团队远程拍摄,作者无法亲临 IROS 大会,便由机器人圈朋友代为「参会」。
特斯拉 FSD(Supervised)车队累计真实驾驶里程突破 150 亿英里,每月新增约 10 亿英里数据。特斯拉最新安全报告称,使用 FSD 的车辆重大碰撞、轻微碰撞均减少 7 倍,非高速路段碰撞减少 5 倍。该车队依托全球最大规模的实车数据闭环持续迭代。
AMD 以 82 亿美元收购 World Labs,后者自 2024 年成立以来主攻空间智能,并在收购 SceniX 后向机器人仿真方向布局。World Labs 称其 Atlas 是首个 omni 模型架构,可从 2D 图像输入预测新的相机视角,用生成模型结合多视图几何解决计算机视觉中的稀疏重建难题,面向机器人、设计与工程等场景。
SciHorizon-eLab 是一个智能体式协议到任务编译器,可将自然语言科学实验协议经语义落地、可执行任务合成与多阶段仿真认证编译成保义的具身任务。其构建的基准包含 300 个已认证任务,覆盖多种实验室操作,支持 HIL 任务执行、专家演示复现生成与有序步骤级评估。代表性任务上最强策略平均成功率仅 49.7%,暴露人机与具身智能体协同的明显短板,代码、基准数据与评测工具已公开。
David Patterson 回应「水管工在 AGI 后仍有工作」的说法,重申 AGI 将同时取代知识型工作和体力劳动。他认为 Claude、ChatGPT 将完全多模态化并控制人形机器人,且这已经在发生。他预计一两年内,它们在所有事情上都会超过任何人类,包括水管工这类体力职业。
Nicolas Keller 团队发布 Reality Check,这是首个公开的机器人操作(manipulation)评测基准与排行榜,包含 14,400 次真实世界 rollout 测试,覆盖 4 个模型、物体放置等多种任务与数据规模。
中国互联网络信息中心在 2026 中国互联网基础资源大会上发布《生成式人工智能应用发展报告(2026)》,截至 2026 年上半年我国生成式人工智能用户规模超过 7 亿人,普及率突破 50%。
cixliv 在机器人竞技场 REK 现场演示其「终结者」机器人,展示「人 vs 机器」这一新极限运动形式。该现场由 Fox 10 Phoenix 报道并被转发,画面被形容为令人起鸡皮疙瘩。
韩国推出四足焊接机器人 Diden Spider,脚部带磁吸装置,可在钢制地面行走、攀爬垂直墙面并吸附天花板作业,负重 30 公斤,替代以往需搭梯子的危险船厂作业。同时,一段仿生蜘蛛机器人演示视频因姿态逼真、惊悚感十足刷屏,网友直呼「Nope」,再度掀起关于机器人恐怖谷的讨论。
苏黎世联邦理工学院软体机器人实验室研制出一款能靠指尖自行行走的机械手,由市面常规仿人机械手改造而来,共五根手指、20 个驱动关节,整机重 818 克。该手在英伟达的艾萨克实验室(NVIDIA's Isaac Lab)仿真平台中用强化学习训练步态,手掌装有电池、基于树莓派(Raspberry Pi)的机载计算机和运动传感器,可完全独立运行。
Wuji 灵巧手在 IROS 亮相,共 20 个主动自由度、每根手指 4 个,设计目标是比常见的简单夹爪更贴近人类手的结构与运动方式。现场体验者认为机器人灵巧手正在快速进步。
开发者 jonstephens85 造访 Agility Robotics,与部署人形机器人 Digit 的工程师交流,注意到 Digit 机身带着实验室之外真实作业留下的痕迹。他尤其欣赏 Digit 并非干净锃亮的展示机,这些痕迹说明它确实在实际工作中被使用。