Standard Bots 推出免代码机器人编程系统,称仅 6% 美国制造商用机器人
Standard Bots 发布新版 Standard Bots OS,主打免代码、零机器人经验即可编程,瞄准美国仅 6% 制造商使用机器人这一痛点。新系统将位置存储为 spaces,可追踪循环变量与设备状态,并用移动与夹爪、控制逻辑、信号、操作员提示、视觉五类步骤模块拼搭完整程序,官方称点击次数更少、编程更快。
Standard Bots 发布新版 Standard Bots OS,主打免代码、零机器人经验即可编程,瞄准美国仅 6% 制造商使用机器人这一痛点。新系统将位置存储为 spaces,可追踪循环变量与设备状态,并用移动与夹爪、控制逻辑、信号、操作员提示、视觉五类步骤模块拼搭完整程序,官方称点击次数更少、编程更快。
IDC 全球人形机器人跟踪报告显示,2026 上半年全球人形机器人出货量接近 2.5 万台,同比增长 432.1%,市场规模超过 7.4 亿美元,同比增长 322.7%。
美国企业家 Mark Cuban 预测,人形机器人将在 5 至 10 年内走向失败,专用机器人形态才是出路。他认为机器人形态应服从任务需求,针对具体工作环境做最优设计,而非一味模仿人体;未来家庭不会采用通用型人形机器人,而是围绕特定任务设计专用机器人并重新规划空间,人类居住区保持相对独立。这一观点与当前多家公司押注人形机器人的热潮形成反差。
AMD 宣布计划以 82 亿美元股票收购世界模型开发商 World Labs,预计年底前完成交易。World Labs 由李飞飞于 2024 年创立,其最新模型 Atlas 可依据几张照片生成工厂或仓库的虚拟副本,并模拟传送带等运动物体,用于训练机器人。
英国创业公司 Worldmodeldata 正把游戏手柄输入等游戏操作数据打包成训练数据集,供世界模型使用,公司由 Yann LeCun 担任顾问。CEO Rhea Loucas 称已从多款热门游戏背后的工作室授权近 100 万小时数据,但拒绝透露是哪些游戏,未来还计划让玩家个人获得补偿。
REVERSAL-BENCH 用连续参数 ρ∈[0,1] 控制可逆性并提供重置 Oracle,覆盖 5 个物理引擎的 8 种操作任务。评估多种策略架构后发现可逆性悬崖:ρ 升高时无重置智能体被永久吸入不可恢复状态,而有回合重置的智能体仍稳定学习。该基准套件、带可恢复性标注的多模拟器数据集与重置 Oracle 已发布,另测试了在不可逆失败前介入的安全护盾。
Google 在 CHI 2026 发布研究原型 AgentHands,将 LLM 的高层推理映射为与语音同步的手势,用于 XR 中空间化的智能体对话。系统通过眼动与场景重建标记物体,由头显本地解析器按词级时间戳把 TTS 与手势动画对齐。在 N=12 的用户研究中,它对照纯语音基线完成兰花养护与 3D 打印机操作任务,空间定位效果显著提升。
Google DeepMind 发布 Gemini Robotics ER 2,定位为机器人的高层大脑,负责与人类对话、理解物理世界并规划多步任务,再把运动执行交给底层 VLA 模型。
推荐理由:官方给出 Gemini Robotics ER 2 相比 ER 1.6 和前沿模型在进度分类、时刻定位上的指标,读者可据此判断机器人具身推理的当前水平。
Google DeepMind 发布 Gemini Robotics 2,由三款模型组成,让机器人实现全身控制、灵巧操作和多机器人协作。其中 Gemini Robotics ER 2 已上线 Google AI Studio 并在 Gemini Enterprise Agent Platform 私密预览,VLA 与端侧模型面向早期接入合作伙伴。
推荐理由:从控制机器人上半身扩展到全身控制,并加入多机协作与端侧快速适配,可了解机器人基础模型的当前能力边界。
Epoch 与 METR 发布长周期编程基准 MirrorCode,测试 AI 在仅有 CLI 访问时重写大型程序的能力,Claude Opus 4.7 用 14 小时、251 美元推理成本完成 METR 估计人类需 2-17 周的任务。
NVIDIA 发布 Cosmos-H-Dreams,一款面向手术机器人的实时、动作条件生成式模拟器,把 Cosmos-H-Surgical-Simulator 蒸馏为因果少步学生模型。
Grabette 是一个开源低成本手持夹爪系统,用于记录机器人操作演示并自动生成可训练的 LeRobot 数据集,无需真实机器人。手持端 BOM 约 490€,配套电动夹爪 Gripette 约 120€,处理流程在浏览器中经 RTAB-MAP SLAM 完成并上传至 Hugging Face Hub。设计灵感来自斯坦福 UMI,示例用 200 条演示训练 Diffusion Policy。
Mistral AI 发布 Robostral Navigate,一个仅用单个 RGB 相机的 8B 具身导航模型,在 R2R-CE validation unseen 上达到 76.6% 成功率。它完全不用 LiDAR 或深度传感器,成绩比最佳单相机方案高 9.7 分,比使用深度或多相机的最佳系统高 4.5 分。模型完全基于仿真数据自研训练,可泛化到轮式、足式与飞行机器人。
LeRobot 发布 v0.6.0,围绕机器人学习闭环引入可想象未来的世界模型策略(VLA-JEPA、FastWAM、LingBot-VA)、奖励模型 API(lerobot.rewards)以及部署 CLI lerobot-rollout。
推荐理由:从世界模型策略到奖励模型、部署 CLI 与六套仿真基准,这篇发布说明勾勒出机器人学习闭环的工具链全貌。
NVIDIA 研究人员提出 ENPIRE,让编码智能体驱动物理机器人自主试验与迭代,在 PushT、插针入盒、切割扎带等任务上把策略成功率提升到 99%。
Google DeepMind 启动为期三个月的 Robotics 加速器项目,选出 15 家欧洲机器人初创公司,提供技术指导并开放 AI 栈与 Gemini 机器人模型。入选公司覆盖物流、制造、医疗、气候与导航等领域,其中 3D-Components 称其 RobTrack 将焊接和金属 3D 打印的参数选择与质控提速 280X。项目本周在伦敦启动。
Import AI 第 460 期汇总了社会奖励攻击、Anthropic 的 RSI 迹象和基于 RL 的无人机竞速等多项研究。其中 SocioHack 基准用 72 个沙盒环境测试模型如何钻制度漏洞,RL 训练下模型能以 61.25% 的召回率重新发现历史上被修补的策略。
Google DeepMind 为实验性原型 Project Genie 加入 Google 街景锚定能力,用户可基于美国真实地点生成可交互的想象世界。该能力由 Maps Imagery Grounding 支持,可搭配 “Desert Sands”“Stone Age” 等风格,并描述自己的角色来生成世界,街景地点目前覆盖美国,后续计划扩展。
Google DeepMind 发布 Gemini Robotics-ER 1.6,这款面向机器人的推理模型增强了空间推理与多视角理解,并新增仪表读数能力。官方称其在指向、计数和任务成功检测上相比 Gemini Robotics-ER 1.5 和 Gemini 3.0 Flash 有明显提升。