跳到正文

#具身智能

今日 25 条
9月29日周二
  1. AGI Hunt33

    Standard Bots 推出免代码机器人编程系统,称仅 6% 美国制造商用机器人

    Standard Bots 发布新版 Standard Bots OS,主打免代码、零机器人经验即可编程,瞄准美国仅 6% 制造商使用机器人这一痛点。新系统将位置存储为 spaces,可追踪循环变量与设备状态,并用移动与夹爪、控制逻辑、信号、操作员提示、视觉五类步骤模块拼搭完整程序,官方称点击次数更少、编程更快。

  2. AGI Hunt36

    库班预言人形机器人 5-10 年内失败 专用机器人才是未来

    美国企业家 Mark Cuban 预测,人形机器人将在 5 至 10 年内走向失败,专用机器人形态才是出路。他认为机器人形态应服从任务需求,针对具体工作环境做最优设计,而非一味模仿人体;未来家庭不会采用通用型人形机器人,而是围绕特定任务设计专用机器人并重新规划空间,人类居住区保持相对独立。这一观点与当前多家公司押注人形机器人的热潮形成反差。

9月28日周一
9月17日周四
  1. Apple Machine Learning Research38

    REVERSAL-BENCH:衡量无重置强化学习悬崖的可逆性轴与重置 Oracle

    REVERSAL-BENCH 用连续参数 ρ∈[0,1] 控制可逆性并提供重置 Oracle,覆盖 5 个物理引擎的 8 种操作任务。评估多种策略架构后发现可逆性悬崖:ρ 升高时无重置智能体被永久吸入不可恢复状态,而有回合重置的智能体仍稳定学习。该基准套件、带可恢复性标注的多模拟器数据集与重置 Oracle 已发布,另测试了在不可逆失败前介入的安全护盾。

8月26日周三
  1. Google Research34

    AgentHands:为 XR 中空间化智能体对话生成交互式手势

    Google 在 CHI 2026 发布研究原型 AgentHands,将 LLM 的高层推理映射为与语音同步的手势,用于 XR 中空间化的智能体对话。系统通过眼动与场景重建标记物体,由头显本地解析器按词级时间戳把 TTS 与手势动画对齐。在 N=12 的用户研究中,它对照纯语音基线完成兰花养护与 3D 打印机操作任务,空间定位效果显著提升。

7月30日周四
  1. Google DeepMind61

    Google DeepMind 发布 Gemini Robotics ER 2 机器人具身推理模型

    Google DeepMind 发布 Gemini Robotics ER 2,定位为机器人的高层大脑,负责与人类对话、理解物理世界并规划多步任务,再把运动执行交给底层 VLA 模型。

    推荐理由:官方给出 Gemini Robotics ER 2 相比 ER 1.6 和前沿模型在进度分类、时刻定位上的指标,读者可据此判断机器人具身推理的当前水平。

7月28日周二
  1. Google DeepMind66

    Google DeepMind 发布 Gemini Robotics 2,为机器人带来全身智能

    Google DeepMind 发布 Gemini Robotics 2,由三款模型组成,让机器人实现全身控制、灵巧操作和多机器人协作。其中 Gemini Robotics ER 2 已上线 Google AI Studio 并在 Gemini Enterprise Agent Platform 私密预览,VLA 与端侧模型面向早期接入合作伙伴。

    推荐理由:从控制机器人上半身扩展到全身控制,并加入多机协作与端侧快速适配,可了解机器人基础模型的当前能力边界。

7月27日周一
7月21日周二
  1. HuggingFace Blog49

    Grabette:一套记录机器人操作数据的开源系统

    Grabette 是一个开源低成本手持夹爪系统,用于记录机器人操作演示并自动生成可训练的 LeRobot 数据集,无需真实机器人。手持端 BOM 约 490€,配套电动夹爪 Gripette 约 120€,处理流程在浏览器中经 RTAB-MAP SLAM 完成并上传至 Hugging Face Hub。设计灵感来自斯坦福 UMI,示例用 200 条演示训练 Diffusion Policy。

7月8日周三
  1. Mistral AI49

    Mistral AI 发布 Robostral Navigate:8B 具身导航模型

    Mistral AI 发布 Robostral Navigate,一个仅用单个 RGB 相机的 8B 具身导航模型,在 R2R-CE validation unseen 上达到 76.6% 成功率。它完全不用 LiDAR 或深度传感器,成绩比最佳单相机方案高 9.7 分,比使用深度或多相机的最佳系统高 4.5 分。模型完全基于仿真数据自研训练,可泛化到轮式、足式与飞行机器人。

7月7日周二
  1. HuggingFace Blog66

    LeRobot v0.6.0 发布,新增世界模型策略、奖励模型 API 与六套仿真基准

    LeRobot 发布 v0.6.0,围绕机器人学习闭环引入可想象未来的世界模型策略(VLA-JEPA、FastWAM、LingBot-VA)、奖励模型 API(lerobot.rewards)以及部署 CLI lerobot-rollout。

    推荐理由:从世界模型策略到奖励模型、部署 CLI 与六套仿真基准,这篇发布说明勾勒出机器人学习闭环的工具链全貌。

6月29日周一
6月9日周二
  1. Google DeepMind30

    Google DeepMind 启动 Robotics 加速器,15 家欧洲机器人初创公司入选

    Google DeepMind 启动为期三个月的 Robotics 加速器项目,选出 15 家欧洲机器人初创公司,提供技术指导并开放 AI 栈与 Gemini 机器人模型。入选公司覆盖物流、制造、医疗、气候与导航等领域,其中 3D-Components 称其 RobTrack 将焊接和金属 3D 打印的参数选择与质控提速 280X。项目本周在伦敦启动。

6月8日周一
5月18日周一
  1. Google DeepMind54

    Google DeepMind 为 Project Genie 加入街景锚定能力,并向 Google AI Ultra 订阅者开放

    Google DeepMind 为实验性原型 Project Genie 加入 Google 街景锚定能力,用户可基于美国真实地点生成可交互的想象世界。该能力由 Maps Imagery Grounding 支持,可搭配 “Desert Sands”“Stone Age” 等风格,并描述自己的角色来生成世界,街景地点目前覆盖美国,后续计划扩展。

4月13日周一