Google DeepMind 发布 Gemini Robotics 2:三款物理 AI 模型实现全身控制、灵巧操作与多机器人协作
Google DeepMind 推出 Gemini Robotics 2,包含三个模型:VLA 模型实现全身人形控制,ER 2 负责推理与任务编排,On-Device 2 可快速适配新机器人。ER 2 已公开预览,支持 128K context window。本文详解技术细节、性能数据及对中文圈机器人开发者的影响。
一句话看懂
Google DeepMind 发布 Gemini Robotics 2,三款模型分别负责全身控制、灵巧操作和多机器人协作,其中推理模型 ER 2 已开放公开预览。
详细发生了什么
Google DeepMind 正式推出 Gemini Robotics 2,作为其下一代机器人的智能层。此次发布包含三个独立模型,分别面向不同场景:
-
Gemini Robotics 2 (VLA):视觉-语言-动作模型,将视觉和语言输入转化为电机控制信号,可驱动完整人形机器人(从脚趾到指尖)以及双臂机器人,支持多指灵巧手和并行夹爪。
-
Gemini Robotics ER 2:具身推理模型,基于 Gemini 3.5 Flash,作为高层大脑负责与人类交互、理解物理世界并规划多步任务(持续数分钟)。支持文本、图像、视频、音频交错输入,context window 达 128K,输出文本最长 64K tokens。
-
Gemini Robotics On-Device 2:高效 VLA 模型,优化后可在机器人本地运行,基于 Gemini Robotics 1.5 和 on-device Gemma 模型。输入包括文本、图像和机器人本体感知数值,输出为动作数值。
关键演示:单个 checkpoint 同时驱动 Apptronik Apollo 2(配备 SharpaWave 五指手或 Inspire 手)和 Franka Duo(配备 Robotiq 夹爪)。ER 2 在进度分类任务上准确率 57.4%,关键时刻定位准确率 91.3%(平均误差 0.96 秒),执行速度比大模型快 4 倍。
多机器人协作方面,Apollo 2 与 Franka F3 Duo 通过共享语义理解实现子任务交接。On-Device 2 可在数小时内(少于 200 个示例)适配新双臂机器人,如 SO101 和 Dexmate。
中文圈视角
对中文机器人开发者来说,这次发布有几个关键点:
-
ER 2 已公开可用:通过 Gemini API 和 Google AI Studio 即可调用,模型字符串为
gemini-robotics-er-2-preview。这意味着国内开发者(需科学上网)可以立即上手测试具身推理能力,用于任务规划、进度监控等场景。 -
国产替代对比:国内具身智能领域,智元机器人、宇树科技、星动纪元等公司也在推进类似模型,但尚未有公开可用的通用推理模型。DeepSeek 等大模型厂商在 VLM 能力上接近,但缺乏机器人专用优化。Gemini Robotics ER 2 的 128K context 和工具调用能力(如 Google Search)是目前国产方案尚未覆盖的。
-
合规与数据安全:On-Device 2 模型可本地运行,避免数据出境问题,但适配新机器人仍需 Google 的早期访问权限。国内开发者若想使用 VLA 模型,需申请成为早期合作伙伴,门槛较高。
-
中文场景盲点:原文未提及中文语言支持,但 Gemini 系列本身支持中文,ER 2 应可直接处理中文指令。国内机器人厂商若想集成,需注意 API 延迟和合规风险。
几条值得记住的细节
- ER 2 基于 Gemini 3.5 Flash,context window 128K,输出 64K tokens,支持文本、图像、视频、音频交错输入。
- 多指灵巧操作成功率波动大:拧灯泡 92%,扎垃圾袋 44%,拉链 40%,簸箕 32%。
- On-Device 2 在 SO101 平台上从 6.7% 提升至 53.3%,在 Dexmate 上从 24.4% 提升至 75.6%。
- 安全基准 ASIMOV-Agentic 已开源至 Hugging Face,采用 CC-BY-4.0 许可。
- ER 2 公开预览,VLA 模型仅限早期合作伙伴,On-Device 2 仅限可信测试者。
一句话总结
Gemini Robotics 2 让机器人从“预设动作”走向“理解+适应”,公开的 ER 2 模型值得中文开发者立即上手测试。