Google Deepmind发布Gemini Robotics 2,从桌面机械臂到人形机器人的全能视觉语言动作模型
Google Deepmind推出Gemini Robotics 2,这是其最先进的视觉语言动作模型,可控制从桌面机械臂到全尺寸人形机器人。文章解析模型能力、ER 2推理层,并探讨对中文圈机器人开发者的影响与替代方案。
一句话看懂
Google Deepmind发布Gemini Robotics 2,一个能控制从桌面机械臂到人形机器人的视觉语言动作模型,并配套ER 2推理层,让机器人更聪明地规划任务。
详细发生了什么
Google Deepmind于2026年7月31日正式发布Gemini Robotics 2,这是其迄今最先进的视觉语言动作(VLA)模型。该模型的核心能力在于统一了视觉理解、语言指令和动作执行,使机器人能够应对从精细的桌面操作到全身协调的复杂任务。
与上一代相比,Gemini Robotics 2在泛化能力上显著提升,能够适应不同形态的机器人硬件,包括单臂桌面机械臂、双臂移动平台以及全尺寸人形机器人。这意味着开发者无需针对每种机器人单独训练模型,而是可以用同一套模型驱动多种硬件。
同时发布的还有Gemini Robotics ER 2,这是一个更高层次的推理层,专门为机器人任务设计。ER 2负责任务分解、路径规划和环境理解,相当于给机器人装上了“大脑”,而Gemini Robotics 2则负责具体的动作执行。两者结合,让机器人不仅能“看到”和“行动”,还能“思考”下一步该做什么。
目前,Google Deepmind已开放Gemini Robotics 2的早期访问计划,部分合作伙伴可以申请试用。官方表示,该模型在真实机器人上的成功率相比前代提升了约30%,但具体数据集和训练细节尚未完全公开。
中文圈视角
对中文圈的机器人开发者来说,Gemini Robotics 2的发布是一个重要信号,但实际使用门槛不低。首先,Google的服务在中国大陆无法直接访问,开发者需要借助海外服务器或API中转,这增加了部署成本和合规风险。其次,Gemini Robotics 2目前仅开放早期访问,且大概率需要企业级申请,个人开发者很难拿到权限。
相比之下,国内已有类似方向的探索,比如智元机器人的AgiBot World模型、宇树科技的机器人控制方案,以及上海人工智能实验室的浦源·灵猿等。这些国产方案在中文场景和本地化支持上更有优势,但在通用性和跨形态适配能力上,Gemini Robotics 2目前仍处于领先地位。
对于中文用户,如果目标是快速验证机器人控制算法,可以先从国产开源模型入手;如果追求最前沿的VLA能力,则需要评估海外API的可行性和成本。另外,数据出境问题值得注意——使用Gemini Robotics 2时,机器人采集的视觉数据会传输到海外服务器,涉及敏感场景时需谨慎。
几条值得记住的细节
- Gemini Robotics 2是VLA模型,直接输出动作指令,而非仅生成文本或图像。
- ER 2推理层独立于动作模型,可单独用于任务规划,也可与Gemini Robotics 2组合使用。
- 早期访问计划已开放,但仅限受邀合作伙伴,普通开发者需等待公开版本。
- 官方称真实机器人成功率提升约30%,但未公布具体测试环境和基准。
- 模型支持多种机器人形态,包括桌面机械臂、移动平台和人形机器人。
一句话总结
Gemini Robotics 2让机器人控制更通用,但中文开发者需权衡海外API的可用性与国产替代方案。