AI 快讯 编译自 the_decoder #模型发布#机器人#Google Deepmind

Google Deepmind发布Gemini Robotics 2,从桌面机械臂到人形机器人的全能视觉语言动作模型

Google Deepmind推出Gemini Robotics 2,这是其最先进的视觉语言动作模型,可控制从桌面机械臂到全尺寸人形机器人。文章解析模型能力、ER 2推理层,并探讨对中文圈机器人开发者的影响与替代方案。

编译发布 2026/07/31 原文发布 2026/07/31

一句话看懂

Google Deepmind发布Gemini Robotics 2,一个能控制从桌面机械臂到人形机器人的视觉语言动作模型,并配套ER 2推理层,让机器人更聪明地规划任务。

详细发生了什么

Google Deepmind于2026年7月31日正式发布Gemini Robotics 2,这是其迄今最先进的视觉语言动作(VLA)模型。该模型的核心能力在于统一了视觉理解、语言指令和动作执行,使机器人能够应对从精细的桌面操作到全身协调的复杂任务。

与上一代相比,Gemini Robotics 2在泛化能力上显著提升,能够适应不同形态的机器人硬件,包括单臂桌面机械臂、双臂移动平台以及全尺寸人形机器人。这意味着开发者无需针对每种机器人单独训练模型,而是可以用同一套模型驱动多种硬件。

同时发布的还有Gemini Robotics ER 2,这是一个更高层次的推理层,专门为机器人任务设计。ER 2负责任务分解、路径规划和环境理解,相当于给机器人装上了“大脑”,而Gemini Robotics 2则负责具体的动作执行。两者结合,让机器人不仅能“看到”和“行动”,还能“思考”下一步该做什么。

目前,Google Deepmind已开放Gemini Robotics 2的早期访问计划,部分合作伙伴可以申请试用。官方表示,该模型在真实机器人上的成功率相比前代提升了约30%,但具体数据集和训练细节尚未完全公开。

中文圈视角

对中文圈的机器人开发者来说,Gemini Robotics 2的发布是一个重要信号,但实际使用门槛不低。首先,Google的服务在中国大陆无法直接访问,开发者需要借助海外服务器或API中转,这增加了部署成本和合规风险。其次,Gemini Robotics 2目前仅开放早期访问,且大概率需要企业级申请,个人开发者很难拿到权限。

相比之下,国内已有类似方向的探索,比如智元机器人的AgiBot World模型、宇树科技的机器人控制方案,以及上海人工智能实验室的浦源·灵猿等。这些国产方案在中文场景和本地化支持上更有优势,但在通用性和跨形态适配能力上,Gemini Robotics 2目前仍处于领先地位。

对于中文用户,如果目标是快速验证机器人控制算法,可以先从国产开源模型入手;如果追求最前沿的VLA能力,则需要评估海外API的可行性和成本。另外,数据出境问题值得注意——使用Gemini Robotics 2时,机器人采集的视觉数据会传输到海外服务器,涉及敏感场景时需谨慎。

几条值得记住的细节

  • Gemini Robotics 2是VLA模型,直接输出动作指令,而非仅生成文本或图像。
  • ER 2推理层独立于动作模型,可单独用于任务规划,也可与Gemini Robotics 2组合使用。
  • 早期访问计划已开放,但仅限受邀合作伙伴,普通开发者需等待公开版本。
  • 官方称真实机器人成功率提升约30%,但未公布具体测试环境和基准。
  • 模型支持多种机器人形态,包括桌面机械臂、移动平台和人形机器人。

一句话总结

Gemini Robotics 2让机器人控制更通用,但中文开发者需权衡海外API的可用性与国产替代方案。