英伟达发布Cosmos 3 Edge:4B参数开放世界模型,在设备端推理并生成机器人动作
英伟达推出Cosmos 3 Edge,一个4B参数的开放世界模型,专为边缘设备设计。它能帮助机器人和视觉AI代理实时理解环境、推理并生成动作,无需云端。本文详解其架构、性能、部署场景及对中文圈开发者与企业的意义。
一句话看懂
英伟达发布Cosmos 3 Edge,一个4B参数的开放世界模型,可在Jetson等边缘设备上实时推理并生成机器人动作。
详细发生了什么
英伟达于2026年7月20日在Hugging Face上发布了Cosmos 3 Edge。这是Cosmos 3系列中最小的模型,参数为4B。此前该系列已有16B的Nano和64B的Super版本,于2026年5月31日在GTC台北发布。Edge专为边缘设备设计,目标是在内存受限的系统上实现数据中心级别的性能。这些系统包括工厂、仓库、医院中的机器人。
Cosmos 3 Edge采用Mixture-of-Transformers架构,包含两个transformer tower。自回归tower处理视觉和文本token,用于理解和推理。扩散tower处理视觉、音频和动作token,用于预测、生成和神经模拟。两个tower共享多模态注意力层,对齐语言、视频、音频和动作信息。模型支持多种具身形态,包括车辆、相机、单臂机器人、双臂机器人、人形机器人等。它通过统一的动作表示(平移、旋转、操作状态)将像素变化与物理运动关联。
作为策略模型,Cosmos 3 Edge可以预测动作及其视觉结果,也可以从结果反推动作。它支持640×360控制分辨率,在NVIDIA Jetson Thor上每次推理生成32个动作,实现15 Hz实时控制。生成方面支持256p和480p分辨率,12-30 fps,50-150帧。开发者可在约一天内针对特定具身形态和传感器集进行后训练。
中文圈视角
Cosmos 3 Edge对中文圈开发者意味着什么?首先,模型完全开源(Linux Foundation OpenMDW-1.1许可),可在Hugging Face下载,无需梯子即可访问。但部署需要NVIDIA硬件(RTX 3070起步,Jetson T2000/T3000等)。国产替代如华为昇腾、瑞芯微等目前缺乏类似级别的开放世界模型,国内机器人企业可能需依赖英伟达生态。
在应用场景上,Cosmos 3 Edge特别适合国内制造业、仓储物流和医疗机器人。例如,工厂中的机械臂可本地实时推理,避免云端延迟和数据出境问题。国内监管要求数据不出境,边缘计算天然符合合规需求。不过,模型对中文场景的适配(如中文指令理解)尚未明确,开发者需自行微调。
一个中文圈尚未讨论的盲点是:Cosmos 3 Edge的“世界模型”能力可能被低估。它不仅是机器人策略模型,还能用于自动驾驶、无人机、AR/VR等场景。国内类似工作(如上海AI Lab的UniPi)多聚焦于视频预测,而Cosmos 3 Edge将推理、生成和动作控制统一,可能加速具身智能落地。
几条值得记住的细节
- Cosmos 3 Edge参数为4B,其中reasoner部分为2B dense transformer,基于Qwen3-VL兼容的消息格式。
- 支持多种具身形态:相机运动(9D)、自动驾驶(9D)、单臂机器人(10D)、双臂机器人(20D)、人形机器人(29D)等。
- 在NVIDIA Jetson Thor上实现15 Hz实时控制,每次推理生成32个动作。
- 后训练可在约一天内完成,使用小规模H100集群或DGX Station。
- 模型发布于Hugging Face,许可为Linux Foundation OpenMDW-1.1。
一句话总结
Cosmos 3 Edge让机器人开发者能在边缘设备上获得世界模型级别的推理能力,降低对云端的依赖,尤其适合国内注重数据合规的工业场景。