NVIDIA发布Alpamayo 2 Super:34B开源VLA模型,推动自动驾驶与Robotaxi商业化
NVIDIA推出Alpamayo 2 Super,一款34B参数的开源视觉-语言-动作(VLA)模型,专为自动驾驶长尾场景设计。基于Cosmos 3 Super Reasoner,支持轨迹预测、因果推理与自动标注,LingoQA得分79.2,商用许可OpenMDW-1.1。了解其技术细节、性能对比及对中文开发者的影响。
一句话看懂
NVIDIA发布Alpamayo 2 Super,一款34B参数的开源VLA模型,用于自动驾驶和Robotaxi,商用许可,性能领先。
详细发生了什么
NVIDIA正式发布Alpamayo 2 Super,这是一款34B参数的视觉-语言-动作(VLA)模型,专为自动驾驶设计,目标直指长尾事件——即那些罕见、多智能体交互的复杂场景,传统检测-预测堆栈往往难以应对。模型采用32B的视觉-语言骨干网络(基于NVIDIA Cosmos 3 Super Reasoner,并通过强化学习后训练),搭配2.3B的扩散式动作解码器。它能在一次处理全环绕摄像头视频后,同时输出规划轨迹、因果解释(Chain-of-Causation)和元动作(如让行或变道)。
权重以OpenMDW-1.1许可发布,这是Linux基金会为开放模型分发制定的宽松许可,允许微调、衍生模型和商业再分发;源代码则采用Apache 2.0。这意味着从发布第一天起,开发者即可将其用于商业用途,无需额外申请权限。NVIDIA表示,整个Alpamayo系列都将采用OpenMDW许可,此前仅限研究使用的版本现在也可直接商用。
训练数据方面,模型使用了约115,000小时的多摄像头驾驶视频,包含约370万条Chain-of-Causation轨迹注释,图像数据超过10亿张。输入为多摄像头RGB视频、文本和带时间戳的自我运动历史。轨迹API返回64个路径点,覆盖0.1至6.4秒,每个路径点包含自我坐标系XYZ和3×3旋转矩阵。
性能上,Alpamayo 2 Super在LingoQA基准上获得79.2的Lingo-Judge分数,在近40个模型中排名第一。NVIDIA测试显示,它比Qwen2.5-VL 72B高出17.0分,比Gemini 2.5 Pro高15.1分,比GPT-4o高23.2分。在规划任务上,使用AlpaSim在910个场景上的闭环评估得分为1.50 ± 0.13;在937个挑战性样本上的开环评估中,6.4秒时的minADE₆为0.911米。
模型还支持自动标注和带2D定位的视觉问答,NVIDIA称其可将专有车队数据的标注周期从数月压缩至数天。
中文圈视角
对国内开发者而言,Alpamayo 2 Super的发布有几个值得关注的要点。首先,开源商用许可(OpenMDW-1.1)意味着国内企业可以合法地将模型用于商业自动驾驶项目,无需担心授权问题,这比许多仅限研究的模型更有吸引力。不过,模型权重托管在Hugging Face上,国内访问可能需要特殊网络环境,但可以通过镜像或ModelScope等平台获取。
其次,国内自动驾驶领域已有百度Apollo、华为ADS等方案,但大多偏重感知和规划的传统架构。Alpamayo 2 Super的VLA一体化设计(轨迹+因果推理+自动标注)可能为国内厂商提供新的技术思路,尤其是在长尾场景处理上。不过,模型训练数据以海外驾驶场景为主,直接用于国内路况可能需要额外的fine-tuning和本地化数据。
另外,模型支持自动标注功能,这对国内数据标注成本高昂的现状可能是一个缓解方案,但需注意数据出境合规问题——如果使用云服务处理国内数据,需确保符合《数据安全法》要求。
几条值得记住的细节
- 模型规模:34B参数,由32B视觉-语言骨干和2.3B扩散动作解码器组成。
- 许可:OpenMDW-1.1(权重)和Apache 2.0(代码),允许商用和再分发。
- 性能:LingoQA得分79.2,AlpaSim得分1.50 ± 0.13,minADE₆ 0.911m。
- 输出:一次推理可同时生成轨迹、Chain-of-Causation解释、元动作、自动标签和定位VQA。
- 部署:在1× H100 80GB上测试,峰值内存72,115 MiB,可蒸馏用于车载推理。
一句话总结
Alpamayo 2 Super为自动驾驶提供了开源、高性能的VLA方案,国内开发者可借此加速长尾场景研究和商业化落地。