NVIDIA GB300 NVL72 部署 Qwen3.8-Max:2.4T 参数 MoE 模型可配置推理,开源生态新高度
阿里发布 Qwen3.8-Max 开源权重,2.4T 总参数、95B 激活参数,NVIDIA 展示在 GB300 NVL72 上部署与可配置推理方案。了解模型架构、性能优势及对中文开发者的实际意义。
一句话看懂
阿里开源 Qwen3.8-Max(Qwen3.8-2.4T-A95B),2.4T 总参数 MoE 模型,NVIDIA 展示其在 GB300 NVL72 上的部署与可配置推理方案。
详细发生了什么
阿里发布了其最大开源权重模型 Qwen3.8-Max(正式名 Qwen3.8-2.4T-A95B),将接近前沿的能力带入开源生态。该模型总参数达 2.4T,但每个 token 仅激活 95B 参数,采用细粒度混合专家(MoE)架构,并混合了全注意力和线性注意力机制,context window 达到 1M token。
NVIDIA 在其官方博客中详细介绍了如何在 GB300 NVL72 平台上高效部署这一庞然大物。GB300 NVL72 是 NVIDIA 新一代 AI 服务器,配备 72 个 GPU 和 576 个 CPU 核心,专为超大规模模型设计。NVIDIA 展示了通过其 NeMo 框架和 TensorRT-LLM 推理引擎,实现模型的分布式加载和推理优化,并支持可配置的推理模式——用户可以根据任务需求调整推理深度(如快速响应或深度思考),在性能和效果之间灵活取舍。
这一部署方案利用了模型稀疏激活的特性,通过智能的专家并行和注意力机制优化,显著降低推理延迟和显存占用。NVIDIA 还提供了详细的性能基准数据,显示在 GB300 NVL72 上,Qwen3.8-Max 的吞吐量相比传统稠密模型有数倍提升。
中文圈视角
对于中文开发者而言,Qwen3.8-Max 的开源意义重大。首先,这是阿里继 Qwen2.5 系列后又一力作,2.4T 参数规模直接对标国际顶尖闭源模型(如 GPT-5 级别),但权重完全开放,意味着国内团队可以在私有环境部署,避免数据出境风险,满足金融、政务等敏感行业的合规要求。
其次,NVIDIA 的部署方案主要针对 GB300 NVL72 这类高端硬件,国内大多数开发者难以企及。但好消息是,Qwen3.8-Max 的 MoE 架构使得它在消费级 GPU(如 RTX 4090)上也能以量化形式运行(激活参数仅 95B),社区已有相关讨论。相比之下,DeepSeek-V3 同样采用 MoE,但 Qwen3.8-Max 的 context window 更长,且支持可配置推理,在长文档处理、复杂推理任务上可能更具优势。
不过,中文用户需注意:模型权重虽开源,但训练细节和完整技术报告尚未完全公开,且模型可能包含中文内容安全过滤机制,使用时应遵守当地法规。此外,国内云服务商(如阿里云、华为云)预计会很快推出托管服务,降低部署门槛。
几条值得记住的细节
- 模型总参数 2.4T,激活参数 95B,采用细粒度 MoE 架构,混合全注意力和线性注意力。
- context window 长达 1M token,可处理超长文档和复杂对话。
- NVIDIA 在 GB300 NVL72(72 GPU)上展示了部署方案,支持可配置推理模式。
- 推理优化基于 NeMo 和 TensorRT-LLM,利用稀疏激活特性提升吞吐量。
- 权重已开源,但训练细节未完全公开,国内云服务商预计将推出托管服务。
一句话总结
Qwen3.8-Max 开源让中文开发者有机会用上接近前沿的大模型,但部署成本高,建议关注云端托管或量化方案。