AI 快讯 编译自 aws_ml_blog #AWS SageMaker#NVIDIA Blackwell#模型训练优化

AWS SageMaker AI 集成 NVIDIA Blackwell GPU:训练配置优化指南与中文用户实践建议

AWS 宣布 SageMaker AI 支持 NVIDIA Blackwell GPU(P6-B200 实例),通过更大内存、新精度格式和激活检查点技术,可显著提升大模型训练效率。本文详解如何配置 batch size、序列长度和精度格式以优化吞吐量,并分析对中文开发者的实际价值。

编译发布 2026/06/25 原文发布 2026/06/25

一句话看懂

AWS SageMaker AI 现已支持 NVIDIA Blackwell GPU(P6-B200 实例),通过更大内存和新型精度格式,可让 1B-64B 参数模型训练吞吐量提升数倍,并简化分布式配置。

详细发生了什么

AWS 官方博客发布了一篇技术指南,详细说明如何在 Amazon SageMaker AI 上利用 NVIDIA Blackwell GPU 优化模型训练。Blackwell 架构(B200 180GB HBM,B300 268GB HBM)相比前代提供了更大的显存和 NVLink 5 互联(1.8 TB/s 双向带宽),以及第五代 Tensor Core 对 FP8、MXFP8、NVFP4 等低精度格式的硬件加速。

文章以单节点 8-GPU 的 P6-B200 实例为例,使用 PyTorch FSDP 分布式训练框架,测试了 1B 到 64B 参数的 transformer 模型。核心优化点包括:

  • 更大 batch size:减少梯度同步次数,提升吞吐量。
  • 简化模型分片:更大显存允许减少甚至消除模型并行,降低通信开销。
  • 更长序列长度:支持长距离依赖任务(如文档理解、代码生成)。
  • 激活检查点(Activation Checkpointing):以少量计算开销(10-30%)换取显存节省,从而支持更大 batch size。

实验数据显示,对于 1B 参数模型,使用 MXFP8 精度和 8K 序列长度时,开启激活检查点并将 batch size 从 1 提升到 16,吞吐量从约 6K tokens/sec 跃升至约 51K tokens/sec(提升约 8 倍),而峰值显存仅 22.8 GB,远低于 B200 的 180 GB 上限。

对于精度格式选择,文章建议:小模型(~14B 以下)优先调 batch size,精度收益有限;大模型(14B+)必须使用激活检查点,并可根据计算/内存瓶颈选择 FP8 或 MXFP8。NVFP4 更适合推理和大模型场景。

中文圈视角

对中文开发者来说,这条消息意味着两件事:

1. 国内用户能用吗? AWS SageMaker AI 在国内(如北京、宁夏区域)已可用,但 P6-B200 实例的可用性需确认。目前国内主流云厂商(阿里云、华为云、腾讯云)尚未提供 Blackwell GPU,因此想尝鲜的用户可能需要使用 AWS 海外区域(如美东、美西),并注意数据出境合规。如果对延迟不敏感,通过 AWS Global Accelerator 或 Direct Connect 可降低网络开销。

2. 与国产平替的对比 国内大模型训练多使用华为昇腾 910B/910C、寒武纪思元等国产 GPU,显存和生态尚不及 Blackwell。SageMaker AI 的托管训练服务(自动扩缩容、Flexible Training Plan)对国内用户也有吸引力,但成本较高。如果预算有限,可考虑 ModelScope 或阿里云 PAI 的类似服务,但硬件性能差距明显。对于追求极致训练效率的团队,Blackwell 的性价比可能更高。

3. 中文场景的具体影响

  • 长序列支持对中文文档理解(如法律合同、学术论文)和长上下文对话模型训练有利。
  • 更大 batch size 可加速中文 LLM 的预训练和微调,减少训练时间。
  • 激活检查点策略对显存受限的团队尤其有用,可降低对多节点集群的依赖。

4. 中文圈盲点 目前国内讨论多集中在模型架构和数据集,对训练基础设施的优化关注不足。Blackwell 的精度格式选择(MXFP8 vs FP8)和激活检查点的调优技巧,值得中文社区深入实践。

几条值得记住的细节

  • P6-B200 实例配备 8 块 Blackwell GPU,每块 B200 显存 180 GB,B300 达 268 GB。
  • 激活检查点可让 1B 模型 batch size 从 1 提升到 16,吞吐量从 6K 增至 51K tokens/sec。
  • 小模型(~14B 以下)通常不需要激活检查点;大模型(14B+)必须开启,否则会 OOM。
  • 低精度格式(FP8/MXFP8)主要提升计算速度而非节省显存,因为会保留高精度主权重。
  • 可通过 Flexible Training Plan 预订容量,实现可预测的访问和成本管理。

一句话总结

如果你在 AWS 上训练大模型,Blackwell 的更大显存和激活检查点策略能显著提升吞吐量并降低成本,值得立即尝试。