AI 快讯 编译自 nvidia_developer #模型训练#推理优化#能效

NVIDIA 全栈推理与训练优化:AI 工厂能效提升,每瓦特性能决定 Token 成本

NVIDIA 发布全栈推理与训练优化方案,从硬件、软件到系统层面提升 AI 工厂能效。电力成本占运营支出 40%,每瓦特性能直接影响 Token 成本。本文详解优化策略及对中文圈用户的影响。

编译发布 2026/06/23 原文发布 2026/06/23

一句话看懂

NVIDIA 提出全栈优化方案,从硬件、软件到系统层面提升 AI 工厂能效,每瓦特性能直接决定 Token 成本。

详细发生了什么

NVIDIA 在最新博客中强调,电力成本可占 AI 工厂运营支出(OpEx)的 40%。每个瓦特都被用于开销、数据摄取、训练或为客户生成 token。大多数站点受限于区域供电的固定功率水平。在此条件下,性能每瓦特成为关键能效指标,直接转化为 token 成本。

NVIDIA 提出的全栈优化涵盖硬件、软件和系统层面:硬件上采用更高效的 GPU(如 H100/B200)和液冷散热;软件层面通过 NVIDIA TensorRT-LLM 优化推理引擎,支持 FP8/INT4 量化,以及通过 NVIDIA NeMo 框架优化训练流程,减少冗余计算;系统层面则通过 NVIDIA DGX SuperPOD 架构实现更优的功率分配和散热管理。此外,NVIDIA 还推出了动态功率管理工具,可根据负载自动调整 GPU 频率和电压,进一步提升能效。

中文圈视角

对于中文圈用户,NVIDIA 的优化方案直接关系到使用成本。国内 AI 厂商(如百度、阿里、腾讯)和创业公司(如 DeepSeek、智谱)大量部署 NVIDIA GPU,电力成本是运营大头。这些优化措施能降低 token 生成成本,进而可能降低 API 调用价格。但需注意,国内用户可能面临硬件获取限制(如高端 GPU 出口管制),部分优化需依赖最新硬件(如 H100),而国产 GPU(如华为昇腾)尚无法完全对标。不过,软件层面的优化(如量化、动态功率管理)可部分迁移至国产平台。此外,国内数据中心普遍面临电力配额紧张,能效优化有助于在有限电力下输出更多 token,对大规模模型部署尤为重要。

几条值得记住的细节

  • 电力成本占 AI 工厂 OpEx 的 40%,是最大单项支出。
  • 性能每瓦特是核心能效指标,直接决定 token 成本。
  • 硬件优化包括更高效 GPU(H100/B200)和液冷散热。
  • 软件优化通过 TensorRT-LLM 和 NeMo 框架实现,支持 FP8/INT4 量化。
  • 动态功率管理工具可根据负载调整 GPU 频率和电压。

一句话总结

NVIDIA 的全栈能效优化将直接降低 AI 工厂的 token 成本,对国内用户意味着更便宜的 API 调用和更高效的模型部署。