AI 快讯 编译自 aws_ml_blog #AWS#SageMaker HyperPod#企业推理

Amazon SageMaker HyperPod 新增数据捕获、Hugging Face 直连、NVMe 加速等企业级推理功能

AWS 为 SageMaker HyperPod 推出五项新能力:多层级推理数据捕获、从 Hugging Face Hub 直接部署模型、本地 NVMe 加载加速冷启动、自动 Route 53 DNS 管理以及 Pod 级 IAM 权限控制。本文详解这些功能如何提升企业级推理的可观测性、性能和安全性。

编译发布 2026/07/09 原文发布 2026/07/09

一句话看懂

AWS 为 SageMaker HyperPod 新增五项企业推理功能:数据捕获、Hugging Face 直连、NVMe 加速、自动 DNS 和 Pod 级 IAM,提升可观测性、部署效率和安全性。

详细发生了什么

Amazon SageMaker HyperPod 推出五项新能力,旨在解决企业大规模生成式 AI 推理中的痛点:

  1. 多层级数据捕获:可在 SageMaker 端点、Application Load Balancer 和模型 Pod 三个层级独立配置数据捕获,记录推理请求和响应数据,用于监控、调试和模型改进。支持自定义采样率、缓冲设置和 payload 大小限制,数据写入 S3。

  2. Hugging Face Hub 直接部署:无需预先将模型权重上传到 S3 或 FSx,可直接从 Hugging Face Hub 部署模型,支持门控模型(通过 tokenSecretRef)、版本锁定(commitSHA)和 token 隔离。兼容 vLLM、TGI 和 SGLang 运行时。

  3. 本地 NVMe 模型加载:从节点本地 NVMe 存储加载模型权重,显著减少冷启动延迟,并自动回退到云存储。

  4. 自动 Route 53 DNS:HyperPod 自动管理自定义域名的 DNS 记录,简化域名配置。

  5. Pod 级 IAM 权限:通过自定义服务账户实现细粒度的 Pod 级 AWS IAM 权限控制,增强安全边界。

这些功能通过声明式 CRD 配置实现,无需额外基础设施操作。

中文圈视角

对于中国企业和开发者,这些功能有几点值得关注:

  • Hugging Face 直连:国内用户访问 Hugging Face Hub 可能受限,需要代理或使用镜像站(如 hf-mirror.com)。AWS 中国区域(北京、宁夏)是否支持此功能尚不明确,建议使用国内 ModelScope 或本地存储作为替代方案。
  • 数据捕获与合规:多层级数据捕获功能将推理数据存储在 S3,涉及数据出境问题。国内企业需注意《数据安全法》要求,考虑使用 AWS 中国区域或本地部署方案。
  • NVMe 加速:本地 NVMe 加载对冷启动优化明显,但国内云厂商(阿里云 PAI、华为云 ModelArts)已有类似 GPU 实例本地盘方案,竞争激烈。
  • 国产平替:百度百舸、阿里云 PAI 等平台也提供推理服务,但 HyperPod 的深度可观测性和 Pod 级 IAM 是差异化优势,适合对安全和审计要求高的金融、政务场景。

几条值得记住的细节

  • 数据捕获支持三个层级:端点(Tier 1)、负载均衡(Tier 2)、模型 Pod(Tier 3),可任意组合启用。
  • Tier 3 默认捕获 100% 输入输出,支持自定义采样率和 payload 大小上限(最大 1024 KB)。
  • Hugging Face 模型部署需要创建包含 API token 的 Kubernetes Secret,支持门控模型和版本锁定。
  • NVMe 加载自动回退到云存储,无需手动配置。
  • Route 53 DNS 自动管理,无需手动创建记录。

一句话总结

HyperPod 新功能让企业推理更易观测、更快部署、更安全,但国内用户需注意网络和合规问题。