Amazon SageMaker HyperPod 新增数据捕获、Hugging Face 直连、NVMe 加速等企业级推理功能
AWS 为 SageMaker HyperPod 推出五项新能力:多层级推理数据捕获、从 Hugging Face Hub 直接部署模型、本地 NVMe 加载加速冷启动、自动 Route 53 DNS 管理以及 Pod 级 IAM 权限控制。本文详解这些功能如何提升企业级推理的可观测性、性能和安全性。
一句话看懂
AWS 为 SageMaker HyperPod 新增五项企业推理功能:数据捕获、Hugging Face 直连、NVMe 加速、自动 DNS 和 Pod 级 IAM,提升可观测性、部署效率和安全性。
详细发生了什么
Amazon SageMaker HyperPod 推出五项新能力,旨在解决企业大规模生成式 AI 推理中的痛点:
-
多层级数据捕获:可在 SageMaker 端点、Application Load Balancer 和模型 Pod 三个层级独立配置数据捕获,记录推理请求和响应数据,用于监控、调试和模型改进。支持自定义采样率、缓冲设置和 payload 大小限制,数据写入 S3。
-
Hugging Face Hub 直接部署:无需预先将模型权重上传到 S3 或 FSx,可直接从 Hugging Face Hub 部署模型,支持门控模型(通过 tokenSecretRef)、版本锁定(commitSHA)和 token 隔离。兼容 vLLM、TGI 和 SGLang 运行时。
-
本地 NVMe 模型加载:从节点本地 NVMe 存储加载模型权重,显著减少冷启动延迟,并自动回退到云存储。
-
自动 Route 53 DNS:HyperPod 自动管理自定义域名的 DNS 记录,简化域名配置。
-
Pod 级 IAM 权限:通过自定义服务账户实现细粒度的 Pod 级 AWS IAM 权限控制,增强安全边界。
这些功能通过声明式 CRD 配置实现,无需额外基础设施操作。
中文圈视角
对于中国企业和开发者,这些功能有几点值得关注:
- Hugging Face 直连:国内用户访问 Hugging Face Hub 可能受限,需要代理或使用镜像站(如 hf-mirror.com)。AWS 中国区域(北京、宁夏)是否支持此功能尚不明确,建议使用国内 ModelScope 或本地存储作为替代方案。
- 数据捕获与合规:多层级数据捕获功能将推理数据存储在 S3,涉及数据出境问题。国内企业需注意《数据安全法》要求,考虑使用 AWS 中国区域或本地部署方案。
- NVMe 加速:本地 NVMe 加载对冷启动优化明显,但国内云厂商(阿里云 PAI、华为云 ModelArts)已有类似 GPU 实例本地盘方案,竞争激烈。
- 国产平替:百度百舸、阿里云 PAI 等平台也提供推理服务,但 HyperPod 的深度可观测性和 Pod 级 IAM 是差异化优势,适合对安全和审计要求高的金融、政务场景。
几条值得记住的细节
- 数据捕获支持三个层级:端点(Tier 1)、负载均衡(Tier 2)、模型 Pod(Tier 3),可任意组合启用。
- Tier 3 默认捕获 100% 输入输出,支持自定义采样率和 payload 大小上限(最大 1024 KB)。
- Hugging Face 模型部署需要创建包含 API token 的 Kubernetes Secret,支持门控模型和版本锁定。
- NVMe 加载自动回退到云存储,无需手动配置。
- Route 53 DNS 自动管理,无需手动创建记录。
一句话总结
HyperPod 新功能让企业推理更易观测、更快部署、更安全,但国内用户需注意网络和合规问题。