Amazon SageMaker AI 推出容器缓存,生成式 AI 模型扩展速度提升 2 倍
AWS 宣布 SageMaker AI 推理新增容器镜像缓存功能,在扩展新实例时消除镜像拉取延迟,端到端启动时间最多缩短 51%。对中文用户而言,这意味着使用 SageMaker 部署大模型时冷启动问题得到显著缓解,尤其适合需要快速响应的生成式 AI 应用。
一句话看懂
AWS 为 SageMaker AI 推理推出容器镜像缓存,新实例扩展时镜像拉取时间降为 0,端到端延迟最高降低 51%。
详细发生了什么
AWS 宣布 SageMaker AI 推理新增容器镜像缓存(container caching)功能,这是其自动扩展优化系列的第三步。在生成式 AI 模型扩展场景中,新实例启动时最大的瓶颈之一是容器镜像下载——例如 Qwen3-8B 模型搭配 LMI 容器(17.7 GB 压缩),镜像拉取耗时 333 秒。容器缓存将这部分时间降为 0,同时因为不再与模型权重下载争抢带宽,模型下载时间也从 168 秒降至 77 秒,端到端启动时间从 525 秒缩短至 258 秒,提升约 51%。
该功能适用于所有基于加速器实例类型的 SageMaker 推理端点,无需修改容器或手动配置,自动启用。如果缓存不可用,系统会自动回退到从 Amazon ECR 拉取镜像,保证扩展不中断。
中文圈视角
对于国内使用 AWS 部署大模型推理的用户来说,容器缓存是一个实实在在的痛点解决。生成式 AI 模型(如 Qwen、Llama 等)的容器镜像通常超过 10 GB,在流量突增时新实例的冷启动时间往往长达数分钟,严重影响用户体验。容器缓存配合此前推出的亚分钟级指标(检测速度提升 6 倍)和实例存储缓存,可以将扩展延迟从分钟级降至秒级。
不过需要注意:该功能目前仅支持加速器实例类型(如 GPU 实例),且依赖 AWS 基础设施。对于使用国内云平台(如阿里云 PAI、华为云 ModelArts)的用户,目前尚无类似的原生容器缓存方案,但可以借鉴思路——通过预置镜像到本地存储或使用镜像加速工具(如 Dragonfly)来优化。另外,数据合规方面,容器缓存仅在单客户端点内隔离,删除端点后缓存自动清除,符合国内对数据驻留和隔离的要求。
几条值得记住的细节
- 容器缓存自动启用,无需修改容器或配置,支持所有 Amazon ECR 中的镜像。
- 以 Qwen3-8B + LMI 容器为例,端到端启动时间从 525 秒降至 258 秒,提升 51%。
- 早期客户实测显示,P50 启动时间改善幅度在 38% 到 65% 之间,具体取决于实例和镜像大小。
- 缓存与亚分钟级指标、实例存储缓存可叠加使用,进一步消除扩展路径上的多个延迟来源。
- 支持所有商业 AWS 区域,具体支持的实例类型和区域请查阅官方文档。
一句话总结
容器缓存让 SageMaker 推理扩展不再被镜像下载拖后腿,生成式 AI 应用应对流量高峰时更从容。