Amazon SageMaker 推出 100+ 详细推理指标和 CloudWatch Insights 仪表盘,助力生成式 AI 监控与调试
AWS 为 SageMaker 推理端点新增 100 多项详细指标,涵盖 GPU 健康、token 延迟、KV 缓存压力等,并内置 CloudWatch Insights 仪表盘。本文详解如何开启、使用这些功能,以及对中国用户监控 LLM 推理的实际意义。
一句话看懂
Amazon SageMaker AI 新增 100 多项详细推理指标和 CloudWatch Insights 仪表盘,帮助团队快速定位 LLM 推理端点的 GPU 压力、KV 缓存瓶颈和跨可用区流量不均等问题。
详细发生了什么
Amazon SageMaker AI 宣布为实时推理端点推出超过 100 项详细可观测性指标,并内置 SageMaker Insights 仪表盘到 CloudWatch 控制台。这些指标覆盖 GPU 利用率、token 级延迟(TTFT、ITL)、KV 缓存压力、可用区流量分布、推理组件放置和冷启动诊断等关键信号。
新功能支持两种端点架构:单模型端点(SME)和推理组件端点(IC)。IC 端点是生产环境推荐方案,允许多个模型共享 GPU 实例并独立扩缩容。所有指标通过 OpenTelemetry 原生格式发送到 CloudWatch,仪表盘使用 PromQL 查询,提供 Performance、Capacity、Reliability 三个视图。
新端点默认开启详细指标(EnableDetailedObservability 默认为 true),现有端点需手动启用。用户还可以通过 MetricsPublishFrequencyInSeconds 调整发布频率(默认 60 秒),并开启 OTel 富化以让经典指标(如 Invocations、ModelLatency)也出现在仪表盘中。
中文圈视角
对于中国 AI 团队,尤其是使用 AWS 中国区或通过海外账号部署 LLM 推理的用户,这个功能直接解决了生产环境中的几个痛点:
- GPU 利用率可视化:国内很多团队仍依赖 nvidia-smi 手动监控,SageMaker 的 per-accelerator 指标和 KV 缓存压力面板可以自动呈现瓶颈,减少排查时间。
- 多模型混部成本优化:IC 端点支持多个模型共享 GPU,适合国内常见的“一个端点服务多个业务线”场景。仪表盘中的 Capacity 视图能清晰展示每个推理组件的资源占用,帮助优化实例数量。
- 与国产平台的对比:国内阿里云 PAI、华为云 ModelArts 等也提供推理监控,但 SageMaker 的 OTel + PromQL 原生支持让数据更容易接入 Grafana、Datadog 等现有工具。对于已使用 AWS 的团队,无需额外搭建监控栈。
- 合规注意:如果使用 AWS 中国区(北京/宁夏),需确认 CloudWatch 指标数据是否出境。对于金融、医疗等敏感行业,建议开启 OTel 富化时注意资源标签中是否包含敏感信息。
一个尚未被广泛讨论的盲点是:这些指标对 vLLM 和 SGLang 框架的依赖——如果使用其他推理框架(如 TensorRT-LLM),token 级指标可能不可用。国内很多团队使用自定义推理栈,需要提前验证兼容性。
几条值得记住的细节
- 新端点默认开启详细指标,无需额外代码;现有端点需创建新配置并更新端点。
- 指标发布频率默认 60 秒,可调至更低(如 30 秒)实现近实时监控。
- 仪表盘位于 CloudWatch 控制台 → Infrastructure Monitoring → SageMaker Insights。
- 经典指标(如 Invocations)需在 CloudWatch Settings 中开启 OTel 富化才能被 PromQL 查询。
- 仅 vLLM 和 SGLang 容器框架支持 token 级延迟指标(TTFT、ITL)。
一句话总结
如果你用 SageMaker 部署 LLM 推理,这个更新能让你从“黑盒监控”升级到“白盒诊断”,尤其适合多模型混部和 GPU 成本敏感的场景。