AI 快讯 编译自 aws_ml_blog #模型推理#AWS#KV缓存

Amazon SageMaker HyperPod 分层 KV 缓存:用 Curvine 降低 LLM 推理成本并加速 TTFT

AWS 推出 SageMaker HyperPod 分层 KV 缓存方案,结合 Curvine 分布式文件系统,将缓存扩展到 NVMe 池,实现跨副本缓存复用,最高提升 2.7 倍 TTFT,并支持在低成本 G6e 实例上运行大模型。了解架构、实现与基准测试结果。

编译发布 2026/08/12 原文发布 2026/08/12

一句话看懂

AWS 在 SageMaker HyperPod 上推出分层 KV 缓存架构,利用 Curvine 将缓存扩展到共享 NVMe 池,实现跨副本缓存复用,最高提升 2.7 倍 TTFT,并降低推理成本。

详细发生了什么

大规模 LLM 推理面临 KV 缓存权衡:要么为增长的 KV 缓存购买超大 GPU 实例,要么忍受重复计算导致的慢速首 token 延迟(TTFT)。AWS 在 SageMaker HyperPod 上构建了分层 KV 缓存,将缓存层级从 GPU 和 CPU 内存扩展到共享分布式 NVMe 池,基于 HyperPod 的 Managed Tiered KV Cache 和 Intelligent Routing 能力,并引入轻量级分布式缓存文件系统 Curvine 作为共享 L2 层(GPU 到 CPU 到共享 NVMe)。

该架构分为三层:L0(GPU HBM)使用 vLLM 原生 paged-attention,存储最热 KV 块;L1(CPU 内存)通过 LMCache 在 GPU 块被驱逐时暂存到主机 DRAM;L2(共享分布式 NVMe 池)由 Curvine 将各节点本地 NVMe 聚合为单一命名空间,通过 FUSE 挂载为 ReadWriteMany PVC,使所有推理 Pod 共享缓存。智能路由器根据前缀树或 KV 状态将请求分发到最可能命中缓存的副本。

测试部署实现了高达 100% 的跨 Pod 缓存命中率,TTFT 提升最高 2.7 倍,跨节点 L2 读取延迟约 56 ms(针对约 1,900 token 的提示)。该架构使原本需要 P5 实例的工作负载可在更经济的 G6e 实例上运行,降低每个端点的成本。

中文圈视角

对于中文用户,这一方案直接关系到部署 Qwen、DeepSeek 等国产模型的成本与体验。国内云厂商(如阿里云、腾讯云)提供类似托管推理服务,但 KV 缓存优化通常不透明。此架构的亮点在于将缓存共享化,特别适合多轮对话、RAG 等前缀重叠高的场景。若使用 AWS 中国区或海外区,可参考此方案优化成本;若使用国内云,可关注其是否提供类似的分层缓存或智能路由功能。此外,Curvine 作为开源项目,也可在自建 Kubernetes 集群中部署,实现跨节点缓存共享,但需注意数据安全与合规要求。

几条值得记住的细节

  • 分层缓存:L0 GPU、L1 CPU、L2 共享 NVMe,通过 LMCache 和 Curvine 实现。
  • 智能路由:支持 prefix-aware、kv-aware、round-robin 三种策略,默认 prefix-aware。
  • 配置方式:在 InferenceEndpointConfig CRD 中设置 enableL1Cache、enableL2Cache、l2CacheBackend 等。
  • 当前限制:l2CacheBackend 仅原生支持 redis 或 tieredstorage,需通过环境变量补丁指向 Curvine FUSE 挂载。
  • 适用场景:提示词重叠率超过 40% 时效果显著,如共享系统提示词或 RAG 上下文。

一句话总结

若你部署 LLM 推理且提示词重叠高,此方案可显著降低 TTFT 和成本,值得在 AWS 上尝试。