AI 快讯 编译自 aws_ml_blog #推理加速#AWS SageMaker#推测解码

AWS 推出 P-EAGLE 并行推测解码,在 SageMaker AI 上实现最高 1.69 倍推理加速

AWS 开源并行推测解码技术 P-EAGLE,并在 SageMaker JumpStart 中集成,支持 Qwen3-Coder、Gemma-4 等模型。相比 EAGLE-3,吞吐量提升最高 1.69 倍,无需手动训练草稿模型。本文介绍部署步骤与性能基准。

编译发布 2026/06/16 原文发布 2026/06/16

一句话看懂

AWS 推出 P-EAGLE,一种并行推测解码技术,在 SageMaker AI 上实现最高 1.69 倍推理加速,无需额外训练草稿模型。

详细发生了什么

大语言模型规模不断增长,推理吞吐量和延迟成为企业部署的关键瓶颈。推测解码(Speculative Decoding)通过轻量草稿模型预测后续 token,再由目标模型一次性验证,是一种有效加速策略。但现有框架如 EAGLE 的草稿 token 是自回归生成的——每个 token 依赖前一个输出,生成 K 个候选需要 K 次顺序前向传播,延迟随推测深度线性增长。

AWS 发明的 P-EAGLE(Parallel-EAGLE)彻底改变了这一局面:它通过可学习的占位符,在单次前向传播中同时预测所有草稿 token,将推测解码从迭代过程变为完全并行操作。例如,目标模型生成“Paris”后,EAGLE 需要 4 次顺序传播才能预测后续 4 个 token,而 P-EAGLE 一次完成。

在 NVIDIA B200 GPU 上对 Qwen3-Coder-30B-A3B-Instruct 的测试显示,P-EAGLE 相比 EAGLE-3 最高提速 1.69 倍,相比无推测解码的基线最高提速 4.17 倍。目前,SageMaker JumpStart 已原生支持 P-EAGLE,首批包含 GPT-OSS-120B、GPT-OSS-20B、Qwen3-Coder-30B-A3B-Instruct、Gemma-4-31B-IT 四个模型,用户无需手动训练草稿模型或配置复杂 CUDA 内核。

中文圈视角

P-EAGLE 对中文开发者意味着几个关键点:

  1. 部署门槛极低:通过 SageMaker JumpStart 一键部署,无需自行训练草稿模型或编写分布式推理代码。对于国内使用 AWS 的企业,这大大降低了推测解码的落地成本。

  2. 国产模型生态兼容:首批支持的 Qwen3-Coder 是阿里通义千问系列,说明 P-EAGLE 对中文模型友好。国内开发者可以基于 Qwen 系列快速获得推理加速。

  3. 与国产平台对比:国内类似服务如阿里云 PAI、华为云 ModelArts 目前尚未提供一键推测解码部署。P-EAGLE 的开源特性(AWS 已贡献到开源社区)意味着国内平台也可能跟进集成,但短期内 AWS 仍是唯一提供开箱即用并行推测解码的云厂商。

  4. 成本与合规:SageMaker 需使用 AWS 海外区域,国内用户需注意数据出境合规。如果对延迟敏感,可考虑 AWS 中国区域(北京/宁夏)是否支持 P-EAGLE,目前尚未明确。

几条值得记住的细节

  • P-EAGLE 通过并行草稿将推测解码的延迟开销从 O(K) 降为 O(1),K 为推测 token 数。
  • 在 HumanEval 基准上,P-EAGLE 相比 EAGLE-3 最高提速 1.22x,相比基线提速 3.97x。
  • 首批支持 4 个模型:GPT-OSS-120B、GPT-OSS-20B、Qwen3-Coder-30B-A3B-Instruct、Gemma-4-31B-IT。
  • 部署时只需在环境变量中设置 "parallel_drafting": true,无需额外代码。
  • P-EAGLE 已开源,可在 GitHub 上获取,但 SageMaker 集成提供了最便捷的部署体验。

一句话总结

P-EAGLE 让推测解码真正并行化,AWS 用户现在可以一键部署,获得最高 1.69 倍推理加速,尤其适合高并发生产场景。