AWS 推出 P-EAGLE 并行推测解码,在 SageMaker AI 上实现最高 1.69 倍推理加速
AWS 开源并行推测解码技术 P-EAGLE,并在 SageMaker JumpStart 中集成,支持 Qwen3-Coder、Gemma-4 等模型。相比 EAGLE-3,吞吐量提升最高 1.69 倍,无需手动训练草稿模型。本文介绍部署步骤与性能基准。
一句话看懂
AWS 推出 P-EAGLE,一种并行推测解码技术,在 SageMaker AI 上实现最高 1.69 倍推理加速,无需额外训练草稿模型。
详细发生了什么
大语言模型规模不断增长,推理吞吐量和延迟成为企业部署的关键瓶颈。推测解码(Speculative Decoding)通过轻量草稿模型预测后续 token,再由目标模型一次性验证,是一种有效加速策略。但现有框架如 EAGLE 的草稿 token 是自回归生成的——每个 token 依赖前一个输出,生成 K 个候选需要 K 次顺序前向传播,延迟随推测深度线性增长。
AWS 发明的 P-EAGLE(Parallel-EAGLE)彻底改变了这一局面:它通过可学习的占位符,在单次前向传播中同时预测所有草稿 token,将推测解码从迭代过程变为完全并行操作。例如,目标模型生成“Paris”后,EAGLE 需要 4 次顺序传播才能预测后续 4 个 token,而 P-EAGLE 一次完成。
在 NVIDIA B200 GPU 上对 Qwen3-Coder-30B-A3B-Instruct 的测试显示,P-EAGLE 相比 EAGLE-3 最高提速 1.69 倍,相比无推测解码的基线最高提速 4.17 倍。目前,SageMaker JumpStart 已原生支持 P-EAGLE,首批包含 GPT-OSS-120B、GPT-OSS-20B、Qwen3-Coder-30B-A3B-Instruct、Gemma-4-31B-IT 四个模型,用户无需手动训练草稿模型或配置复杂 CUDA 内核。
中文圈视角
P-EAGLE 对中文开发者意味着几个关键点:
-
部署门槛极低:通过 SageMaker JumpStart 一键部署,无需自行训练草稿模型或编写分布式推理代码。对于国内使用 AWS 的企业,这大大降低了推测解码的落地成本。
-
国产模型生态兼容:首批支持的 Qwen3-Coder 是阿里通义千问系列,说明 P-EAGLE 对中文模型友好。国内开发者可以基于 Qwen 系列快速获得推理加速。
-
与国产平台对比:国内类似服务如阿里云 PAI、华为云 ModelArts 目前尚未提供一键推测解码部署。P-EAGLE 的开源特性(AWS 已贡献到开源社区)意味着国内平台也可能跟进集成,但短期内 AWS 仍是唯一提供开箱即用并行推测解码的云厂商。
-
成本与合规:SageMaker 需使用 AWS 海外区域,国内用户需注意数据出境合规。如果对延迟敏感,可考虑 AWS 中国区域(北京/宁夏)是否支持 P-EAGLE,目前尚未明确。
几条值得记住的细节
- P-EAGLE 通过并行草稿将推测解码的延迟开销从 O(K) 降为 O(1),K 为推测 token 数。
- 在 HumanEval 基准上,P-EAGLE 相比 EAGLE-3 最高提速 1.22x,相比基线提速 3.97x。
- 首批支持 4 个模型:GPT-OSS-120B、GPT-OSS-20B、Qwen3-Coder-30B-A3B-Instruct、Gemma-4-31B-IT。
- 部署时只需在环境变量中设置
"parallel_drafting": true,无需额外代码。 - P-EAGLE 已开源,可在 GitHub 上获取,但 SageMaker 集成提供了最便捷的部署体验。
一句话总结
P-EAGLE 让推测解码真正并行化,AWS 用户现在可以一键部署,获得最高 1.69 倍推理加速,尤其适合高并发生产场景。