DFlash 投机解码:并行生成整块 Token,NVIDIA Blackwell 上吞吐量提升 15 倍
UC San Diego 团队提出 DFlash,用轻量块扩散模型替代自回归草稿模型,实现并行生成整块 Token。在 Qwen3-8B 上实现 6.08 倍无损加速,NVIDIA Blackwell 上吞吐量提升 15 倍。支持 SGLang、vLLM、TensorRT-LLM,已开源 20 个检查点。
一句话看懂
UC San Diego 团队提出 DFlash,用轻量块扩散模型并行生成整块 Token,在 NVIDIA Blackwell 上实现最高 15 倍吞吐量提升,无损且开源。
详细发生了什么
自回归大模型逐 Token 生成,GPU 利用率低、推理慢。投机解码(Speculative Decoding)用小型草稿模型预测未来 Token,再由目标模型并行验证,但现有方法(如 EAGLE-3)仍逐 Token 生成,实际加速仅 2–3 倍。
UC San Diego z-lab 团队提出的 DFlash 改用轻量块扩散模型(block diffusion model)作为草稿器,一次前向传播生成整块 Token,再由目标模型并行验证。论文报告在 Qwen3-8B 上平均 4.86 倍无损加速,最高 6.08 倍(MATH-500),比 EAGLE-3 快 2.5 倍以上。NVIDIA 工程团队在 Blackwell DGX B300 系统上测试 gpt-oss-120b,在固定交互延迟下吞吐量提升 15 倍。
DFlash 的核心创新是“目标模型最了解自己”:从目标模型多层提取隐藏状态,融合为紧凑的目标上下文特征,并通过 KV 注入(KV injection)注入到草稿模型的每一层 Key/Value 投影中,使接受长度随草稿深度扩展。草稿模型仅 5 层(Qwen3-Coder 为 8 层),远小于此前扩散方法使用的 7B 草稿器。
DFlash 已开源 20 个检查点,支持 Transformers、vLLM、SGLang 和 TensorRT-LLM。在 vLLM 中只需将 EAGLE-3 配置替换为 DFlash 即可,无需修改应用代码。
中文圈视角
DFlash 对中文用户和开发者有直接价值:
- 国产模型适配:论文测试了 Qwen3-8B(阿里通义千问系列),并提供了 Qwen3-4B、Qwen3-Coder 等检查点。国内使用 DeepSeek、Qwen 等模型的团队可直接用 DFlash 加速推理,无需额外训练。
- 部署门槛低:DFlash 支持 vLLM 和 SGLang,这两个框架在国内 AI 服务中广泛使用。替换配置即可生效,无需改代码。但需注意,DFlash 的 KV 注入依赖目标模型内部状态,目前仅支持 Qwen3 和 LLaMA-3.1 系列,其他模型需自行适配。
- 与国产框架对比:国内类似工作如 ModelScope 的投机解码方案通常使用小模型逐 Token 草稿,加速比约 2–3 倍。DFlash 的块扩散方法在加速比上有明显优势,但需要 NVIDIA Blackwell 或 B200 等高端 GPU 才能发挥最大效果。
- 监管与合规:DFlash 本身不涉及数据出境,但使用 NVIDIA TensorRT-LLM 时需注意其商业许可。开源检查点托管在 Hugging Face,国内可通过 ModelScope 镜像获取。
几条值得记住的细节
- DFlash 草稿器仅 5 层(Qwen3-Coder 为 8 层),而此前扩散方法使用 7B 草稿器,加速比被限制在 3–4 倍。
- 论文中 Qwen3-8B 在 MATH-500 任务上达到 6.08 倍加速,接受长度 τ=7.87。
- NVIDIA 测试中,DFlash 在 Blackwell 上以 500–600 tokens/sec 每用户吞吐量服务时,总吞吐量是自回归解码的 15 倍以上。
- DFlash 支持 Transformers、vLLM、SGLang 和 TensorRT-LLM 四个后端,已发布 20 个检查点。
- 在 vLLM 中启用 DFlash 只需一行配置:
--speculative-config '{"method": "dflash", "model": "z-lab/Qwen3.5-27B-DFlash", "num_speculative_tokens": 15}'。
一句话总结
DFlash 让大模型推理加速不再依赖逐 Token 生成,用块扩散草稿器实现 5–15 倍无损加速,国产模型用户可直接受益。