AI 快讯 编译自 marktechpost #模型发布#推理加速#开源框架

腾讯开源AngelSpec:统一训练框架加速Hy3模型推理,DFly草案模型实现1.98-2.40倍加速

腾讯开源AngelSpec,一个基于PyTorch的投机解码草案模型训练框架,支持MTP和块并行架构。其核心DFly草案模型在Hy3-295B-A21B上实现1.98-2.40倍推理加速,通过混合目标条件化和隐藏校正自回归头提升接受长度。本文详解技术细节、中文用户可用性及国产替代方案。

编译发布 2026/07/30 原文发布 2026/07/30

一句话看懂

腾讯开源AngelSpec,一个统一训练框架,通过DFly草案模型在Hy3大模型上实现最高2.4倍推理加速,专为处理混合工作负载设计。

详细发生了什么

腾讯发布了AngelSpec,一个开源的、原生PyTorch的投机解码(speculative decoding)草案模型训练框架。它同时支持自回归多token预测(MTP)和块并行DFlash系列。

核心问题:真实服务流量中的工作负载是异构的(对话、代码、数学推理等),而单一通用草案模型往往在混合基准上表现尚可,但在实际场景中次优。AngelSpec将工作负载异构性作为一等设计约束,专门优化结构、训练数据和验证深度。

框架包含两个互补的草案模型:MTP模型针对对话场景训练,块扩散模型(DFly)则用代码和数学数据强化。DFly引入混合目标条件化(hybrid target conditioning)和前驱条件化自回归头(predecessor-conditioned AR head),在保持并行性的同时提升接受率。

在Hy3-295B-A21B模型上,使用TP=8配置,DFly-8在并发数4到64范围内实现1.98-2.40倍加速。在Qwen3-8B上,DFly的平均接受长度达到5.41,优于DSpark的5.32、DFlash的4.57和MTP的3.24。

AngelSpec已在Hugging Face和ModelScope上发布7个检查点,支持6种草案架构,并集成了训练时测试(Training-Time Test)、目标模型回滚(target-model rollout)、长上下文训练(128k tokens)等关键技术。

中文圈视角

国内用户能用吗? AngelSpec完全开源,基于PyTorch,无需特殊硬件即可运行(但训练需要GPU)。代码和模型权重已上传至ModelScope,国内用户可直接下载,无需梯子。它依赖vLLM作为推理引擎,vLLM在国内有广泛使用,兼容性良好。

国产替代对比: 目前国内类似框架较少。DeepSeek的EAGLE系列是投机解码的代表,但AngelSpec更通用,支持6种架构一键切换。与智谱的GLM系列相比,AngelSpec专注于推理加速而非模型本身,可作为插件集成。

对中文用户的具体场景: 对于部署了Hy3或Qwen等大模型的企业,AngelSpec可直接降低推理成本。例如,在代码生成场景下,DFly的加速效果更显著(数学和代码基准提升最大)。但需注意,当前模型权重主要针对英文优化,中文对话场景的加速效果需进一步测试。

监管/合规角度: 框架本身不涉及数据出境,但训练数据中使用了OpenCodeInstruct等英文数据集。国内用户若需微调,建议使用国产数据集(如CodeGPT-zh)以确保内容安全。

几条值得记住的细节

  • 加速数据: 在Hy3-295B-A21B上,DFly-8在并发4-64时实现1.98-2.40倍加速,平均接受长度从DFlash的3.69提升至4.79。
  • 架构支持: AngelSpec支持6种草案架构:DFly、DFlash、DFlare、Eagle3、DSpark、MTP,通过配置文件一键切换。
  • 训练技巧: 使用目标模型回滚(target-model rollout)训练,MTP深度接受率从52.8%提升至66.4%。
  • 数据扩展: 为DFly额外添加70万条提示(50万代码+20万数学),并去除与评估集重叠的16-token连续片段。
  • 开源地址: 模型权重已上传至Hugging Face和ModelScope,框架代码在GitHub上以Apache 2.0许可发布。

一句话总结

AngelSpec让大模型推理加速不再是“一刀切”,通过针对性训练草案模型,在混合负载下实现显著提速,且国内可直接使用。