AI 快讯 编译自 marktechpost #模型推理#速度突破#小米

小米MiMo与TileRT实现1万亿参数模型在商用GPU上每秒超1000 tokens推理速度

小米MiMo团队联合TileRT推出MiMo-V2.5-Pro-UltraSpeed,在单节点8块商用GPU上实现1万亿参数模型每秒超1000 tokens的推理速度。本文详解FP4量化、DFlash投机解码和TileRT运行时三大技术,并分析对中文用户的实际意义与国产替代可能性。

编译发布 2026/06/08 原文发布 2026/06/08

一句话看懂

小米MiMo团队与TileRT合作,让1万亿参数模型在普通8卡GPU节点上跑出每秒超1000 tokens的生成速度,是业界首个达到该量级的商用方案。

详细发生了什么

小米MiMo团队联合TileRT系统组发布了MiMo-V2.5-Pro-UltraSpeed,这是针对现有MiMo-V2.5-Pro模型的高速推理模式。该模式在单个标准8-GPU商用节点上,实现了1万亿参数模型每秒超1000 tokens的解码速度,演示峰值接近1200 tokens/s。

速度提升来自三层协同优化:第一层是FP4量化,仅对MoE专家层使用MXFP4格式,其他模块保持FP8精度,通过量化感知训练(QAT)保持模型质量基本不变;第二层是DFlash投机解码,采用块级掩码并行预测,一次前向传播生成整个块,在编程场景下平均接受长度达6.30;第三层是TileRT运行时,通过持久化引擎内核和Warp Specialization消除微秒级操作间隙。

该模式通过申请制API试用,2026年6月9日至23日开放,定价为标准模型的3倍,换取约10倍速度提升。小米已在Hugging Face开源了MiMo-V2.5-Pro-FP4-DFlash检查点,TileRT也开源了部分模块。

中文圈视角

对中文用户而言,这个突破意味着两件事:

第一,商用GPU跑万亿参数模型不再是梦。此前达到类似速度需要Cerebras晶圆级芯片或Groq定制架构,成本极高。小米的方案基于普通GPU(推测为NVIDIA A100/H100级别),国内云厂商如阿里云、华为云、腾讯云均可提供类似算力。这意味着国内开发者有望通过API调用获得接近实时的大模型推理体验,尤其适合编程助手、实时对话等场景。

第二,国产模型推理优化进入新阶段。小米MiMo团队与TileRT的合作展示了软硬协同设计的威力。国内类似工作如DeepSeek的MLA架构、智谱的GLM推理优化,目前尚未公开达到1000 tokens/s的万亿参数模型速度。小米的开源检查点(Hugging Face可下载)为国内社区提供了直接验证和二次开发的基础。不过,API试用仅两周且需申请,国内用户需注意网络访问限制,建议关注后续是否通过ModelScope等国内平台开放。

另外,FP4量化+投机解码的组合对中文场景的适用性值得关注:DFlash的滑动窗口注意力对长上下文中文文本(如古文、技术文档)的效果有待实测;编程场景的接受长度(6.30)可能因中文代码注释而下降。

几条值得记住的细节

  • 速度数据:1万亿参数模型在8块商用GPU上达到1000+ tokens/s,峰值约1200 tokens/s。
  • 定价:UltraSpeed模式为标准模型价格的3倍,约10倍速度提升。
  • 试用期:API试用窗口为2026年6月9日至23日,需申请审批。
  • 开源:MiMo-V2.5-Pro-FP4-DFlash检查点已在Hugging Face开源,TileRT部分模块在GitHub开源。
  • 技术亮点:FP4量化仅用于MoE专家层,其他模块保持FP8;DFlash块大小上限为8,编程场景平均接受长度6.30。

一句话总结

小米让万亿参数模型在普通GPU上跑出千token每秒的速度,中文开发者很快就能用上更快的AI推理服务。