MiniMax 发布 MSA 稀疏注意力:109B MoE 模型实现 28.4 倍注意力计算缩减,中文开发者可试用开源推理内核
MiniMax 推出 MSA(MiniMax Sparse Attention),一种基于 GQA 的两阶段块稀疏注意力机制。在 109B MoE 模型上训练后,MSA 在 1M 上下文下将每 token 注意力计算量降低 28.4 倍,同时保持下游基准性能。中文开发者可通过开源内核和 MiniMax-M3 模型直接体验长上下文推理加速。
一句话看懂
MiniMax 发布 MSA 稀疏注意力,在 109B MoE 模型上实现 28.4 倍注意力计算缩减,开源推理内核并推出生产模型 MiniMax-M3。
详细发生了什么
MiniMax 研究团队发布了 MSA(MiniMax Sparse Attention),一种构建在 Grouped Query Attention(GQA)之上的稀疏注意力方法。MSA 将注意力分解为两个阶段:Index Branch 和 Main Branch。Index Branch 为每个 query 和 GQA group 选择 Top-k 个 key-value 块(默认块大小 128 token,每 query 保留 16 块,即 2,048 个 key-value token),Main Branch 仅对这些块执行精确 softmax 注意力。
MSA 在 109B 参数的 MoE 模型上训练,使用 3T token 预算。训练采用 KL 对齐损失使 Index Branch 分布匹配 Main Branch 注意力模式,并通过 Gradient Detach、Indexer Warmup 和强制本地块三种机制稳定训练。MSA 支持两种训练路径:MSA-PT(从零训练,40B token 预热)和 MSA-CPT(从密集 GQA 检查点继续训练 400B token)。
性能方面,MSA 在 MMLU(67.2 vs 67.0)、GSM8K(77.7 vs 76.2)、HumanEval(64.0 vs 61.0)等基准上接近或超过全注意力基线。在 1M 上下文下,每 token 注意力计算量降低 28.4 倍。团队还开源了针对 NVIDIA SM100 GPU 的内核 fmha_sm100,支持 BF16、FP8、NVFP4 和 FP4 精度,MIT 许可。
中文圈视角
对中文开发者意味着什么?
-
可用性:MSA 内核已开源(MIT 许可),可通过 Hugging Face kernels 库直接安装。生产模型 MiniMax-M3 可通过 MiniMax API 调用,无需梯子。对于需要长上下文推理的国内场景(如代码仓库分析、长文档问答、多轮对话),MSA 提供了即时的加速方案。
-
国产平替对比:与 DeepSeek 的 NSA(Native Sparse Attention)相比,MSA 采用块级选择(128 token 块)而非 token 级,且每个 GQA group 独立选择 Top-k 块,在长上下文下保持 KV 读取连续性。与智谱 GLM 系列相比,MiniMax 更侧重多模态长视频理解,MSA-PT 在 VideoMME 上达到 45.48,高于全注意力基线 41.11。
-
中文场景盲点:目前国内讨论多集中在模型能力,较少关注推理效率。MSA 的 28.4 倍计算缩减意味着在相同硬件下可处理更长的上下文,或降低推理成本。对于部署在国产 GPU(如昇腾)上的团队,虽然内核目前仅支持 NVIDIA SM100,但算法设计本身可移植。
-
合规注意:MiniMax 作为国内公司,其 API 服务符合数据出境要求。开源内核需自行部署,注意模型权重可能涉及合规审查。
几条值得记住的细节
- 每 query 固定预算:无论上下文多长,每个 query 只关注 2,048 个 key-value token(16 块 × 128 token/块)。
- 训练技巧:Indexer Warmup 阶段先运行全注意力 40B token,让 Index Branch 通过 KL 损失学习后再控制路由。
- 内核性能:exp-free Top-k 选择在 128K 上下文下比 torch.topk 快 5.1 倍,比 TileLang radix-select 快 3.7 倍。
- 生产模型:MiniMax-M3 已发布,支持多模态输入,在 VideoMME 和 TemporalBench 上表现优异。
- 开源许可:内核 fmha_sm100 以 MIT 许可发布,支持 BF16/FP8/NVFP4/FP4 精度。
一句话总结
MSA 让长上下文推理不再昂贵,中文开发者现在就能用上开源内核和 API 加速自己的应用。