AI 快讯 编译自 marktechpost #模型发布#稀疏注意力#长上下文

MiniMax 发布 MSA 稀疏注意力:109B MoE 模型实现 28.4 倍注意力计算缩减,中文开发者可试用开源推理内核

MiniMax 推出 MSA(MiniMax Sparse Attention),一种基于 GQA 的两阶段块稀疏注意力机制。在 109B MoE 模型上训练后,MSA 在 1M 上下文下将每 token 注意力计算量降低 28.4 倍,同时保持下游基准性能。中文开发者可通过开源内核和 MiniMax-M3 模型直接体验长上下文推理加速。

编译发布 2026/06/17 原文发布 2026/06/17

一句话看懂

MiniMax 发布 MSA 稀疏注意力,在 109B MoE 模型上实现 28.4 倍注意力计算缩减,开源推理内核并推出生产模型 MiniMax-M3。

详细发生了什么

MiniMax 研究团队发布了 MSA(MiniMax Sparse Attention),一种构建在 Grouped Query Attention(GQA)之上的稀疏注意力方法。MSA 将注意力分解为两个阶段:Index Branch 和 Main Branch。Index Branch 为每个 query 和 GQA group 选择 Top-k 个 key-value 块(默认块大小 128 token,每 query 保留 16 块,即 2,048 个 key-value token),Main Branch 仅对这些块执行精确 softmax 注意力。

MSA 在 109B 参数的 MoE 模型上训练,使用 3T token 预算。训练采用 KL 对齐损失使 Index Branch 分布匹配 Main Branch 注意力模式,并通过 Gradient Detach、Indexer Warmup 和强制本地块三种机制稳定训练。MSA 支持两种训练路径:MSA-PT(从零训练,40B token 预热)和 MSA-CPT(从密集 GQA 检查点继续训练 400B token)。

性能方面,MSA 在 MMLU(67.2 vs 67.0)、GSM8K(77.7 vs 76.2)、HumanEval(64.0 vs 61.0)等基准上接近或超过全注意力基线。在 1M 上下文下,每 token 注意力计算量降低 28.4 倍。团队还开源了针对 NVIDIA SM100 GPU 的内核 fmha_sm100,支持 BF16、FP8、NVFP4 和 FP4 精度,MIT 许可。

中文圈视角

对中文开发者意味着什么?

  1. 可用性:MSA 内核已开源(MIT 许可),可通过 Hugging Face kernels 库直接安装。生产模型 MiniMax-M3 可通过 MiniMax API 调用,无需梯子。对于需要长上下文推理的国内场景(如代码仓库分析、长文档问答、多轮对话),MSA 提供了即时的加速方案。

  2. 国产平替对比:与 DeepSeek 的 NSA(Native Sparse Attention)相比,MSA 采用块级选择(128 token 块)而非 token 级,且每个 GQA group 独立选择 Top-k 块,在长上下文下保持 KV 读取连续性。与智谱 GLM 系列相比,MiniMax 更侧重多模态长视频理解,MSA-PT 在 VideoMME 上达到 45.48,高于全注意力基线 41.11。

  3. 中文场景盲点:目前国内讨论多集中在模型能力,较少关注推理效率。MSA 的 28.4 倍计算缩减意味着在相同硬件下可处理更长的上下文,或降低推理成本。对于部署在国产 GPU(如昇腾)上的团队,虽然内核目前仅支持 NVIDIA SM100,但算法设计本身可移植。

  4. 合规注意:MiniMax 作为国内公司,其 API 服务符合数据出境要求。开源内核需自行部署,注意模型权重可能涉及合规审查。

几条值得记住的细节

  • 每 query 固定预算:无论上下文多长,每个 query 只关注 2,048 个 key-value token(16 块 × 128 token/块)。
  • 训练技巧:Indexer Warmup 阶段先运行全注意力 40B token,让 Index Branch 通过 KL 损失学习后再控制路由。
  • 内核性能:exp-free Top-k 选择在 128K 上下文下比 torch.topk 快 5.1 倍,比 TileLang radix-select 快 3.7 倍。
  • 生产模型:MiniMax-M3 已发布,支持多模态输入,在 VideoMME 和 TemporalBench 上表现优异。
  • 开源许可:内核 fmha_sm100 以 MIT 许可发布,支持 BF16/FP8/NVFP4/FP4 精度。

一句话总结

MSA 让长上下文推理不再昂贵,中文开发者现在就能用上开源内核和 API 加速自己的应用。