AI 快讯 编译自 marktechpost #模型发布#开源#MoE

Soofi S 30B-A3B 开源混合 Mamba-Transformer MoE 模型发布:德英双语性能领先

德国研究联盟发布 Soofi S 30B-A3B,一款开源混合 Mamba-Transformer MoE 基础模型,总参数 31.6B,激活 3.2B,在德英双语任务上超越同类开源模型。本文详解架构、训练数据、性能对比及对中文圈用户的启示。

编译发布 2026/07/15 原文发布 2026/07/15

一句话看懂

德国研究联盟发布 Soofi S 30B-A3B,一款开源混合 Mamba-Transformer MoE 模型,总参数 31.6B,激活 3.2B,德英双语性能领先同类开源基础模型。

详细发生了什么

德国研究联盟 Soofi Consortium 发布了 Soofi S 30B-A3B 的预训练报告。该模型是一款开源基础模型,专为德语和英语设计,训练全程在德国电信的工业 AI 云上进行,权重已在 Hugging Face 以预览形式开放。

Soofi S 采用混合架构:52 层中包括 23 层 Mamba-2 序列混合层、23 层细粒度 MoE 层和 6 层 Grouped-Query Attention (GQA) 层,仅 6 层 GQA 维护 KV cache。每个 MoE 层有 128 个路由专家,每 token 激活 6 个,外加 2 个共享专家。模型维度 2688,使用 squared ReLU 和 RMSNorm,无位置编码。架构参考 Nemotron 3 Nano 设计,未做修改。

训练分三阶段,共消耗约 26.68T tokens:阶段一使用 20T tokens 以 1e-3 学习率训练;阶段二使用 6.58T tokens 高质量退火数据,学习率从 1e-3 衰减至 1e-5;阶段三使用 0.10T tokens,序列长度扩展至 1,048,576,支持最大 1M token context window。德语数据占比从阶段一的 7.2% 提升至阶段二的 15.32%,来源包括 HPLT、German Commons、FinePDFs、FineWiki 以及 Genios 的 1.93 亿篇商业授权文章。

性能方面,Soofi S 在 16 个开源基础模型对比中表现突出:英语聚合得分 70.1,德语聚合得分 79.1,均领先 Olmo 3 32B、Apertus 70B、EuroLLM 22B 等模型。HumanEval pass@1 达 73.8,MBPP-DE 达 84.2,GSM8K 达 86.1。与架构相同的 Nemotron 3 Nano 相比,英语提升 1.8 分,德语提升 4.2 分。

中文圈视角

对中文用户而言,Soofi S 的发布有几点值得关注:

  1. 架构启示:Mamba-Transformer 混合 MoE 架构在长上下文场景下效率突出——仅 6 层 GQA 维护 KV cache,解码速度可达同参数量级稠密模型的 8-9 倍。这种设计对中文长文档处理(如法律合同、学术论文)有借鉴意义,国内模型如 DeepSeek、Kimi 可关注类似混合架构的优化。

  2. 数据策略:Soofi S 通过提升德语数据占比(从 7.2% 到 15.32%)显著改善德语性能,这对中文模型有直接参考价值——中文数据在预训练中的占比和配比策略值得深入探索。目前国内开源模型如 Qwen、Yi 虽在中文上表现优秀,但公开的详细数据配比信息较少。

  3. 开源生态:Soofi S 是“完全开放”的基础模型(无指令微调、无对齐),权重和代码均公开。这与国内部分模型“开源但不完全开放”(如仅发布推理权重)形成对比。对于需要定制微调的中文开发者,Soofi S 的开放程度提供了更好的研究基础。

  4. 监管与主权:模型由德国政府资助,训练在德国本土云上进行,体现了“AI 主权”理念。中文圈在推动国产大模型时,也可借鉴这种主权云训练模式,确保数据安全与合规。

几条值得记住的细节

  • 模型总参数 31.6B,每 token 激活 3.2B,仅 6/52 层维护 KV cache。
  • 训练使用 512 块 NVIDIA B200 GPU,耗时约 253,000 GPU 小时(2026年3月24日至5月13日)。
  • 支持最大 1M token context window,解码速度在 40K 上下文下为同规模稠密模型的 8-9 倍。
  • 德语聚合得分 79.1,英语聚合得分 70.1,均领先同级别开源模型。
  • 权重为门控预览,需在 Hugging Face 接受条款后下载,许可证尚未最终确定。

一句话总结

Soofi S 展示了混合 MoE 架构在双语场景下的高效性,其数据配比策略和开源模式对中文大模型研发有直接参考价值。