AI 快讯 编译自 marktechpost #模型发布#开源#MoE

AMD发布Instella-MoE-16B-A3B:全开源MoE模型,2.8B激活参数,训练于Instinct GPU

AMD推出Instella-MoE-16B-A3B,一款全开源的混合专家模型,总参数16B,每token仅激活2.8B,基于Instinct MI300X/MI325X训练。本文详解架构创新、性能数据及中文用户部署要点。

编译发布 2026/08/01 原文发布 2026/08/01

一句话看懂

AMD发布Instella-MoE-16B-A3B,全开源MoE模型,总参数16B,每token仅激活2.8B,在Instinct GPU上训练,性能领先同级开源模型。

详细发生了什么

AMD正式发布Instella-MoE-16B-A3B,这是一款从零开始训练的混合专家(MoE)语言模型,基于Instinct MI300X和MI325X GPU。模型总参数量为16B,但每个token仅激活2.8B参数。AMD公开了所有训练阶段的权重,以及数据混合、训练配置和推理代码。

架构上,Instella-MoE采用decoder-only设计,27层,隐藏层大小2048,16个注意力头,词表大小128,896。每个MoE层包含2个共享专家和从64个中选出的6个路由专家,从而实现2.8B激活参数。预训练和中期训练采用Multi-Token Prediction目标。

两个关键系统级创新:Gated MLA(门控多头潜在注意力)在Multi-head Latent Attention中加入轻量级学习输出门,通过专用线性投影生成输入条件门,在输出投影前乘法应用;FarSkip-Collective将过时和部分激活传递给MoE和注意力层,使专家并行通信与计算重叠。AMD报告预训练速度提升12.7%,专家并行服务时首token时间(TTFT)降低39.2%。

训练流程:预训练使用7.1T token,来自Nemotron-CC-v2、MegaMath、FineMath、RefineCode和TxT360等开放语料。中期训练使用Dolma3 Dolmino 100B的三种数据变体,通过权重平均合并。长上下文阶段使用YaRN将窗口从4K扩展到64K。后训练包括SFT、DPO和RL(Miles框架)。

性能方面,基础模型平均分76.7,领先Moonlight-16B-A3B(76.2)、SmolLM3-3B-Base(70.5)等,但落后于Qwen3.5-4B-Base(79.5)。长上下文HELMET 41.5,RULER 79.4。后训练从SFT 71.58提升到Think 73.22。

中文圈视角

对中文用户而言,Instella-MoE-16B-A3B的发布有几个值得关注的要点。首先,模型权重采用ResearchRAIL许可证,仅限学术和研究用途,这意味着国内开发者不能直接用于商业产品,但可以用于研究和实验。训练代码采用MIT许可证,这部分可以自由使用和修改,对于想复现MoE训练流程的团队很有价值。

其次,模型在AMD Instinct GPU上训练,使用ROCm生态,这与国内常见的NVIDIA CUDA生态不同。国内用户如果使用AMD GPU,可以借鉴其训练和推理代码,但如果是NVIDIA环境,可能需要适配。目前国内开源社区对AMD GPU的支持相对较少,这可能是早期采用者的机会。

第三,模型性能与Qwen3.5-4B-Base相比还有差距,但作为全开源模型,其透明度更高。国内用户如果关注模型可解释性和训练细节,Instella-MoE提供了完整的训练配方,包括数据混合和配置,这是很多闭源模型无法提供的。对于学术研究和教育用途,这是一个很好的学习资源。

最后,模型支持64K长上下文,对中文长文档处理有一定潜力,但需要自行评估中文能力。由于权重仅限研究,国内用户可能需要关注后续是否有商业许可版本。

几条值得记住的细节

  • 模型总参数16B,激活参数2.8B,每token使用2个共享专家和6个路由专家(从64个中选)。
  • Gated MLA和FarSkip-Collective带来12.7%训练加速和39.2% TTFT降低。
  • 权重在ResearchRAIL许可下发布,仅限学术研究;训练代码为MIT许可。
  • 基础模型平均分76.7,领先Moonlight-16B-A3B(76.2)和OLMo-3-7B(70.1),但落后Qwen3.5-4B-Base(79.5)。
  • 推理时16B BF16权重约需32GB显存,单个高内存加速器即可运行,支持SGLang推理。

一句话总结

Instella-MoE是研究MoE训练和AMD生态的好素材,但商业使用受限,中文用户可关注其训练代码和架构创新。