月之暗面Kimi K3部署指南:在AWS上运行2.8万亿参数MoE模型
月之暗面于2026年7月发布Kimi K3,一个2.8万亿参数的MoE模型,支持1M token上下文和原生多模态。本文详解如何在AWS上通过SageMaker HyperPod或EKS部署该模型,包括基础设施要求、容量获取和配置步骤。
一句话看懂
月之暗面发布Kimi K3,2.8万亿参数MoE模型,支持1M上下文,可在AWS上通过SageMaker HyperPod或EKS自托管。
详细发生了什么
2026年7月27日,月之暗面(Moonshot AI)发布了Kimi K3,一个2.8万亿参数的Mixture of Experts(MoE)模型,这是首个达到3万亿参数级别的开源权重模型。Kimi K3采用Kimi Delta Attention(KDA)、Gated Multi Head Latent Attention(MLA)和Stable LatentMoE框架,拥有896个专家,每token仅激活16个,活跃参数约1040亿,相比前代Kimi K2效率提升2.5倍。模型支持1M token上下文窗口、原生多模态(文本+视觉)、工具调用、结构化输出和始终开启的思考模式。
AWS官方博客提供了两种部署方案:Amazon SageMaker HyperPod(推荐,简化容器编排)和Amazon EKS(适合已有Kubernetes基础设施的团队)。模型权重以MXFP4格式发布在Hugging Face上,需使用vLLM专用推理容器(vllm/vllm-openai:kimi-k3)。硬件要求极高,必须使用p6-b300实例(8块NVIDIA B300 Blackwell Ultra GPU),可通过Flexible Training Plans或Capacity Blocks获取预留容量。
中文圈视角
Kimi K3的发布对国内AI圈意义重大。首先,它是月之暗面继Kimi K2后又一次开源尝试,且模型规模达到2.8万亿参数,直接对标国际前沿。国内用户若想自部署,需注意:
- 硬件门槛极高:p6-b300实例目前仅AWS提供,国内云厂商(阿里云、华为云)尚无同等GPU。国内用户可能需要等待国产GPU(如昇腾)适配,或使用AWS中国区域(需ICP备案)。
- 与国产模型对比:相比DeepSeek-V3(671B参数)和Qwen2.5(72B),Kimi K3规模大一个数量级,但推理成本也更高。对于中文长文本任务(如法律文档分析、科研论文处理),Kimi K3的1M上下文和MoE架构有优势,但实际部署成本可能让中小团队望而却步。
- 监管合规:模型权重开源,但部署在AWS海外区域可能涉及数据出境问题。国内企业若需合规,建议使用AWS中国区域或等待月之暗面提供国内镜像。
- 中文社区盲点:目前讨论多集中在模型能力,但部署细节(如MXFP4格式兼容性、vLLM支持进度)鲜有人提。建议关注vLLM主分支合并情况,以及国内推理框架(如vLLM中文分支、TGI)的适配。
几条值得记住的细节
- Kimi K3总参数2.8万亿,每token激活16/896专家,活跃参数1040亿。
- 模型权重以MXFP4格式发布,需使用专用vLLM容器(vllm/vllm-openai:kimi-k3)。
- 硬件最低要求:1个p6-b300.48xlarge实例(8块B300 GPU),需通过Flexible Training Plans或Capacity Blocks预留。
- SageMaker HyperPod方案自动处理模型下载、容器调度和健康检查,暴露OpenAI兼容API。
- EKS方案需自行管理集群,可使用AI on EKS项目Terraform模块快速部署。
一句话总结
Kimi K3是目前最大的开源MoE模型,但部署成本极高,适合有AWS大额预算的团队,国内用户需关注硬件和合规问题。