Kimi K3 部署指南:在 AWS SageMaker HyperPod 和 EKS 上运行 2.8 万亿参数 MoE 模型
本文介绍如何在 AWS 上部署 Moonshot AI 的 Kimi K3 模型,涵盖 SageMaker HyperPod 和 EKS 两种方案。Kimi K3 拥有 2.8 万亿参数、1M context window,支持原生多模态和工具调用。了解部署步骤、基础设施要求和 vLLM 推理配置,帮助你在云端自托管前沿级开源模型。
一句话看懂
Moonshot AI 发布 2.8 万亿参数的 Kimi K3,本文教你如何在 AWS 上用 SageMaker HyperPod 或 EKS 部署这个开源 MoE 模型,需要 p6-b300 GPU 实例。
详细发生了什么
2026 年 7 月 27 日,Moonshot AI 发布了 Kimi K3。这是一个 2.8 万亿参数的 Mixture of Experts(MoE)模型,也是首个达到 3 万亿参数级别的开源权重模型。Kimi K3 采用 Kimi Delta Attention(KDA)、Gated Multi Head Latent Attention(MLA)和 Stable LatentMoE 框架,将参数分布在 896 个专家中,每个 token 激活 16 个专家。也就是说,每次前向传播约 1040 亿参数激活,相比前代 Kimi K2 扩展效率提升 2.5 倍。
Kimi K3 支持 1M token 的 context window,原生多模态(文本+视觉),擅长长时程编程、agentic workflows 和复杂推理,支持原生 tool calling、结构化输出和常开思考模式。权重以 MXFP4 格式在 Hugging Face 上公开,模型标识为 moonshotai/Kimi-K3。推理需要 vLLM day-0 容器,当前 vllm/vllm-openai:kimi-k3 镜像可用,未来将合并到主分支。
部署 Kimi K3 需要 p6-b300 实例(ml.p6-b300.48xlarge),配备 8 块 NVIDIA B300 Blackwell Ultra GPU。AWS 提供两种容量获取方式:Flexible Training Plans(用于 SageMaker HyperPod)和 Capacity Blocks(用于 EKS)。
中文圈视角
Kimi K3 作为国产模型,其开源对中文开发者意义重大。国内用户可以直接在 Hugging Face 下载权重,但部署需要高端 GPU(如 B300),成本极高,个人开发者难以承受。不过,国内云厂商(如阿里云、腾讯云)可能提供类似实例,但需注意数据出境和合规问题。对于中文用户,Kimi K3 的中文能力可能优于同规模英文模型,适合中文长文档处理、代码生成等场景。此外,国内平替方案包括 DeepSeek-V3 或 Qwen 系列,但参数规模较小。建议关注 ModelScope 是否同步上线,以降低国内部署门槛。
几条值得记住的细节
- Kimi K3 总参数 2.8 万亿,激活参数 1040 亿,上下文窗口 1M tokens。
- 权重格式为 MXFP4,需使用 vLLM 容器 vllm/vllm-openai:kimi-k3 推理。
- 部署必须使用 ml.p6-b300.48xlarge 实例,需通过 Flexible Training Plans 或 Capacity Blocks 预留容量。
- SageMaker HyperPod 方案使用 Inference Operator 自动处理模型下载和端点管理,简化部署。
- EKS 方案适合已有 Kubernetes 基础设施的团队,使用 Terraform 模块快速搭建。
一句话总结
Kimi K3 部署门槛高,但 AWS 提供了两种路径,适合有 GPU 资源的企业尝试,个人用户可先体验 API。