Kimi K3 开源模型发布:2.8万亿参数,用内存换算力,中国AI另辟蹊径
Moonshot AI 发布 Kimi K3 开源模型,2.8万亿参数创纪录。通过混合专家、量化训练和Delta注意力机制,大幅降低算力需求,但内存占用极高。本文解析其技术路线、对中文用户的实际意义及部署挑战。
一句话看懂
Moonshot AI 发布 Kimi K3,2.8万亿参数开源模型,通过内存换算力的设计绕过芯片限制,但部署门槛极高。
详细发生了什么
7月16日,Moonshot AI 发布 Kimi K3 开源模型,参数规模达2.8万亿,是目前最大的开源模型,远超 DeepSeek V4 Pro 的1.6万亿。但参数并非全部——K3 的设计核心是用内存换算力,以应对美国芯片出口限制。
K3 采用混合专家架构(MoE),将模型拆分为896个专家模块,每次只激活16个(约1.8%),大幅降低单次推理算力。同时,通过量化感知训练将参数精度从16位降至4位,模型体积从5.6TB压缩至约1.4TB。此外,Kimi Delta Attention 机制优化了长上下文处理的内存占用,支持百万token上下文,解码速度提升6.3倍。
Moonshot 建议在64个以上加速器集群上运行 K3,并已向 vLLM 项目贡献缓存代码以降低推理成本。定价方面,输入token每百万$3,缓存命中时$0.30,输出token每百万$15,高于 DeepSeek V4 但低于 Fable 5。
中文圈视角
Kimi K3 对中文用户意味着什么?首先,它是国产模型在开源领域的重大突破,参数规模全球第一,但实际可用性存疑。国内用户无需梯子即可通过 Moonshot 官方 API 或自行部署使用,但硬件门槛极高——推荐64卡集群,普通企业难以承受。
与国产同类模型对比:DeepSeek V4 参数更小(1.6T)、价格更低($0.87/百万输入),且部署更友好;GLM-5.2 来自智谱,价格适中($4.40/百万输入)。K3 的优势在于超长上下文(百万token)和开源可定制,适合需要处理海量文档的金融、法律、科研机构。
监管层面:K3 开源权重可本地部署,符合数据不出境要求,对东南亚银行、保险等受监管行业有吸引力。但 Moonshot 未明确训练芯片来源,若涉及美国限制硬件,可能影响合规性。
中文圈尚未讨论的盲点:K3 的量化训练和 Delta Attention 对国产芯片(如华为昇腾)的适配性。Moonshot 仅模糊提及“替代供应商”,实际性能未知。若国产芯片无法高效运行,K3 的“自主可控”将打折扣。
几条值得记住的细节
- K3 参数达2.8万亿,但每次推理仅激活1.8%的专家模块,算力需求远低于同规模密集模型。
- 量化训练将精度降至4位,模型体积从5.6TB压缩至1.4TB,但内存占用仍极高。
- 百万token上下文支持,Delta Attention 使解码速度提升6.3倍,适合长文档处理。
- 定价:输入$3/百万token,输出$15/百万token,缓存命中时$0.30。
- 权重将于7月27日开源,但标准推理工具尚未完全支持,实际可用日期可能滞后。
一句话总结
Kimi K3 用内存换算力,突破了芯片限制,但高昂的部署成本使其更适合大型企业,普通用户仍应关注 API 服务。