Moonshot AI 发布 Kimi K3:2.8 万亿参数开源 MoE 模型,1M 上下文窗口,性能直追闭源巨头
Moonshot AI 于 2026 年 7 月 16 日发布 Kimi K3,一个 2.8 万亿参数的开源 MoE 模型,采用 Kimi Delta Attention 和 Attention Residuals 架构,支持 1M token 上下文。在编程、浏览、文档理解等基准测试中领先,API 定价 $0.30-$15.00/MTok。本文详解架构、性能、中文用户使用指南。
一句话看懂
Moonshot AI 发布 Kimi K3,2.8 万亿参数开源 MoE 模型,1M 上下文窗口,在多项基准上超越 GPT-5.6 Sol 和 Claude Fable 5,API 兼容 OpenAI SDK。
详细发生了什么
2026 年 7 月 16 日,Moonshot AI 正式发布 Kimi K3,一个 2.8 万亿参数的稀疏 MoE 模型,激活 16/896 个专家。K3 基于两项架构创新:Kimi Delta Attention (KDA) 和 Attention Residuals (AttnRes)。KDA 是一种混合线性注意力机制,在百万 token 上下文中实现最高 6.3 倍解码加速;AttnRes 沿深度方向选择性检索表示,提升约 25% 训练效率,额外成本低于 2%。
K3 还引入了 Stable LatentMoE、Quantile Balancing、Per-Head Muon 等优化。训练数据配方改进带来约 2.5 倍于 K2 的扩展效率。在基准测试中,K3 在 Program Bench (77.8)、SWE Marathon (42.0)、BrowseComp (91.2)、Automation Bench (30.8)、OmniDocBench (91.1) 上领先所有对比模型,包括 Claude Fable 5 和 GPT-5.6 Sol。但在 FrontierSWE 和 HLE-Full 上仍落后于 Fable 5。
K3 已上线 Kimi.com、Kimi Work、Kimi Code 及 API。API 定价:缓存命中 $0.30/MTok,缓存未命中 $3.00/MTok,输出 $15.00/MTok。Moonshot 报告在编程工作负载中缓存命中率超过 90%。
中文圈视角
Kimi K3 对中文用户意义重大。首先,它是目前最大的开源模型,国内开发者可直接通过 Kimi 官网或 API 使用,无需梯子。API 兼容 OpenAI SDK,迁移成本极低。相比 DeepSeek-V3 等国产模型,K3 在长上下文和编程任务上优势明显。
其次,1M token 上下文窗口对中文长文档处理(如法律合同、学术论文、代码库)非常实用。K3 的 OmniDocBench 高分表明其文档解析能力出色,可直接用于中文 PDF、扫描件处理。
但需注意:K3 的 reasoning_effort 仅支持 max,且 temperature 等参数固定,灵活性受限。另外,输出定价 $15/MTok 较高,但缓存命中率高可降低成本。国内用户可优先尝试 Kimi Work 的免费额度。
几条值得记住的细节
- K3 总参数 2.8 万亿,激活 16/896 个专家,采用 Stable LatentMoE 路由。
- KDA 注意力机制在百万 token 下实现 6.3 倍解码加速。
- API 定价:缓存命中 $0.30/MTok,未命中 $3.00/MTok,输出 $15.00/MTok。
- 支持原生多模态(文本、图像、视频),但未提及音频。
- 已在 vLLM 中贡献了 KDA 的 prefix caching 实现。
一句话总结
Kimi K3 是目前最强的开源模型之一,在编程和长上下文任务上接近闭源顶尖水平,中文用户可直接通过 Kimi 平台免费体验。