Cohere 发布 North Mini Code:30B 参数 MoE 编码模型,3B 活跃参数可单卡运行
Cohere 推出首款面向开发者的编码模型 North Mini Code,采用 30B 总参数、3B 活跃参数的混合专家架构,支持 256K context window,可单张 H100 运行。本文详解其架构、性能、使用场景,并分析对中文开发者的实际意义。
一句话看懂
Cohere 发布 North Mini Code,一款 30B 总参数、3B 活跃参数的 MoE 编码模型,专为 agentic coding 设计,单张 H100 即可运行,权重开源。
详细发生了什么
Cohere 于 2026 年 6 月 9 日发布了其首款面向开发者的编码模型 North Mini Code。该模型采用混合专家(MoE)架构,总参数量 30B,但每次推理仅激活 3B 参数,显著降低计算成本。模型支持 256K token 的 context window,最大输出 64K token,最低硬件要求为单张 H100(FP8 精度)。权重以 Apache 2.0 许可证发布在 Hugging Face 上,同时可通过 Cohere API、Model Vault 和 OpenRouter 访问。
架构方面,North Mini Code 是 decoder-only Transformer,包含 128 个专家,每个 token 激活 8 个专家。注意力层采用滑动窗口与全局注意力 3:1 交错设计。后训练分为两阶段:级联监督微调(SFT)和基于可验证奖励的强化学习(RLVR),重点优化 agentic coding 能力。
Cohere 报告该模型在 Artificial Analysis Coding Index 上得分为 33.4,在 SWE-Bench Verified、Terminal-Bench v2 等基准测试中表现不俗。与 Devstral Small 2 相比,输出吞吐量最高提升 2.8 倍,token 间延迟改善 30%。
中文圈视角
对于中文开发者,North Mini Code 的吸引力在于其“主权 AI”定位——模型可自托管,数据不出境,这对国内企业尤其重要。目前国产编码模型如 DeepSeek-Coder 和 CodeGeeX 同样支持本地部署,但 North Mini Code 的 MoE 架构在单卡上实现了 30B 参数的效果,效率更高。不过,模型主要针对英文代码和 agentic 场景,对中文注释和中文编程任务的支持未明确说明。
此外,模型权重虽为 Apache 2.0,但 Hugging Face 页面附加了非商业使用条款,商业部署需仔细核查。对于国内开发者,可通过 Hugging Face 镜像或 ModelScope 获取权重,但需注意网络访问限制。
几条值得记住的细节
- 模型总参数量 30B,每次推理仅激活 3B 参数,单张 H100(FP8)即可运行。
- 支持 256K context window 和 64K 最大输出,适合大型代码库分析。
- 优化场景:代码生成、agentic 软件工程、终端任务,原生支持 tool calling 和 interleaved thinking。
- 权重以 Apache 2.0 发布,但 Hugging Face 页面附加了非商业条款,部署前需确认。
- 可通过 Hugging Face Transformers 或 vLLM 部署,vLLM 需安装 cohere_melody 库以支持工具调用解析。
一句话总结
North Mini Code 让开发者用单卡 H100 就能运行 30B 级别的编码模型,适合需要本地部署、数据敏感的团队。