美团发布LongCat-2.0:1.6万亿参数开源MoE模型,原生支持100万token上下文,国产AI芯片训练
美团发布LongCat-2.0,一款1.6万亿参数MoE模型,每token激活约480亿参数,原生支持100万token上下文窗口,基于LongCat Sparse Attention技术,训练和推理全程运行在国产AI ASIC超算集群上。本文解析其架构、基准测试,并探讨对中文开发者的实际意义。
一句话看懂
美团发布LongCat-2.0,1.6万亿参数MoE模型,原生百万token上下文,训练推理全栈国产AI芯片,瞄准智能体编程场景。
详细发生了什么
美团发布了LongCat-2.0,这是继2025年560B参数的LongCat-Flash之后的下一代万亿级开源模型。LongCat-2.0采用MoE架构,总参数量1.6万亿,每token动态激活约480亿参数(范围330亿-560亿)。最大亮点是原生支持100万token上下文窗口,基于自研的LongCat Sparse Attention(LSA)注意力机制,将长上下文计算复杂度从二次降至线性。
训练过程使用了超过35万亿token,在国产AI ASIC超算集群上完成,全程无回滚或不可恢复的损失尖峰。美团声称其稳定性在非NVIDIA硬件上尤为难得。推理同样部署在国产ASIC上,采用6D并行和prefill-decode分离架构。
在基准测试方面,美团自测数据显示:SWE-bench Pro 59.5分(略超GPT-5.5的58.6分),Terminal-Bench 2.1 70.8分,SWE-bench Multilingual 77.3分。美团表示整体性能可与Google Gemini 3.1 Pro媲美,但优势集中在软件工程领域,在通用智能体基准如FORTE和BrowseComp上仍落后于前沿模型。
模型以MIT许可证开源,权重即将发布。目前可通过LongCat API平台、OpenRouter等渠道使用,兼容OpenAI和Anthropic的API格式。定价为每百万输入token $0.75,每百万输出token $2.95,促销价分别为$0.30和$1.20,缓存读取免费。
中文圈视角
LongCat-2.0对中文开发者有几点直接意义:
-
国产芯片生态里程碑:这是首个完全在国产AI ASIC上完成训练和推理的万亿级开源模型。此前国产芯片多用于推理,训练大模型仍依赖NVIDIA。LongCat-2.0证明了国产算力在超大规模训练中的可行性,对受出口管制影响的中文团队是重要信号。
-
百万token上下文的实用场景:中文代码仓库常包含大量中文注释和文档,百万token窗口可一次性加载整个中型项目(如Spring Boot应用),避免分块摘要的信息丢失。对于需要跨文件追踪bug、重构多模块代码的开发者,这是直接生产力提升。
-
API兼容性降低迁移成本:模型提供OpenAI和Anthropic兼容端点,意味着现有工具链(如Cursor、Continue)可直接切换后端,无需重写代码。国内开发者也可通过OpenRouter访问,无需额外配置。
-
与国产模型的对比:相比DeepSeek-V3(671B总参数,37B激活)和Qwen2.5-72B,LongCat-2.0在参数量和上下文长度上领先,但激活参数效率(约3%激活率)与DeepSeek的5%相近。其SWE-bench分数(59.5)高于公开的DeepSeek-Coder-V2(约49分),但需独立验证。
-
监管与合规:模型以MIT许可证开源,权重即将发布,国内团队可本地部署,避免数据出境风险。但需注意,模型训练数据可能包含中文互联网内容,使用时应遵守《生成式人工智能服务管理暂行办法》。
几条值得记住的细节
- 架构创新:LongCat-2.0引入零计算专家(Zero-computation experts),简单token(如标点)不消耗算力,由PID控制器动态调整专家偏置,激活参数在33B-56B间浮动。
- N-gram嵌入模块:额外1350亿参数的N-gram嵌入模块,与MoE专家正交,捕获密集局部token关系,减少大batch解码时的内存I/O。
- 后训练融合:MOPD管道融合三个教师专家组(Agent、Reasoning、Interaction),将能力统一到一个模型中。
- 最大输出128K tokens:支持单次生成最长131072 token(128K),适合生成长篇代码或文档。
- 权重即将发布:目前仅提供API访问,权重尚未开放下载,但承诺MIT许可证。
一句话总结
LongCat-2.0是国产AI芯片训练万亿级模型的首个成功案例,百万token上下文让智能体编程进入新阶段,中文开发者应重点关注其API和即将开源的权重。