AI 快讯 编译自 marktechpost #模型发布#编码AI#开源

快手KwaiKAT团队发布KAT-Coder-V2.5:基于10万+可验证仓库环境的智能编码模型

快手KwaiKAT团队推出KAT-Coder-V2.5智能编码模型,通过AutoBuilder将环境构建成功率从16.5%提升至57.2%,生成超10万个可验证环境。模型在PinchBench上以94.9分领先,并开源35B MoE版本。本文详解技术细节、中文用户使用门槛及与国产模型的对比。

编译发布 2026/07/26 原文发布 2026/07/26

一句话看懂

快手KwaiKAT团队发布KAT-Coder-V2.5,一个能在真实仓库中自主编码的AI模型,训练数据来自10万+可验证环境,在PinchBench上以94.9分领先Opus 4.8。

详细发生了什么

快手KwaiKAT团队发布了KAT-Coder-V2.5技术报告,核心观点是:智能编码能力的瓶颈在于训练基础设施,而非模型规模。团队开发了AutoBuilder系统,将可执行仓库环境的构建成功率从16.5%提升到57.2%,最终生成了超过10万个覆盖12种编程语言的可验证环境。

模型训练采用异步PPO和三层次奖励机制,并通过沙箱审计将强化学习中的反馈错误率从约16%降至2%以下。KAT-Coder-V2.5在PinchBench上以94.9分领先Opus 4.8(93.5分),在SWE-Bench Pro上以65.2分排名第二。同时,团队开源了KAT-Coder-V2.5-Dev版本,这是一个35B总参数/3B活跃参数的MoE模型,基于Qwen3.6-35B-A3B,采用Apache-2.0许可。

中文圈视角

对中文开发者来说,KAT-Coder-V2.5的发布有几个值得关注的点:

  1. 使用门槛:完整版通过快手StreamLake平台提供API服务,国内用户可直接访问,无需特殊网络。开源版KAT-Coder-V2.5-Dev已上架Hugging Face,国内可通过ModelScope镜像下载。

  2. 与国产模型的对比:KAT-Coder-V2.5在SWE-Bench Pro上得分65.2,低于Opus 4.8(69.2),但高于此前国内开源模型的表现。其35B MoE架构与DeepSeek-Coder-V2的236B总参数相比更轻量,适合本地部署。

  3. 中文场景应用:模型支持12种语言,包括Python、JavaScript、C++等主流语言,但未明确提及中文注释或中文Issue处理能力。对于国内开发者常用的Java、Go等语言,模型表现有待实测。

  4. 合规与数据安全:开源版Apache-2.0许可允许商用,但训练数据来自GitHub公开仓库,需注意代码版权问题。通过StreamLake调用时,数据不出境,符合国内监管要求。

几条值得记住的细节

  • AutoBuilder将环境构建成功率从16.5%提升至57.2%,生成超10万个可验证环境。
  • 沙箱审计发现约16%的RL轨迹失败源于基础设施而非模型策略,修复后错误率降至2%以下。
  • KAT-Coder-V2.5在PinchBench上得分94.9,领先Opus 4.8(93.5)。
  • 开源版KAT-Coder-V2.5-Dev为35B总参数/3B活跃参数的MoE模型,基于Qwen3.6-35B-A3B。
  • 训练数据来自真实PR和commit,并剥离了git历史等可追溯信息,防止模型作弊。

一句话总结

KAT-Coder-V2.5证明了智能编码的瓶颈在基础设施而非模型规模,国内开发者可通过StreamLake或开源版直接使用,但中文场景适配和实际编码能力仍需验证。