AI 快讯 编译自 marktechpost #模型发布#开源#编程模型

DeepReinforce 发布开源编程模型 Ornith-1.0:模型在强化学习中自主习得 Scaffold,397B 版本 SWE-Bench 达 82

DeepReinforce 推出 Ornith-1.0 开源编程模型家族,基于 Gemma 4 和 Qwen 3.5,涵盖 9B 到 397B 四种尺寸。核心创新是模型在强化学习中自主习得 scaffold,而非使用固定框架。397B 旗舰模型在 SWE-Bench Verified 上达到 82.4,超越 Claude Opus 4.7,所有权重 MIT 许可。本文详解技术细节、基准成…

编译发布 2026/06/25 原文发布 2026/06/25

一句话看懂

DeepReinforce 发布 Ornith-1.0 开源编程模型家族,模型在强化学习中自主习得 scaffold,397B 版本 SWE-Bench Verified 达 82.4,超越 Claude Opus 4.7,所有权重 MIT 许可。

详细发生了什么

DeepReinforce 于 2026 年 6 月 25 日发布 Ornith-1.0,一个专为 agentic coding 设计的开源模型家族。该系列基于 Google Gemma 4 和阿里 Qwen 3.5 进行后训练,提供四种尺寸:9B Dense、31B Dense、35B MoE(每 token 激活约 3B 参数)和 397B MoE。所有模型权重以 MIT 许可在 Hugging Face 上发布,同时提供 FP8 和 GGUF 格式以加速本地部署。

Ornith-1.0 的核心创新在于训练方式:传统编程 agent 将模型与固定的人工设计的 scaffold(框架)配对,而 Ornith-1.0 在强化学习过程中自主习得 scaffold,联合优化框架与解决方案。模型输出以 <think> 块开头,支持 reasoning parser 返回独立 reasoning_content 字段,并生成格式良好的 tool calls 用于 agent 循环。

基准测试方面,Ornith-1.0-397B 在 SWE-Bench Verified 上取得 82.4,在 Terminal-Bench 2.1 上取得 77.5,均超越 Claude Opus 4.7(80.8 和 70.3),但落后于 Claude Opus 4.8(87.6 和 85)和更大的 GLM-5.2-744B。

为防止模型在自主编写 scaffold 时作弊,DeepReinforce 设计了三层防御:固定信任边界(环境、工具、测试隔离不可变)、确定性监控器(基于规则的监控,标记越权行为)和冻结 LLM 裁判(在验证器之上提供否决权)。

中文圈视角

Ornith-1.0 对中文开发者有几点直接价值:

  1. 可用性与平替:模型基于 Qwen 3.5 和 Gemma 4,对中文代码场景(如中文注释、中文文档生成)有天然支持。9B 模型约 19GB(bf16),单张 80GB GPU 即可运行,国内开发者可通过 Hugging Face 镜像或 ModelScope 获取。相比 Claude Opus 4.7(需 API 付费且可能受限),Ornith-1.0 完全开源,可本地部署,无数据出境风险。

  2. 与国产模型对比:Qwen 3.5 本身已有不错的编程能力,但 Ornith-1.0 通过 RL 自主习得 scaffold,在 agent 任务(如多步骤代码修复、仓库级重构)上可能更具优势。国内类似产品如 DeepSeek-Coder-V2 或 CodeGeeX4 尚未采用这种“自学习 scaffold”范式,Ornith-1.0 提供了一个新方向。

  3. 合规与部署:MIT 许可意味着商用无限制,适合国内企业集成。模型支持 vLLM、SGLang 和 Transformers,兼容 OpenAI API 格式,现有 agent 框架(如 LangChain、AutoGPT)无需修改代码即可接入。

  4. 中文圈盲点:目前国内讨论多集中在模型尺寸和基准分数,但 Ornith-1.0 的“自学习 scaffold”机制可能比分数更重要——它意味着 agent 可以针对特定任务(如 CI/CD 流水线、数据库迁移)自动优化策略,而无需人工设计模板。这对国内 DevOps 和自动化测试场景有潜在价值。

几条值得记住的细节

  • 模型尺寸与许可:9B、31B、35B-MoE、397B-MoE 四种,全部 MIT 许可,Hugging Face 可下载。
  • 基准成绩:397B 在 SWE-Bench Verified 82.4,Terminal-Bench 2.1 77.5,超越 Claude Opus 4.7 但低于 Opus 4.8 和 GLM-5.2-744B。
  • 部署要求:9B 模型 bf16 约 19GB,单张 80GB GPU 可运行;支持 FP8 和 GGUF 量化。
  • 三层防作弊:固定信任边界、确定性监控器、冻结 LLM 裁判,防止模型通过修改验证脚本获得高奖励。
  • 输出格式:模型以 <think> 块开头,支持 reasoning_content 字段和 tool calls,兼容 OpenAI API。

一句话总结

Ornith-1.0 让编程 agent 在训练中自主学会如何“思考”,开源且可本地部署,对中文开发者来说是一个值得尝试的实用工具。