AI 快讯 编译自 marktechpost #模型发布#强化学习#工具评测

Prime Intellect 发布 Verifiers v1:可组合任务集、框架与运行时,用于智能体强化学习训练与评估

Prime Intellect 推出 Verifiers v1,将环境拆分为 taskset、harness 和 runtime 三个可组合部分,通过拦截服务器实现训练轨迹记录与奖励攻击缓解。支持 OpenAI Chat/Responses 和 Anthropic Messages 三种协议。本文详解架构设计及其对中文开发者的意义。

编译发布 2026/07/13 原文发布 2026/07/13

一句话看懂

Prime Intellect 发布 Verifiers v1,将智能体强化学习环境拆分为 taskset(任务)、harness(求解)和 runtime(运行)三部分,支持多种协议并内置拦截服务器,用于训练与评估。

详细发生了什么

Prime Intellect 发布了 verifiers 0.2.0,预览了重写的 v1 核心(位于 verifiers.v1 命名空间)。v1 将之前捆绑的环境拆分为三个可组合部分:

  • Taskset:定义工作内容,包括数据、工具和评分逻辑。
  • Harness:求解任务并生成 rollout,可以是 ReAct 循环、CLI 智能体或自定义实现。
  • Runtime:运行 rollout 的环境,支持本地或沙箱(如 Docker)。

各部分解耦后,任何 taskset 都可以在任何兼容的 harness 下运行。

架构的核心是 verifiers 管理的拦截服务器,位于智能体 runtime 和推理服务器之间。它代理请求和响应,记录轨迹、设置采样参数,并可重写工具响应以缓解训练中的奖励攻击。每个服务器默认复用 32 个 rollout,池根据并发量弹性伸缩。

目前支持三种协议:OpenAI Chat Completions、OpenAI Responses 和 Anthropic Messages。协议适配器将各格式标准化为 vf.types,使评分逻辑独立于被测试的智能体。

中文圈视角

对于中文开发者,Verifiers v1 的模块化设计降低了构建智能体 RL 训练环境的门槛。但需要注意:

  • 可用性:Prime Intellect 是开源项目,无需梯子即可访问 GitHub 仓库。但训练和评估通常需要调用 OpenAI 或 Anthropic 的 API,国内用户可能需要代理或使用国产替代。
  • 国产平替:目前国内类似的开源工具较少。智谱的 AgentLM 和 ModelScope 的 Agent-FLAN 提供了部分功能,但未像 Verifiers 这样将环境拆分为独立组件。对于希望复现论文实验的团队,Verifiers v1 是一个更灵活的选择。
  • 合规考量:如果使用拦截服务器记录轨迹,涉及数据出境问题。建议在本地部署推理服务器(如 vLLM)并搭配国产模型,避免敏感数据外传。
  • 中文场景:对于中文代码生成、工具调用等任务,Verifiers v1 的协议适配器支持自定义 harness,可以方便地接入国产模型 API。但需注意,其评分逻辑目前主要针对英文基准,中文场景可能需要自行实现 scoring 函数。

几条值得记住的细节

  • Verifiers v1 将环境拆分为 taskset(任务)、harness(求解)和 runtime(运行)三部分,实现解耦。
  • 拦截服务器默认复用 32 个 rollout,池根据并发量弹性伸缩。
  • 支持三种协议:OpenAI Chat Completions、OpenAI Responses 和 Anthropic Messages。
  • 协议适配器将各格式标准化为 vf.types,评分逻辑独立于智能体。
  • v1 轨迹存储从 v0 的二次增长优化为线性增长,显著降低存储开销。

一句话总结

Verifiers v1 为智能体 RL 训练提供了模块化、可组合的环境框架,中文开发者可借此快速搭建实验平台,但需注意 API 调用和合规问题。