Harness-1 发布:20B 参数检索子智能体,用强化学习在状态化搜索框架中训练,开源权重和代码
UIUC、UC Berkeley 和 Chroma 联合推出 Harness-1,一个 20B 参数的检索子智能体。它通过状态化搜索框架分离决策与簿记,在 8 个基准上平均 curated recall 达 0.730,超越其他开源模型 11.4 分,仅次于 Opus-4.6。权重和代码已开源。
一句话看懂
Harness-1 是一个 20B 参数的开源检索子智能体,通过将搜索簿记移出策略网络、放入状态化框架,在 8 个基准上平均 curated recall 达到 0.730,超越其他开源模型 11.4 分,仅落后于闭源的 Opus-4.6。
详细发生了什么
伊利诺伊大学厄巴纳-香槟分校、UC Berkeley 和 Chroma 的研究团队提出了 Harness-1,一个基于 gpt-oss-20b 的 20B 参数检索子智能体。核心创新是“状态化认知卸载”:将搜索过程中的候选池、重要性标记的精选集、证据图和验证记录等簿记工作交给环境(harness),而策略网络只负责语义决策——搜索什么、精选哪些文档、验证哪些声明、何时停止。
Harness-1 使用 8 个工具:fan_out_search、search_corpus、grep_corpus、read_document、review_docs、curate、verify 和 end_search。训练分为两步:先用 GPT-5.4 生成的 899 条轨迹进行 SFT,再用 on-policy CISPO 进行强化学习,奖励函数包含发现、选择和工具多样性奖励。训练仅使用 SEC 查询,但效果泛化到其他领域。
在 8 个基准(涵盖网页、金融、专利和多跳 QA)上,Harness-1 的平均 curated recall 为 0.730,比第二名开源模型 Tongyi DeepResearch 30B 高出 11.4 分,仅落后于闭源模型 Opus-4.6(0.764)。在未见过的基准上提升更大(+17.0 分 vs 源任务 +7.9 分),表明学到的搜索操作具有泛化性。权重和代码已开源,支持 vLLM、SGLang 或 Transformers 部署。
中文圈视角
Harness-1 对中文用户有几点值得关注:
-
开源可复现:权重和代码完全公开,国内开发者可以直接在本地或云服务器上部署,无需依赖闭源 API。这对于需要定制化检索场景的团队(如法律文书检索、学术文献综述)尤其有价值。
-
与国产模型的对比:论文中对比了 Kimi-K2.5(0.647 curated recall),Harness-1 表现更好。但 Kimi 等国产模型在中文场景有天然优势,而 Harness-1 目前主要针对英文数据。国内团队可以借鉴其“状态化框架”思路,在国产基座模型(如 Qwen、DeepSeek)上复现类似方法,可能提升中文检索效果。
-
应用场景:Harness-1 适合证据型检索,例如金融文档分析、专利检索、多跳事实核查。中文用户在做类似工作时,可以尝试用 Harness-1 作为 RAG 系统的检索模块,替代传统的向量检索或 BM25。
-
监管与合规:由于是开源模型,数据可以完全本地处理,避免数据出境风险。对于金融、法律等对数据安全敏感的行业,这是一个优势。
几条值得记住的细节
- Harness-1 的精选集上限为 30 篇文档,重要性标签分为 very_high、high、fair、low 四级。
- 训练仅使用了 4,352 个唯一项目,远少于许多基线模型。
- 工具多样性奖励是关键:没有它,模型会重复搜索,curated recall 仅 0.53;加上后提升至 0.60。
- 证据图通过正则表达式提取实体,而非完整的实体链接,可能存在精度损失。
- 权重和代码已开源:arXiv:2606.02373。
一句话总结
Harness-1 证明将检索簿记外置能显著提升开源模型的搜索质量,中文开发者可直接复用其框架和代码。