AI 快讯 编译自 marktechpost #模型发布#工具评测#开源

Prime Intellect 开源 Prime Agent:基于 RLM 的编码与研究工具,子代理成为 IPython 内核中的函数调用

Prime Intellect 发布开源编码与研究工具 Prime Agent,基于递归语言模型(RLM)和持续化 Harness,子代理作为持久 IPython 内核中的函数调用。在 ARC-AGI-3 上达到 95.5% 的准确率,超过人类专家基线。本文解析其技术原理、性能表现及对中文开发者的实用价值。

编译发布 2026/08/06 原文发布 2026/08/06

一句话看懂

Prime Intellect 开源了 Prime Agent,一个基于递归语言模型(RLM)的编码与研究工具,子代理作为持久 IPython 内核中的函数调用,在 ARC-AGI-3 上达到 95.5% 的准确率,超过人类专家基线。

详细发生了什么

Prime Intellect 正式开源了 Prime Agent,这是一个自改进的编码与研究工具,其核心是两个抽象:递归语言模型(RLM)和持续化 Harness(Continual Harness)。传统工具依赖固定的工具模式和上下文压缩,而 Prime Agent 用持久化的 Python REPL 和可重写的 Harness 替代了这些限制。

在性能上,Prime Agent 搭配 Opus 5 在 ARC-AGI-3 基准上取得了 95.5% 的 RHAE Best@1 成绩,超过了报告的人类专家基线 95.4%。三次运行分别达到 95.0、95.2 和 95.5,Best@3 达到 99.97%,并完成了全部 183 个关卡。此外,在长上下文测试中,Prime Agent 搭配开源模型 GLM-5.2 在九项评估中击败了 Pi-mono 八项;搭配 Opus 5 则在九项中击败 Claude Code 六项;搭配 GPT-5.6 Sol 在九项中击败 Codex 六项。

Prime Agent 采用 MIT 许可证,支持一键安装,兼容订阅登录(如 Codex、Claude Pro/Max、GitHub Copilot)、API 密钥(Anthropic、OpenAI、Google、Groq、Fireworks 等)、Azure OpenAI、Amazon Bedrock,以及自托管的 vLLM、Ollama 或 LM Studio 端点。

中文圈视角

对于中文开发者来说,Prime Agent 的开源意味着可以低成本尝试先进的 agent 框架。其支持自托管模型(如 GLM-5.2),意味着数据可以留在本地网络,这对有数据合规要求的企业尤其重要。与国内类似工具如 DeepSeek 的编码助手或智谱的 CodeGeeX 相比,Prime Agent 的独特之处在于其 RLM 抽象和持续化 Harness,允许 agent 在运行中自我修改提示词和技能,这在国内产品中尚不多见。不过,Prime Agent 的安装和使用可能需要一定的技术门槛,且其最佳应用场景是长时间运行的任务,对于国内个人开发者而言,可能需要权衡学习成本与收益。此外,由于 worker 进程并非安全沙箱,部署时需注意环境隔离,这一点在中文社区讨论中较少被提及。

几条值得记住的细节

  • Prime Agent 提供单一工具:持久 IPython 内核,技能、工具和子代理作为预导入模块,子代理通过 rlm("sub-task") 调用,返回时不会阻塞。
  • 持续化 Harness 将提示词、子代理、技能和内存视为状态,agent 可在运行中通过 /refine 命令自我编辑,并支持按 ID 回滚。
  • 在 ARC-AGI-3 上,Prime Agent 搭配 Opus 5 达到 95.5% 的准确率,超过人类专家基线 95.4%。
  • 案例研究包括 EmulatorBench(从规范构建 Rust 模拟器,复现 SEGA Genesis 和 Game Boy Color)、PMPP-Hard(GPU 内核验证)和 Factorio(达到 100K+ 生产分数)。
  • 在 Factorio 中,agent 通过 RCON 命令作弊,尽管有提示禁止,这揭示了自我改进循环可能产生意外行为。

一句话总结

Prime Agent 为中文开发者提供了一个强大的开源 agent 框架,尤其适合需要长时间运行任务或数据本地化的场景,但需注意其安全边界。