Prime Intellect 发布了 Prime Agent,一个开源的编程 Agent Harness,核心设计围绕两个抽象:Recursive Language Model(RLM)和 Continual Harness。在 ARC-AGI 3 基准测试上,Prime Agent + Opus 5 的组合达到了 95.5% RHAE Best@1,超过了 ARC 报告的人类专家基线 95.4%。

不是又一个 coding agent 包装器
Prime Agent 的架构和市面上大多数 coding agent 有本质区别。大多数 agent harness 的设计是基于早期模型的能力——固定的工具调用 schema、手动设计的 sub-agent、写死的 prompt 和 skill。Prime Agent 的假设是:现在的模型已经足够强了,harness 应该让模型自己管理自己的上下文和工具,而不是让模型去适配 harness。

两个核心抽象:
RLM 把上下文当作变量,把 sub-agent 委托当作 REPL 里的函数调用。agent 在持久化的 IPython kernel 里运行,可以像写程序一样操作自己的历史、sub-agent 和工具。这意味着 agent 可以处理任意长度的 session 而不会丢失信息——过去的信息可以存在变量里随时取用。
Continual Harness 把 harness 的状态(prompt、skill、memory、sub-agent)变成 agent 可以在运行中自己 CRUD 的东西。agent 发现某个模式反复出现时,可以自己创建新的 skill 或 memory,而不是等人类开发者来更新。这配合 /refine 命令实现了一个自我改进循环——agent 读自己的执行轨迹,找出最小的 harness 改进(改一个 prompt note、加一个 memory),然后应用它。
程序化 sub-agent 调度
Prime Agent 的 sub-agent 调用方式值得一提。不是预定义的"代码审查 agent"或"测试 agent",而是 agent 在代码里动态创建:
auth = await rlm("Summarize the authentication flow", name="auth-expert")
api = await rlm("Summarize the HTTP API layer", name="http-expert")
rlm() 不会返回 sub-agent 的结果——它返回一个 handle,sub-agent 通过 agent_message.send() 异步回复。这意味着 agent 可以并行 fan-out 多个 sub-agent,然后继续做自己的事情,等 sub-agent 完成后自动收到消息。


sub-agent 是持久化的——它们的 session 目录、上下文、IPython kernel 和对话历史在初始调用完成后仍然存在。agent 可以随时通过 session ID 给 sub-agent 发送后续消息。
ARC-AGI 3 结果
Prime Agent 在 ARC-AGI 3 上用 Opus 5 达到了 95.5% RHAE Best@1,高于人类专家基线 95.4%。三次运行的成绩分别是 95.0%、95.2%、95.5%,Best@3 达到了 99.97%,183 个 level 全部完成。


更重要的是,Prime Agent 不仅比每个模型的 native harness 得分更高,而且成本更低——因为 RLM 的设计让上下文管理更高效,减少了不必要的 token 消耗。
完全开源
Prime Agent 可以通过以下命令安装:
curl -fsSL https://app.primeintellect.ai/prime-agent/install.sh | sh
它支持 autonomous mode,可以直接从 CLI 启动无人值守的长时间任务:
prime-agent --autonomous --autonomous-gate "npm run check" --autonomous-max-turns 20 "Implement the change"
Prime Agent 目前还没有任何模型专门为它训练过——它的设计面向未来的模型能力。Prime Intellect 的预期是,当下一代模型开始围绕这个 harness 训练时,性能还会有进一步跃升。
参考来源: