AI 编程 Agent 的账,大多数人算错了。
Stencil 的 Can Boluk 发了一篇文章,拆开了一份来自 SWE-Bench 基准测试的数据:在 1.81 亿个 token、近 200 万次工具调用中,编辑和写入只占了 9%。剩下 91% 全在阅读——读文件、grep 搜索、查看输出。

换句话说,Agent 的钱不是烧在写代码上,是烧在读代码上。
这个事实意味着一个反直觉的结论:业界流行的 /plan 模式——让贵模型做规划、便宜模型来执行——其实更烧钱。因为便宜模型在拿到规划文档之后,还得重新读一遍贵模型已经读过的所有文件。理解没有继承下来,成本却重复付了一次。
Boluk 的原话是:一份计划书只是一张 2000 token 的明信片,寄自一个 100K token 的完整上下文。执行者"拿到的是明信片,不是理解"。
于是他提了一个方案,叫 Prewalk。
Prewalk 的思路极其简单:不要传计划书,直接传整个上下文。

具体做法分三步。第一步,让前沿模型带着一条隐藏指令启动——先深入探索、把计划写成任务清单、然后开始执行。第二步,放手让它去探索、写清单、完成一个有效的代码编辑。第三步,在第一个编辑落地的那一瞬间,把上下文切给便宜模型,同时把规划指令从上下文中完全删除。
便宜模型执行任务的时候,它看到的是:已经有人探索过了,已经有个任务清单了,已经有一个编辑漂亮地完成了。它不会收到"做计划"的指令——它只看到一件事要做:照着这个模式继续。
这背后的行为动力很微妙。Boluk 管它叫"有样学样"——前面的模型只示范了一步,但这一步是在深入理解之后迈出的,足够让后面的模型知道怎么走。

数据很硬。
用 GPT-5.6 Sol 做前沿模型、Luna 做执行器,Prewalk 拿下 85% 的通过率——是 Sol 单独完成(88%)的 97%,但成本只有 61%(1.04 美元 vs 1.71 美元),速度还快了 47%。换成 Opus 4.8 配 Gemini Flash 3.5,Prewalk 达到 Opus 单独完成的 92%,但只花了 53% 的钱。
作为对比,Opus /plan 模式:成本比 Opus 单独跑还高了 14%,通过率一模一样。多花的钱换来的是一张没用的明信片。
还有一个意外发现。Prewalk 显著降低了模型的"作弊"行为——就是 Agent 在卡住的时候去网上搜正确答案。Opus 4.8 单独跑有 44% 的任务会作弊,/plan 模式下飙升到 72%,Prewalk 压到了 13%。Boluk 的解释是:作弊往往发生在探索陷入死胡同的时候(大约第 12-14 轮),Prewalk 在前沿模型完成第一轮探索后就把它关了,刚好在绝望开始之前退场。

换句话说,Prewalk 不只是省钱,它让执行更诚实,因为继承来的上下文里已经有了"这条路走得通"的证据。
代码已经合入了开源 Agent 框架 omp,--prewalk 一个 flag 就能开。Boluk 说这套思路在任何 Agent 脚手架里都很容易实现。它的本质不是新技术,而是对上下文窗口的重新理解:当你让一个模型替另一个模型"预热"上下文,你不需要让它干完所有活,只要开一个足够好的头。
参考来源: