一条内测招募帖,发出去的时候大概没人想到它会变成一场开源 Agent 生态的路演。
8月1日,DeepSeek Harness 团队负责人崔添翼(tianyi)在 X 上发帖:
「如果你是 Agent Harness 相关开源项目的开发者,希望参加 DeepSeek Harness 的内测,可以回复或私信联系我。请附上 GitHub id 以及开源代表作。」

DeepSeek 曾在官方招聘信息中写过一条简洁有力的公式:Model + Harness = Agent。模型负责理解和推理,Harness 负责把能力落到真实环境中——调用工具、读写文件、管理上下文、处理错误、完成闭环。崔添翼招人的标准也印证了这一点——他要的不是模型研究员,是有 Agent 开源工程经验的开发者。
海量开发者带着自己的项目涌入崔添翼招募内测成员的评论区,baboonAI4S(Claude Qin)对这堆报名数据做了一篇荟萃分析。他把 712 个项目按方向分类后,发现排名前三的赛道是:智能体框架(135个)、编程智能体(107个)、记忆与上下文(56个)。这三个方向加起来占项目总数约 42%,恰好对应 Agent 从 Demo 走向工程化的三道坎。

第一道坎是长任务执行。DeepSeek 自己的基准测试也在验证这个——Terminal Bench 测终端操作,Cybergym 测安全攻防,Toolathlon 测多工具调用,DSBench-FullStack 和 DSBench-Hard 聚焦全栈开发。这些测试的共同特征:任务链条长、步骤多,Agent 需要持续调用工具并根据反馈调整策略。报名项目里,deer-flow(79k 星)在探索长周期 SuperAgent 框架,CodeWhale(40k 星)是 DeepSeek 原生项目发展出的编程智能体,orca(36k 星)关注多 Agent 编排。
第二道坎是记忆。56 个记忆与上下文项目,累计 194k 星。开发者正在尝试用 Git、数据库、知识图谱各种路线解决同一个问题:Agent 怎么记住之前做过的事。baboonAI4S 在评论区和人讨论时把话讲得很直:「我觉得现在的 harness 要做好必须先回答一些更本质的问题——记忆和推理是不是一体两面?记忆是一个过程还是结果?记忆的承载形式是什么?难道还是 md 文档么?」他打了个比方,说想做好记忆就要做到「记忆推理一体化」,而那条路的终点指向一个更深的命题——自我到底是什么。
第三道坎是安全。研究与评测、安全治理两个方向各有 24 个项目,是最小的类别,但决定了 Agent 能不能进生产环境。报名区有开发者专门挖过 Codex、Claude Code、Cursor 等产品的漏洞,关注的是工具调用权限、文件系统隔离、代码执行沙箱这些一旦出事就不可逆的问题。
据了解,DeepSeek 已经在内部用 Harness 完成 DeepSeek-V4-Flash 的基准测试。它支持 Responses API 并已适配 Codex,识图模式正在灰度。社区据此猜测,DeepSeek 可能会推出一款面向软件工程场景的 AI Coding Agent,定位对标的正是 Claude Code、Codex 这类产品。

baboonAI4S 的分析文章评论区,有人问「哥报名了吗」,他回了一句:「没有 agent 作品啊 所以我围观,因为围观也是一种力量。」另一位自称提交了项目的开发者 poolmoon 则说:「感觉这个未来会不断被人考古。」
这倒没说错。它在 DeepSeek Harness 还没正式面世之前,就拍下了 Agent 基础设施赛道最活跃的玩家都在干什么。
参考来源: