公测刚满一周,DeepSeek Harness 发布了 v0.1.0-rc.8。
14 项更新,多模态是重头戏。新版支持原生图片请求和图文混合输入,/goal、/plan 等命令可以直接接收图片;Claude Code 和 Codex 进一步接入子 Agent 体系;Windows 终端加入持久 PowerShell 会话,极简模式预设默认开启。

但最值得聊的,不是这些明面上的更新。
有开发者发现,当一个模型本身不支持图像输入时,DeepSeek Harness 并不会直接报错放弃。它会退回到一套工具链:先 OCR 识别文字,再统计颜色比例、扫描像素行、读取图片尺寸和色彩模式等元信息。最后把这些结构化数据交回给文本模型,让模型根据这些证据“脑补”图片内容。
这等于给纯文本模型拼出了一套工具层的“视觉”。
有开发者在测试中展示了这个过程:调用 read_image 首先失败,但 Harness 随后自动切换到 OCR + 颜色统计 + 像素扫描的组合,把一张包含文字和图形的图片拆成了“文字内容及坐标”“背景颜色比例”“特定区域像素变化”“图片尺寸”等多组信息,再交给模型推理。

当然,这种能力和视觉大模型直接理解图片有明显区别。对于 PPT 截图、流程图、界面截图等结构明确的图片,OCR + 像素特征能拿到不少有效信息;面对真实照片、复杂空间关系,这套工具链恢复的信息就有限了。
但从 Agent Harness 的设计角度看,这个思路很有意思:视觉能力不完全绑死在底座模型上,工具也可以承担一部分感知工作。
事实上,在官方加强多模态支持之前,社区已经冒出不少视觉插件——dsh-vision、dsh-vision-toolkit、modlens、dsh-auto-vision、dsh-subagent-vision,以及通过 pi2dsh 桥接的 pi-vision 等。有的方案就是走 OCR + 像素分析的路子,有的通过自定义路由直接给视觉模型配置 input: [text, image]。rc.8 上线后,原生多模态和这些工具层方案可以进一步配合使用。
这也呼应了 DeepSeek Harness 公测时强调的核心设计——“一切皆插件”。模型、工具、技能、会话、沙箱、存储、循环、调度和 UI,都可以由不同插件组合和替换。视觉能力同样如此:原生模型能看就看,不能看就用工具拼。
子 Agent 体系也在扩容。Claude Code 和 Codex 现在可以作为 Profile Bundle 按需安装,Codex 还支持非交互权限模式和命名实例。加上 web_search 并发查询、子 Agent reportDelivery 及时唤醒父任务、本地 dsh web 自动打开浏览器等优化,这版 Harness 在工具编排的粒度上又往前走了一步。
SQLite 后端的读写和分叉性能也得到提升,但注意存储格式与旧版本不兼容。
国内开发者看到更新后直接感叹“DSH 支持多模态了,奔走相告”,海外社区则聚焦在子 Agent 集成和多模态的配合上。有网友评价 DeepSeek Harness 正变得“越来越有意思”。
从 8 月 13 日开源公测到现在,不到一周时间,DeepSeek Harness 就把多模态和更多子 Agent 装进了同一套 Harness。按这个迭代速度,接下来值得看的,是这套插件化体系能否把更多模型、工具和 Agent 装进来,跑出更复杂也更稳定的任务流程。
参考来源: