说实话,每次有人问我"市面上已经有 Monica、Sider、Copilot for Chrome 这些 AI 浏览器插件了,你为什么还要再做一个",我都觉得这个问题问得好。
因为我自己也是从用户变成开发者的。
现有产品的天花板
我用过不少 AI 浏览器插件。刚开始觉得都挺好——选中一段文字,弹出解释;写邮件时帮你润色;看英文网页给你翻译摘要。但用久了你会发现,它们本质上都是同一类东西:一个带网页上下文的聊天框。
它们能读取页面的文本,然后把文本丢给大模型,再返回一段回答。仅此而已。
这当然有用,但总觉得差点意思。比如我在一个后台管理系统里,需要填50个表单字段,每个字段还有联动逻辑;比如我想让 AI 帮我把一个网页上的表格数据整理导出;比如我想让 AI 帮我点完一个多步骤的审批流程。这些场景里,"读页面文本"远远不够——我需要 AI 能真正去操作浏览器。
能点击按钮、能填写表单、能切换标签页、能管理书签和历史记录。不是给我一段操作指南让我自己去点,是 AI 自己去执行。
市面上的产品,大多数做不到。或者说,做到了也不开源。
AI Helper 想做的事
AI Helper 的核心定位很简单:让 AI 真正成为浏览器的一部分,而不是一个访客。

怎么理解这个区别?
访客模式:AI 通过 API 读取页面内容,生成回答,展示在侧边栏。用户看完回答,自己决定下一步做什么。AI 不参与执行。
参与模式:AI 不仅理解页面,还能直接操作页面。你说"帮我把这个表格里的数据导出成 CSV",AI 就去定位表格、提取数据、生成文件、触发下载。中间的多步推理和工具调用,由 ReAct 推理循环自主完成。
AI Helper 走的是第二条路。它内置了 44 个工具,覆盖页面交互、表单操作、内容提取、标签页管理、书签历史、存储管理、网络请求、媒体输出、AI 协作等十多个类别。模型通过 ReAct 循环自主决定调用哪些工具、按什么顺序执行,中间还会做三级反思——工具级反思、子任务反思、主循环后置反思——确保执行质量。
更进一步,浏览器沙箱终究有边界。有些操作——比如读写本地文件、执行系统命令——浏览器扩展本身做不了。AI Helper 提供了一个可选的 Node.js Agent 服务,连上之后 AI 就能突破沙箱,操作你的本地文件系统,甚至执行命令行工具。这个能力是可选的,默认关闭,需要你主动安装和授权。
为什么必须开源
除了功能定位,还有一个更根本的问题:数据安全。
市面上大多数 AI 浏览器插件是闭源的。你的 API Key、你浏览的页面内容、你的对话历史,都要经过它们的服务器。你不知道数据在中间经过了什么处理,存了多久,有没有被用于训练。你只能选择信任。
我不太想信任。
AI Helper 是 MIT 许可证开源的。你的 API Key 直接发送给模型厂商(默认 DeepSeek V4 Pro,也支持任何 OpenAI 兼容接口),中间没有任何第三方服务器。所有的对话历史、会话数据都存在你本地的 IndexedDB 里。代码全部公开,你可以审查每一行逻辑,也可以自行部署、自行定制。
这不是什么技术突破,就是一个态度问题:用户的数据,应该由用户自己掌控。
不是要替代谁
我不想把 AI Helper 包装成"碾压一切"的产品。Monica、Sider 这些产品有它们的用户群和产品哲学,做得也很好。AI Helper 不是要替代它们,而是填补一个空白:一个真正能操作浏览器的开源 AI Agent。
这个定位决定了它的受众比较明确——你需要 AI 不只是帮你"看"网页,还要帮你"做"事情;你关心数据隐私,希望代码可审计;你有一定的技术背景,愿意花时间配置和调优。
务实的心态
开发 AI Helper 的过程让我学到一件事:不要追求大而全,先把自己需要的功能做扎实。
44 个工具不是一开始就规划好的,而是在实际使用中一个个加上去的。最开始只有基本的页面读取和对话功能,后来发现需要填表单,加了表单工具;需要批量操作标签页,加了标签页管理;需要处理本地文件,加了 Agent 服务。ReAct 循环、反思系统、Token 预算管理、多智能体、Skill 系统、MCP 扩展,每一个都是在解决实际问题的过程中长出来的。
开源项目最怕的不是功能少,而是功能多但没有一个能用得顺手。所以我更倾向于:先确保核心路径跑通、跑稳,再考虑扩展。
如果你也在找一个能真正操作浏览器的开源 AI 助手,或者你对 ReAct 推理循环、浏览器扩展架构、AI Agent 工程实践感兴趣,欢迎来看看代码,提提建议,或者一起参与开发。
项目地址:
GitHub: https://github.com/xiweicheng/ai-helper
Gitee: https://gitee.com/xiweicheng/ai-helper