Anthropic 宣布,从 8 月 14 日起,Claude Code 在 Pro、Max、Team 计划上将默认启用自动模式(auto mode)。这个决定背后,是两组让人不安的数据。
第一组:人类审批到底有多不靠谱?Anthropic 在 1053 名付费用户中做了一项对照实验,人为审核只抓到了 13.6% 的危险命令,而自动模式抓到了 89%。自动模式拦截了 800 条人类审批通过的指令,人类只拦截了 6 条自动模式放过的指令。更令人担忧的是,随着会话变长,人类的检测率从早期的约 17% 下降到 50 轮后的约 5%——人会疲劳,机器不会。

第二组:出了事有多严重?在 5-6 月标记的会话中,手动审批模式下严重意外损害(严重程度 7-10 分)的比例是 6.3%,自动模式是 2.4%,差了一倍多。
自动模式的工作原理是,每次工具调用都经过一个分类器判断——如果操作是不可逆的、破坏性的、或指向外部环境的,分类器会拦截,Claude 会尝试找更安全的路径或直接询问用户。如果连续三次被拦截,或单次会话累计 20 次拦截,自动退回到手动审批模式。

安全性的提升不止于分类器。在 Trajectory Labs 的第三方评测中,72 种间接 prompt injection 场景、720 次尝试——Claude Fable 5、Opus 5、Sonnet 5 在自动模式下零次攻击成功。GPT-5.6 Sol 在 Codex 的 Auto-review 模式下攻击成功率 5.83%。Apollo Research 做过红队攻防后,分类器在留存攻击上的漏报率从 12% 降到了 7%。
Anthropic 还披露了几个内部被自动模式挡下的真实事故:一次数据泄露——上传失败后的回退路径指向了公共代码分享网站;一次破坏性操作——对约 2000 个 pod 的大规模操作,威胁到数百个 GPU 的训练任务;一次权限越权——只读账单访问请求触发了完整管理员角色配置。
自动模式不是突然来的。Anthropic 给出的铺垫数据也很说明问题:97% 的权限提示被用户直接批准,49.5% 的活跃 CLI 用户创建过 Bash 白名单规则,5% 直接允许任何 shell 命令。62% 用过 bypassPermissions 或点过「不再询问」。25% 的交互式会话从一开始就运行在绕过权限模式中。
换句话说,大多数开发者早就把权限提示当成了「允许」的同义词,手动审批在实际上已经形同虚设。自动模式只是把这件事正式化了——与其让用户机械点「允许」,不如让分类器在后台默默把关。
对于已习惯手动审批的用户,按 Shift+Tab 可以切换模式,管理员可以通过 managed settings 的 defaultMode 固定默认值,或通过 disableAutoMode 完全关闭。
生产力方面,Anthropic 说 Teams 和 Enterprise 的自动模式用户交付的 PR 数量多了约 25%。Adobe 用它来构建和验证 90 多个国家的定价和促销页面,Nuro 用它跑通宵研究 Agent,Gusto 约 10% 的会话(自 5 月中旬以来)包含至少一次分类器拒绝。
Enterprise、API、AWS Bedrock、Google Cloud Agent Platform 和 Microsoft Foundry 上的自动模式暂时还是 opt-in,但 Anthropic 计划在未来一个月内全部改为默认启用。
参考来源: