Cloudflare 宣布彻底重构 AI 爬虫管控体系。过去那个一键"拦截所有 AI 机器人"的开关被拆成了三个独立选项:Search(搜索)、Agent(智能体)、Training(训练)——包括免费版在内的全部客户都可以分别配置。

这是一个比表面看起来更重要的分类。
Search 爬虫的目的是索引内容、在查询时给出答案。Cloudflare 的态度是:可以放行,但网站主应该获得推荐流量或补偿。Agent 爬虫是替用户实时执行任务的,ChatGPT-User、Gemini 或 Claude 驱动的浏览器操作都归入此类。Training 爬虫是来拿数据做训练的,数据会"永久嵌入模型的底层架构"。
新默认规则将于 9 月 15 日生效:对于新接入 Cloudflare 的域名,Training 和 Agent 爬虫在展示广告的页面上将默认被拦截。搜索爬虫不受影响。
真正狠的是多用途爬虫的处理方式。Googlebot、Applebot、BingBot 这类既做搜索索引又做 AI 训练的爬虫,将按最严格的规则执行——一旦网站主拦截了 Training,这些巨头爬虫全部吃闭门羹。
理由很直接。Cloudflare 的原话是:「广告是一个信号,意味着网站主期望真人落在那个页面上看到它。」你不该用机器人消耗广告位的带宽,更不该把那些内容拿去训练模型。

与此同时,Cloudflare 还发了三个配套动作。
一个是 BotBase,面向企业客户的爬虫可见性数据库,列出所有已验证机器人的分类、用途,可以搜索、过滤、导出检测 ID 用于自定义安全规则。
一个是 Content Signals 规范的扩展。新增了一个 use 信号,三个取值:immediate(交互但不存储)、reference(索引、摘要、回链,默认值)、full(摘要和复现)。托管 robots.txt 默认添加 use=reference。违反信号的机器人会被吊销 Verified 状态,而且,当前任何全量复制内容的机器人都不能获得 Verified 认证。
还有一个实验性的"传递信任"方案。通过 RFC 7239 定义的 Forwarded 头,爬虫可以携带身份和使用意图穿越中间层,格式是 Forwarded: for="openai";use="reference"。目标是让信任「成为你可以随身携带的东西,也是你可以失去的东西」。考虑到 Cloudflare 背后站着超过 20% 的全球网站,丧失信任状态的威慑力确实不是空洞的。
这一整套动作的逻辑起点,是 2025 年 7 月 Cloudflare 第一次推出那个著名的"一键拦截 AI 爬虫"按钮。当时的判断很简单:爬虫和网站主之间存续了 30 年的默契已经破裂——「我们爬你,你给我推荐流量」不再成立。一年后,一刀切的拦截被证明太粗糙,三段式分类是第二步。
Cloudflare 这次还预告了一个覆盖全网络的新功能,细节将在 2027 年初披露。官方的措辞值得留意:「一个以信任为基础的网络生态系统。创造内容的人可以决定内容如何被使用。」
参考来源: