Reed's News
← 返回精选

Cloudflare推出AI流量分类管理新选项

AI 52 alphabetatango 2026/7/25 2533 字 原文 ↗

一年前,我们宣布首个「内容独立日」https://blog.cloudflare.com/content-independence-day-no-ai-crawl-without-compensation/,为网站所有者提供了夺回内容控制权的工具。爬虫与网站所有者维持30年的默契——「我们抓取你的内容,你获得流量导入」——已不复存在。AI技术只顾攫取内容,却毫无回馈,给网站所有者的生存带来了威胁。为此,我们推出了一键「屏蔽AI爬虫」功能,以及

付费抓取市场

过去一年间,局势已发生巨大变化。去年7月,关于「AI爬虫」的讨论还聚焦在「无补偿禁止AI训练」上,直指内容被用于模型训练却未给网站所有者带来任何价值的零和博弈。但如今,大家开始追求更精细化的方案:内容所有者仍希望能保护自己的内容,也理应凭借辛苦创作、整理和分享的原创内容获得补偿。我们也意识到,一刀切地封锁内容并非万能;网站所有者想要的,不只是「每次都屏蔽所有自动化程序」这一个选项。

如果你运营的是小型网站,核心问题或许还不是「有人用你的内容训练模型」,而是「根本没人能找到你的网站」。于是你不得不做一场浮士德式的交易:要么在搜索引擎中曝光,任由AI抓取内容训练模型;要么放弃曝光机会,承担无人问津的风险。如果头部搜索引擎用同一套爬虫同时做搜索抓取和模型训练,这种模式会让它们获得不公平的优势;而这种优势又会驱使新玩家采取隐蔽手段来缩小竞争差距。

AI已无处不在

如今,AI技术已经渗透到各类应用中。Google搜索早已不再是单纯的AI排序工具,而是进化成了能在结果页直接给出答案的「全量问答引擎」https://blog.google/products-and-platforms/products/search/search-io-2026/。不止Google,整个「搜索」领域都在朝这个方向发展。

我们大可争论当下「AI」的定义边界,但很快就会发现标准又会改变。因此,我们不再简单地将爬虫划分为「AI爬虫」或「非AI爬虫」,而是采用更精细化的分类逻辑,聚焦爬虫或智能体的行为本质:它在我的网站上做什么?它存储了哪些内容?它会如何重新分享我的内容?

务实的分类体系

为解答这些问题,我们需要更细致的视角——一套贴合客户实际AI使用场景的务实分类体系。因此,我们将讨论范围从AI训练拓展到三类核心AI使用场景,让所有客户都能对其进行管理:

  • 搜索类:收集或索引你的内容,以便后续回答相关问题。核心特征是主动构建网站内容数据库,用于响应用户未来的查询。网站所有者应获得流量导入或其他等价补偿。
  • 智能体类:受用户指令驱动,代表人类访问网页。
  • 训练类:抓取你的内容用于训练或微调模型。核心特征是你的数据会被永久整合到AI的底层架构中,用于提升其能力。

网络上许多主流爬虫都可归入上述某一类,有些甚至同时属于多类。除了以上三类,我们还划分了其他多种行为类别——包括广告验证、内容源抓取、智能体交易(下文将详述)。但我们认为,所有网站所有者都应能轻松管理这三类AI核心场景的访问权限。我们主张爬虫运营方拆分其爬虫,这能提升对网站所有者的透明度:让他们更清楚某款爬虫访问网站的目的,也能更精准地管控访问权限。如果一家公司的自动化系统同时承担搜索索引构建、智能体交互、训练数据收集三种功能,我们强烈建议将其拆分为三个独立的爬虫。

我们希望这套分类体系具备可扩展性,能随着自动化流量生态的演变而适配。追踪爬虫的用途并非新鲜事,但我们的新分类体系做出了几项更新,更贴合当前爬虫流量的现状。其中最关键的一点是:对于具备多种用途的爬虫,我们会追踪其全部用途,而非只标注其中一种。

AI流量管理新选项

我们希望为Cloudflare网络上的所有网站所有者,提供更多管理不同类型AI流量的选项。

我们此前推出的「屏蔽AI爬虫」预设管理功能,针对的是单一用途的模型训练爬虫,如下所示:

BLOG-3337 2

2025年7月1日的AI爬虫流量管理设置截图。

但AI的用途各不相同,我们希望为客户提供所需的精细化管控能力。因此,我们推出了基于搜索、智能体、训练三类核心场景管理AI流量的功能。借助这些新选项,所有客户(包括免费版用户)都能更精准地管控AI爬虫流量。

BLOG-3337 3

2026年7月1日的AI爬虫流量管理新选项截图。

设置新默认规则

2026年9月15日起,我们将为这三类场景分别设置新的默认规则。对于所有新接入Cloudflare的域名,训练类智能体类爬虫默认将被屏蔽,但仅限于展示广告的页面;而搜索类爬虫默认仍允许访问。

广告是网站所有者希望用户访问并浏览的信号——这是一种可变现的资源,支撑着网站的运营。因此在这类页面上,我们将用户注意力视为核心目标,阻止可能干扰这一目标的爬虫(即训练类和智能体类爬虫)。另一方面,搜索类爬虫是最自然的流量导入渠道,允许其访问符合大多数网站所有者的利益。

9月15日起的另一项变化是:多用途爬虫(尤其是同时兼具搜索和训练功能的爬虫)将根据其全部行为来判定是否允许访问,这与我们为网站所有者提升透明度的理念一致。由于默认规则将遵循最严格的适用标准,对于选择屏蔽训练类爬虫的客户(无论是通过新的AI流量管理选项,还是旧版的「屏蔽AI爬虫」服务),Googlebot、Applebot、BingBot等多用途爬虫将被自动屏蔽。

当然,客户的选择权始终是第一位的:如果网站所有者希望退出这些新默认配置,可在9月15日之前随时在安全设置中轻松操作,确认自己希望对同时具备搜索功能的训练类爬虫不做任何更改。在临近9月15日时,我们也会持续通知客户即将到来的默认规则变更,确保希望自定义设置的客户有充足时间调整。

BotBase:面向企业客户的全新可见性工具

我们还兴奋地宣布,企业级爬虫管理服务将迎来一项重大可见性更新——全新功能BotBase。随着Cloudflare追踪的爬虫目录不断扩大,客户希望能按合理的分组管理爬虫,并了解特定爬虫的更多细节。

在此介绍BotBase。这是我们全新的已知爬虫数据库,涵盖已验证爬虫和智能体。客户可在Cloudflare控制面板上直接查看这个全面、可搜索的爬虫目录。我们目前先聚焦于提升可见性,今年晚些时候,还会将BotBase拓展为网站自动化内容的直接管控中心。

借助这一新界面,企业级爬虫管理客户可以查看所有已验证爬虫/智能体的完整列表,以及它们在新分类体系中的归类——这是我们首次在Cloudflare控制面板上动态展示此类信息。客户若想精准定位某款爬虫,可轻松筛选该爬虫的所有流量,还能复制其检测ID用于安全规则配置。所有这些功能都已在专属页面上线,可通过爬虫管理配置卡片访问。

在构建BotBase时,我们考虑了所有能帮助我们针对不同爬虫生成可扩展、有价值洞察的信息维度。其中一个核心维度就是我们新分类体系的基石:爬虫在网站上的行为。我们将行为分类如下,每款爬虫会被标注一个或多个行为类别:

爬虫分类 行为与用途
搜索类 抓取网站内容,帮助网站在搜索引擎结果中展示
智能体类 受用户指令驱动,代表人类访问网页
训练类 抓取内容用于训练或微调模型
交易类 代表用户完成结账操作
数据收集类 包括价格抓取、竞品情报收集、第三方分析
安全测试类 包括漏洞扫描、渗透测试
SEO类 SEO抓取、网站审计、无障碍检测
广告验证类 广告投放验证、广告欺诈检测
社交/链接预览类 社交平台和消息应用的链接预览
内容源抓取类 包括RSS阅读器、播客聚合器、新闻推送爬虫
监控与运维类 包括可用性监控、Webhook、健康检查

粗体斜体行表示面向所有客户开放的新可配置选项。

爬虫会如何使用我的内容?

我们了解到,客户还关心爬虫的内容使用方式——即爬虫抓取内容后会保留和重新分享哪些信息。为此,我们正在为爬虫管理客户开发基于「内容使用方式」选择和屏蔽爬虫的功能。该设置分为三个等级,从限制最严到最宽松:

  • immediate(即时使用):仅交互,不存储或复用任何内容
  • reference(引用使用,默认):建立索引、摘录内容并提供反向链接
  • full(完整使用):总结并再现内容

这些选项可与爬虫分类结合,制定精细化规则,例如「允许所有搜索类SEO类广告验证类爬虫,但仅允许其使用reference等级的内容权限」。这让网站所有者能够按合理分组决策,无需逐一管理单个爬虫的规则。

为进一步支持这一功能,从今日起,我们开始测试一项名为use的新信号,它是内容信号的扩展,可写入robots.txt文件。它在第一版内容信号的三个字段基础上,新增了第四个可选字段,对应上述三种使用偏好:

  • use=immediate
  • use=reference
  • use=full

与robots.txt中的其他内容一样,内容使用信号仅表达网站所有者的偏好,而非直接执行屏蔽。我们现已支持这一扩展:所有已启用托管robots.txt的客户(其文件默认包含「允许搜索抓取,但禁止AI训练抓取」的偏好),将自动在robots.txt中添加use=reference的偏好设置。

# Cloudflare 托管内容及原版内容信号
User-agent: *
Content-Signal: search=yes,ai-train=no
Allow: /

包含原版内容信号的Cloudflare托管robots.txt内容。

# Cloudflare 托管内容及新增内容使用信号
User-agent: *
Content-Signal: search=yes,ai-train=no,use=reference
Allow: /

添加了新参数的Cloudflare托管robots.txt内容。

我们还开始在BotBase中追踪每款爬虫的内容使用方式。一旦发现爬虫滥用这些信号,它将失去「已验证」状态,不再被允许访问。目前,会完整再现内容的爬虫无法获得「已验证」状态。

「已验证」爬虫意味着什么?

说到「已验证」,我们正在更新已验证的定义,以匹配即将调整的默认允许/屏蔽规则。此前,所有已验证爬虫默认都被允许访问,这一点在我们的基础

屏蔽 unwanted自动化流量服务,以及面向企业级爬虫管理客户的规则模板中都有体现。

爬虫防护模式 从今日起,我们将对此进行精细化调整:未验证爬虫仍默认被屏蔽,但「已验证」不再等同于「默认允许访问」。今后,「已验证」标签仅表示该爬虫可被其所属类别允许访问,具体是否允许将由允许的类别(例如允许搜索类爬虫)决定。

为平衡这一变化,我们正在开放「已验证」爬虫的申请流程,并提升透明度。爬虫运营方若想获得「已验证」身份,需满足两个条件:一是如实披露自身身份,二是不滥用由此获得的访问权限。为方便爬虫运营方操作,我们正在开发管理工具,帮助他们确保在Cloudflare分类体系中的信息准确(将于近期公布)。

BLOG-3337 4

面向BotBase(Cloudflare爬虫目录的下一代产品)现有及潜在爬虫运营方的专属平台预览截图。

探索可传递信任机制

还有一点值得关注:访问你网站的爬虫(或智能体),其运营方往往并非开发它的公司。像Cloudflare开发者平台这样的服务,同时为数千家不同运营方运行自动化程序,既有大型企业,也有你从未听说过的独立开发者。你可能信任Stripe,但未必信任所有将Stripe工具集成到个人项目中的开发者。

我们将这种「网站所有者 → 爬虫运营公司 → 终端用户」的模式称为可传递信任,并提议利用RFC 7239中定义的现有Forwarded请求头——它能让「代理组件披露代理过程中丢失的信息」。

这类似于X-Forwarded-For用于传递IP地址,或X-Forwarded-Host用于保留原始Host头的作用。因此,当网站所有者设置「允许该运营方访问」时,无论该运营方是直接访问,还是通过三层受信任的中介访问,这一偏好都将生效。更多细节可查看我们的文档,以下是一个简单的格式示例:

Forwarded: for="openai"

结合上文提到的内容使用扩展,请求头可设置如下,明确运营方对所访问内容的使用方式:

Forwarded: for="openai";use="reference"

这也与我们希望构建的激励机制一致:失去Cloudflare所服务的超过20%的网站域名的信任,将是一种强有力的威慑。信任将成为一种可传递的资产,同时也可能被剥夺。

然而,随着爬虫流量与人类流量逐渐融合,这种可传递信任机制可能无法覆盖那些无法公开身份的流量来源。我们今日提出的措施有助于传递信任,但并非适用于所有网站和所有场景。小型流量来源

、以及希望履行隐私承诺的公司,应该能够探索公平的基础方案,构建智能体互联网的未来,例如

隐私需求 隐私化速率限制

即刻设定你的规则

这些看似微小的调整,都朝着同一个方向推进:让网站所有者对内容的使用者和使用方式拥有更多控制权。我们相信,今日公布并即将实施的新默认规则,能提升透明度,更贴合行业发展趋势。

当然,互联网生态仍将不断变化,我们也会持续调整应对。但前进的方向不会改变——这是Cloudflare创立之初就坚守的理念:构建一个基于信任的网络生态。内容创作者有权决定自己的作品如何被使用;如实披露行为的主体,将获得更多而非更少的访问权限。

这些AI流量管理新选项现已上线,所有现有客户均可在域名设置中配置。尚未使用Cloudflare?

即刻免费开始使用,设置你想要的流量管控规则。

祝大家内容独立日快乐。

BLOG-3337 5