跳到主要内容
行业洞察 · 智核增长研究中心

Cloudflare让/crawl执行Content Signals:品牌官网怎样限制AI内容用途?

Cloudflare Browser Run的/crawl现会执行robots.txt中的内容用途信号。本文解释contentUse、search、ai-input、ai-train与use=reference的边界,并给出品牌官网配置和验收清单。

直接结论

Cloudflare于2026年8月31日让Browser Run的`/crawl`端点开始执行网站在`robots.txt`中声明的`use`内容用途限制:调用方要用`contentUse`说明只做引用级使用还是完整使用,若其意图高于网站允许的级别,请求会被拒绝并返回400。对品牌出海企业而言,这使`use=reference`第一次获得了一个可公开核验的产品级执行案例,但它只约束Cloudflare这一端点;Content Signals仍是偏好与权利保留信号,不是所有AI爬虫都会遵守的访问控制或引用保证。

事实与背景

Cloudflare在2026年8月31日的官方更新中宣布,Browser Run的/crawl端点现在会读取目标网站robots.txt里的Content Signals use指令。调用方可在请求中设置contentUse,当前允许值为referencefull,从限制更严格到更宽松排列;默认值是full。如果网站声明的允许级别比调用方的用途更严格,Cloudflare会拒绝该抓取请求并返回HTTP 400。

这项变化的重要性不在于又出现一个robots字段,而在于从“网站表达偏好”推进到“具体抓取产品在请求时执行偏好”。此前Cloudflare已把searchai-inputai-train定义为三种目的信号,并测试use扩展来描述内容在被访问后最多可怎样保存和复用。本次更新给出了一个可验证的执行结果:当调用方声明的用途越过网站允许边界时,Cloudflare Browser Run的/crawl不再继续抓取。

目的信号与使用级别解决的是两个问题

信号或参数回答的问题当前官方含义品牌应如何理解
search为什么抓取建立搜索索引并提供链接与短摘要,不含AI生成式搜索摘要决定是否表达传统搜索与链接发现意愿
ai-input为什么抓取在查询时把内容输入模型,例如RAG、grounding或生成式AI搜索答案与搜索收录、训练授权分开决策
ai-train为什么抓取训练或微调AI模型不应因允许搜索而默认允许训练
use=immediate访问后最多怎样使用可以交互,但不保存和复用最严格的内容使用偏好
use=reference访问后最多怎样使用索引、摘录并链接回来源适合优先要求来源回链、限制完整复用的公开内容
use=full访问后最多怎样使用可以摘要和再现应在内容授权与商业目标允许时采用

两组信号不能互相替代。ai-train=no只表达不用于训练,并没有说明是否允许查询时输入模型,也没有说明抓取后可保存到什么程度;use=reference限制内容使用级别,却不单独回答抓取目的是搜索、实时AI输入还是训练。品牌要同时回答“为了什么访问”和“访问后最多怎样使用”,不能只抄一行示例就认为策略已经完整。

Cloudflare /crawl怎样执行这些边界

Cloudflare的/crawl文档还提供crawlPurposes参数,调用方可以声明searchai-inputai-train中的一个或多个用途;默认包含三者。如果目标网站在Content Signals中把调用方声明的任一用途设为no,该请求会被拒绝并返回400。与此同时,contentUse声明调用方所需的使用级别;网站的use更严格时,同样触发拒绝。

因此,调用方若不显式缩小目的和用途,就可能因为默认的“全部目的加full”与品牌网站的限制冲突。例如,网站允许搜索、拒绝训练并只允许reference,而调用方沿用默认参数时,请求就不符合网站声明。对开发者而言,正确做法是按真实业务意图声明最小必要的crawlPurposescontentUse,并把400分类为策略冲突,而不是无条件重试或改换身份绕过。

对网站方而言,400是Cloudflare端点的执行结果,并不是全网Bot访问日志的统一状态。其他爬虫是否识别、如何解释、是否执行Content Signals,仍取决于各自产品与政策。服务器上没有出现Cloudflare /crawl请求,也不能反向证明其他AI系统没有抓取或使用内容。

use=reference适合什么,不适合什么

对希望参与海外搜索和AI来源发现、同时不希望正文被完整再现的品牌,use=reference提供了比“全部允许”或“全部封禁”更细的公开表达:内容可以被索引、摘录,并应链接回来源。它尤其适合产品事实页、研究洞察、FAQ、证据记录和更新日志等希望获得来源呈现的公开页面。

reference不是一个“提高引用率”的优化标签。它不能保证页面被抓取、进入索引、出现在答案来源区,也不能规定链接的展示位置或带来多少流量。若页面本身缺少明确标题、更新时间、作者、可见正文、canonical、证据链接与稳定URL,单独增加内容用途信号不会补齐这些可引用性基础。

它也不适合保护报价单、客户资料、订单、未发布产品、合同或内部知识库。Content Signals表达的是访问与使用偏好,不会替代登录、授权、网络隔离、WAF和数据最小化。任何不应公开读取的资源,都应先在源头拒绝未授权访问,而不是把robots.txt当作保密边界。

Cloudflare托管robots.txt的默认组合要逐项审阅

Cloudflare当前文档显示,已启用托管robots.txt的客户会收到search=yes, ai-train=no, use=reference这一组合。官方没有替客户自动填写ai-input,因为缺省不是“允许”或“禁止”,而是未通过该信号表达偏好。这一细节很关键:企业不能把字段缺失解释为已经退出生成式AI输入,也不能把它解释为已经授权。

品牌应由内容、法务、增长和安全负责人共同决定ai-input。如果目标是让公开知识参与查询时的RAG或grounding,可在确认授权边界后表达相应意愿;如果只希望普通搜索建立索引和返回链接,可以明确限制AI输入。多语言、多子域与经销商站还要检查每个主机实际返回的robots.txt,避免只修改根域却遗漏其他公开内容入口。

三种常见策略与验收证据

内容场景候选策略必须保留的验收证据不能据此承诺
公开产品、知识、FAQ与证据页允许搜索;按授权决定AI输入;拒绝训练;优先use=reference实际robots响应、目标页200、完整正文、canonical、Bot日志和来源展示复测一定被AI引用或产生回流
已授权完整摘要或再现的内容只在合同与内容政策允许时使用use=full,并限定路径与版本授权范围、页面清单、用途、期限、调用记录和撤回流程一份全站许可可覆盖所有语言、素材和第三方权利
客户、交易、内部或受限内容身份认证、最小权限、网络控制与WAF;不依赖Content Signals保密未授权请求被拒绝、权限日志、数据分类和访问复核robots声明能阻止恶意抓取

配置验收至少要覆盖四层:原始robots.txt是否包含预期信号;CDN、缓存和不同主机是否返回一致版本;允许公开访问的目标页是否稳定返回200和完整正文;服务器日志与公开结果是否分别出现预期的抓取、来源链接和更新。若企业自身使用Cloudflare Browser Run抓取第三方网站,还应做一组反向测试:用最小用途参数请求允许页面,用高于网站允许级别的参数确认收到400,并记录失败原因,不把策略拒绝误报为网络故障。

测量要把合规执行与GEO效果分开

本次变化直接可测的是Cloudflare /crawl是否执行用途边界,而不是品牌的AI曝光是否提升。合规层可以记录信号版本、请求参数、HTTP结果、目标URL与时间;准入层可以观察Bot访问、状态码、WAF事件和正文抽取;GEO效果层则要另行观察来源链接、引用页面、答案准确性、品牌提及和站内转化。三层指标不能互相代替。

如果设置use=reference后引用下降,不能仅凭时间相关性判断信号导致。同期的抓取阻断、内容改版、canonical变化、索引新鲜度、平台覆盖和问题集波动都可能影响结果。正确方法是保留变更前后配置快照,固定一组问题和页面,结合服务器日志、引用证据与站内分析做分层复测。

对企业的影响

第一,AI内容治理从“是否允许某个Bot”进入“访问目的加使用级别”的双轴阶段。品牌需要把搜索发现、查询时AI输入、训练与访问后的保存复用分别决策,不能再用一条通配Disallow代表全部立场。 第二,`use=reference`给“允许发现但要求引用回链”的公开内容提供了机器可读表达,而且Cloudflare `/crawl`已经给出具体执行案例。这增强了策略的可测试性,但不等于其他平台已采用,也不等于来源链接一定展示。 第三,默认参数会影响企业自建抓取流程。使用Cloudflare Browser Run的团队若不显式设置最小`crawlPurposes`和`contentUse`,可能因默认包含全部目的且默认为`full`而触发400;这类失败应进入合规诊断,不应被自动重试掩盖。 第四,多市场站点需要主机级治理。同一品牌的根域、语言子域、经销商域、帮助中心和活动站可能由不同CDN与模板提供`robots.txt`,必须逐一取证,避免政策只在一个入口生效。

智核增长的判断

Cloudflare本次更新的真正价值,是让Content Signals从“声明性规范”多了一条“执行性产品证据”。对希望参与AI搜索又重视内容授权的出海品牌,最值得建立的不是一份更长的Bot名单,而是一张URL组策略表:每组页面标明能否公开访问、允许哪些抓取目的、允许到什么使用级别、由什么技术控制执行、用什么日志和公开结果验收。 实施优先级应是:先用认证和授权保护非公开资源,再为公开内容确定目的与使用策略,随后配置robots、CDN/WAF和页面证据,最后分开测量合规执行、技术准入和GEO效果。这样可以避免把内容授权问题误写成SEO技巧,也避免为了阻止训练而误伤搜索发现与来源回链。 本文能证明的是Cloudflare Browser Run `/crawl`在2026年8月31日新增了对`use`限制的产品级执行,并可因用途冲突返回400;不能证明Content Signals已成为通用互联网标准、所有AI爬虫都会遵守、`use=reference`具有确定法律效果,或配置后一定增加引用和流量。

建议行动

  1. 按公开产品、知识、FAQ、证据、活动、交易、客户与内部页面建立URL组清单,并标注公开级别。
  2. 为每个公开URL组分别决定`search`、`ai-input`、`ai-train`,不要把缺省字段当作允许或禁止。
  3. 决定访问后的最大使用级别:需要回链与摘录边界时评估`use=reference`,仅在明确授权时采用`use=full`。
  4. 对客户资料、报价、订单、合同和内部知识使用认证、授权、网络隔离与WAF,不依赖robots.txt保密。
  5. 从公网逐个检查根域、www、语言子域、帮助中心和活动域实际返回的robots.txt,保存带时间的配置快照。
  6. 检查CDN托管robots与源站文件是否冲突,确认缓存刷新后不同地区和协议返回一致内容。
  7. 若使用Cloudflare Browser Run,显式设置最小必要的`crawlPurposes`和`contentUse`,不要无意识沿用全部目的与`full`默认值。
  8. 将HTTP 400按“内容用途或目的冲突”单独分类,记录目标URL、请求参数和响应;禁止通过改User-Agent或代理绕过。
  9. 分别监控Bot请求、WAF事件、页面200与正文完整性、AI来源链接、引用准确性和站内转化。
  10. 配置变更后用固定问题集和固定URL复测,保留前后日志与来源证据,避免把同期波动归因于单一信号。

限制条件

Cloudflare把`use`描述为正在测试的Content Signals扩展;本次明确执行它的是Cloudflare Browser Run `/crawl`端点,不应外推到Cloudflare所有产品、所有AI Search实例、所有搜索引擎或所有第三方Bot。不同爬虫可能忽略未知robots字段,Cloudflare也明确指出Content Signals是偏好表达而非防抓取技术措施。 `reference`、`full`与`immediate`的含义来自Cloudflare当前官方文档。`/crawl`调用方当前可声明的`contentUse`值只有`reference`和`full`,网站侧的`use`扩展则包含`immediate`;产品参数、默认值和执行方式未来可能继续变化。Content Signals的法律效力取决于司法辖区、合同、权利归属与具体事实,本文不构成法律意见。 允许搜索、允许AI输入或设置`use=reference`都不能保证抓取频率、索引、排名、AI摘要、来源展示、引用位置、推荐、流量或转化。任何高风险内容都应先采用真实访问控制;任何效果结论都应由服务器日志、公开答案、可访问来源链接和站内分析共同支持。

核验来源