跳到主要内容
行业洞察 · 智核增长研究中心

Cloudflare 9月15日调整AI Bot默认策略:品牌官网怎样避免误拦AI搜索?

Cloudflare将于2026年9月15日为新接入域名调整AI Bot默认策略:Search保持允许,Agent与Training在含广告页面默认阻断。本文拆解适用范围、混合用途爬虫、robots.txt与WAF边界及上线验收方法。

直接结论

Cloudflare将在2026年9月15日为新接入Cloudflare的域名启用新的AI Bot默认策略:Search类爬虫保持允许,Agent与Training类Bot在被Cloudflare识别为展示广告的页面上默认阻断;同时,兼具Search与Training用途的混合用途爬虫会受到训练阻断配置影响。品牌官网不应把这理解为“所有AI爬虫一律封禁”,而应在上线或迁移前逐项核对Search、Agent、Training三类策略、广告页面识别结果和既有WAF规则,并用真实状态码、抓取路径与引荐数据验收。

事实与背景

截至2026年9月13日,Google Search Central、Bing Webmaster、OpenAI与Cloudflare在过去72小时内没有出现比既有站内主题更重要、且能由细粒度官方记录确认的新变化。本次选择的是一个即将到达执行节点、但站内尚未覆盖的常青运营问题:Cloudflare在7月1日已经公告,9月15日起,新接入Cloudflare的域名将收到更新后的AI Bot默认策略。它不是9月13日刚发布的功能,也不能被写成所有既有域名会在同一时刻自动改成完全相同的策略。

新默认策略按行为而不是笼统的“AI爬虫”标签拆分。Cloudflare把可直接管理的AI相关行为分为Search、Agent和Training:Search用于收集或索引内容,以便之后回答搜索问题;Agent代表用户实时访问网页并执行任务,例如聊天抓取或浏览器代理;Training用于训练或微调模型。一个Bot可以同时拥有多个行为,因此同一个请求是否被允许,不能只看运营商名称或User-Agent字符串。

9月15日到底改变什么

对象官方默认或规则变化品牌需要确认不能据此推断
新接入Cloudflare的域名Search保持允许;Agent和Training在展示广告的页面上默认阻断域名接入日期、三类策略当前值、哪些页面被识别为含广告整个站点的所有AI访问都被阻断
混合用途爬虫同时具有Search与Training行为的爬虫会受训练阻断配置影响,包括旧版“Block AI bots”设置Bot在Cloudflare当前分类中的全部行为,以及命中的最终策略只要具有Search用途就一定放行
旧版Block AI bots设置Cloudflare标记为在9月15日弃用;旧说明此前排除混合用途爬虫是否已迁移到按Search、Agent、Training拆分的策略旧开关与新策略长期等价
既有域名官方公告重点指向新接入域名,并允许客户在生效日前选择退出新默认值控制台中的实际配置、历史自定义规则与变更记录仅凭域名创建时间就能证明线上行为

“Block on pages with ads”不是一个由站长手工列出的固定URL清单。Cloudflare说明该选项使用其自动检测来识别展示广告的页面,并只在这些页面执行阻断。因此,内容团队需要把广告模板、地区差异、A/B测试和动态广告加载纳入验收;同一站点的无广告产品页、含广告行业文章与结账页面可能出现不同结果,不能只测试首页一次就宣布策略正常。

混合用途爬虫是本次最容易被忽略的边界。Cloudflare明确说明,一个Bot可同时具有多种行为;9月15日后,兼具Search和Training用途的爬虫会受到训练阻断配置影响。企业如果只核对“Search=Allow”,却没有检查同一Bot是否也被标记为Training,就可能在含广告页面看到意外的403或其他阻断响应。反过来,放行一个运营商的全部流量也可能超出企业原本只允许搜索发现、不允许训练的政策。

robots.txt、AI Bot策略与WAF不是同一个控制层

控制层主要作用是否技术强制验收重点
robots.txt与Content Signals表达抓取与内容用途偏好,例如search、ai-input、ai-train或userobots.txt遵守具有自愿性;Content Signals也不应被当作安全边界公开文件内容、规则对象、爬虫是否读取与遵守
AI Bot行为策略按Search、Agent、Training选择Allow、全站Block或仅广告页BlockCloudflare通过其边缘控制执行实际命中类别、页面、状态码和规则动作
单个爬虫控制对具体Crawler设置Allow或Block由AI Crawl Control执行运营商、爬虫身份、分类与例外是否一致
WAF自定义规则按路径、主机名、检测字段或其他条件执行更细规则技术强制,且会在AI Crawl Control付费抓取等后续步骤之前处理优先级、跳过规则、误拦与规则重叠

Cloudflare官方说明,robots.txt用于表达偏好,但并不能在技术层面阻止不遵守规则的爬虫;若要强制执行,应使用AI Crawl Control等安全控制。对于已经同时配置托管robots.txt、旧版Block AI bots、AI Crawl Control和WAF自定义规则的企业,发布前必须画出一条真实请求的判定链,确认最终动作来自哪一层。只修改robots.txt后看到403,或只把策略设为Allow后仍看到阻断,都不足以证明平台异常。

Cloudflare还说明,AI Crawl Control的爬虫阻断通过WAF自定义规则实现,并发生在Cloudflare Bot Solutions及Pay Per Crawl之后续处理之前。由此带来的直接操作要求是:先审计现有WAF,再调整AI Bot策略;否则一个更早命中的通用Bot规则、地区规则或路径规则,仍可能让Search类爬虫在策略界面显示Allow时收到阻断。

不要只靠User-Agent完成验收

Cloudflare的检测能力随套餐不同。官方入门文档说明,免费套餐主要通过User-Agent识别知名、主动自报身份的AI爬虫;启用Bot Management的企业套餐可使用检测ID获得更完整的识别。User-Agent可以被伪造,所以测试请求只能证明某个字符串在当前规则下得到什么响应,不能独立证明请求来自真实运营商。

更可靠的验收应同时保存四类证据:Cloudflare控制台或配置导出的策略快照;BotBase或当前爬虫清单中的行为分类;边缘请求日志中的检测字段、命中规则和状态码;AI平台产生的真实引荐或抓取记录。对Search、Agent和Training至少各选一个有代表性的真实爬虫,分别测试无广告核心页、含广告文章页、商品详情页、robots.txt、sitemap与一个受限路径。

测试结果判定下一步
Search在核心公开页为2xx,Agent/Training只在预期广告页被阻断,WAF与robots偏好一致通过记录配置版本,持续监控新分类与页面模板变化
策略符合预期,但部分页面广告识别或地区模板结果不一致条件通过缩小上线范围,补测模板、地区和动态广告加载
Search被旧WAF、训练策略或混合用途分类意外阻断不通过暂停迁移或发布,定位实际命中规则并重新测试
只有模拟User-Agent结果,没有检测ID、日志或真实平台记录不可归因不宣称已保障AI搜索抓取,补齐来源身份与线上证据

把策略结果与业务结果分层测量

Cloudflare AI Crawl Control可按日期、Crawler、运营商、主机名和路径查看请求,并区分允许请求、失败响应、状态码、数据传输与热门路径;部分套餐还提供AI平台引荐来源和目标路径。品牌应先回答“谁访问了什么、是否被允许、命中哪条规则”,再回答“是否出现引荐、收录、来源引用或转化”。抓取返回2xx只是技术准入证据,不是被索引、被引用或带来销售的证明。

对于多域名、多语言和多市场站点,应以zone与hostname为最小治理单元。新接入的活动域名、区域子域名、CDN迁移域名或广告落地页,可能与主站拥有不同默认值和WAF历史。每次接入都应从配置基线复制、差异审查和真实路径抽样开始,而不是依赖账号级印象。

对企业的影响

这次切换把AI访问治理从“允许或阻断所有AI Bot”的单一开关,进一步推向按行为、页面商业模式和检测身份拆分。对依靠内容与商品页获得AI搜索发现的出海品牌,Search保持允许提供了一个较清晰的默认方向;但混合用途分类、广告页自动识别和既有WAF规则仍可能让实际响应偏离控制台表面设置。 风险最高的不是选择Allow或Block本身,而是团队不知道哪一层在执行。市场团队可能希望保留AI搜索引荐,法务希望限制训练,产品团队又需要用户驱动Agent读取公开商品信息。若三种诉求被压缩成一个“封禁AI爬虫”开关,企业可能同时失去搜索发现、代理访问和可审计的政策边界。

智核增长的判断

Cloudflare 9月15日默认值调整应被当作一次“访问政策迁移”,而不是SEO插件更新。正确顺序是先确定企业允许的内容用途,再把Search、Agent、Training映射到不同页面与业务场景,最后检查robots.txt、托管策略、WAF和单爬虫例外是否表达同一决策。对于含广告内容页,必须把Cloudflare的自动页面识别结果纳入验收,避免只在控制台读配置。 我们建议保留Search准入与训练授权之间的明确分界,但不把任何平台默认值直接当作公司的最终政策。需要用户实时代理访问的报价、库存、门店或支持页面,还应单独评估Agent访问;涉及账户、支付、未公开价格或客户数据的路径,则必须依靠认证与应用安全控制,而不是AI Bot分类。 本文能证明的是Cloudflare截至2026年9月13日公开的产品默认值、行为分类、检测与控制边界;不能证明Cloudflare对某个具体页面的广告识别一定正确,也不能证明放行Search会带来抓取、收录、AI引用、引荐或转化。

建议行动

  1. 清点9月15日前后新接入Cloudflare的全部zone、子域名和活动域名,记录接入时间、负责人和当前AI Bot策略。
  2. 分别导出或截图Search、Agent、Training的当前动作,不用旧版“Block AI bots”开关代替新策略对账。
  3. 在BotBase或当前爬虫清单中核对重点Crawler的全部行为,特别标记同时具有Search与Training用途的混合爬虫。
  4. 建立无广告核心页、含广告文章页、商品页、robots.txt、sitemap和受限路径的测试矩阵,并覆盖主要地区与页面模板。
  5. 审计WAF自定义规则、Bot Fight Mode、AI Crawl Control和单爬虫例外,确认规则顺序与最终动作没有冲突。
  6. 将robots.txt和Content Signals视为公开偏好层,将AI Bot策略与WAF视为强制层,分别保存配置和响应证据。
  7. 免费套餐不要仅凭模拟User-Agent认定真实爬虫身份;企业Bot Management环境优先使用检测ID和安全日志完成归因。
  8. 发布或迁移后按Crawler、运营商、hostname、路径与状态码检查2xx、3xx、4xx和5xx分布,定位意外阻断。
  9. 将技术准入、抓取、索引、AI引用、引荐和转化分层报告,不把允许请求数量写成AI搜索效果。
  10. 为策略、Bot分类和广告页识别结果设置变更复核,页面模板、广告系统、域名接入或Cloudflare分类变化后重新抽样。

限制条件

本文基于Cloudflare截至2026年9月13日可访问的官方文档。9月15日是官方已公告的默认策略生效日,原始公告日期为7月1日;因此本文不把它描述为过去72小时刚发布的新功能。官方明确指向“新接入Cloudflare的域名”,既有域名的最终行为应以控制台配置、WAF规则和线上请求证据为准,不能仅凭公告推断。 Cloudflare的Search、Agent与Training是其当前行为分类,不等于各AI平台自己的爬虫命名、robots政策或数据使用承诺。一个Bot可能拥有多个行为,分类也可能随公开说明和观察到的行为调整。免费套餐主要依赖User-Agent识别,存在伪造与归因限制;企业检测ID也不能代替对具体规则和响应的验证。 “含广告页面”由Cloudflare自动检测,本文没有访问客户控制台,也不对任何具体页面的分类作保证。robots.txt与Content Signals不是认证、授权、隐私或数据防泄漏机制;账户、支付、客户数据和非公开内容仍应通过身份认证、访问控制与应用安全措施保护。允许Search只代表边缘访问策略的一部分,不保证搜索引擎或AI系统抓取、索引、展示、引用或产生业务结果。

核验来源