跳到主要内容
平台动态 · AI Bot治理

Cloudflare发布AI Bot报告:搜索抓取、训练与Agent访问必须分开治理

Cloudflare在7月1日披露其网络中的非人类流量、训练用途爬虫和混合用途爬虫变化。对品牌官网而言,真正的议题不是简单地“允许或封禁AI”,而是能否识别访问目的,并把可见性、训练授权、安全和成本分别管理。

直接结论

企业不应使用一条笼统的“封禁所有AI Bot”规则。用于搜索发现的爬虫、用于模型训练的爬虫、混合用途Bot与用户触发Agent可能带来完全不同的业务结果。正确做法是建立User-Agent、可验证IP、robots规则、CDN/WAF策略和服务器日志的联合准入表,再由内容、法务、安全和增长共同批准。

官方变化是什么

Cloudflare在2026年7月1日发布的报告称,其网络中超过一半的流量已经来自非人类访问;在被其按用途识别的爬虫请求中,2026年6月AI训练用途占52%,混合用途爬虫超过36%,纯搜索抓取所占比例较小但仍对网站可见性关键。这些数字来自Cloudflare自身覆盖范围,应理解为其网络观察,而不是整个互联网的无偏总体统计。

报告强调,混合用途爬虫把搜索、Agent使用和训练混在同一身份里,会让内容所有者难以作出授权决定。Cloudflare把可验证的Bot身份、访问目的声明、内容发现信号和许可机制视为下一阶段基础设施。这个方向与OpenAI分别说明OAI-SearchBot、GPTBot和ChatGPT-User的做法相呼应:访问者名称相似,并不等于用途相同。

报告日期2026-07-01
关键问题混合用途Bot无法清晰表达访问目的
治理对象robots、WAF、日志、授权与成本

对品牌出海企业的影响

品牌出海企业往往同时需要两件看似冲突的事:让搜索和AI答案发现官网,同时保护高成本研发资料、付费内容或敏感文档。若只按“AI”三个字封禁,可能把搜索展示入口一并切断;若全部开放,又可能超出公司的训练授权、许可或带宽策略。分类准入让这两个目标可以分别讨论。

第二个影响在基础设施层。robots.txt只表达自愿遵守的抓取偏好,不能代替WAF身份验证、速率限制和应用安全。相反,WAF若只匹配User-Agent字符串,也容易误拦真实爬虫或被伪造Bot绕过。技术团队需要结合平台公布的IP范围、反向DNS、请求行为和日志字段验证,并保留命中规则与响应状态。

第三个影响是GEO测量。一次来自AI相关User-Agent的请求不等于网页已经被引用,引用也不等于产生访问或商机。日志应与平台答案测试、来源URL、落地会话和业务转化分层记录。只有这样,企业才知道开放某类Bot带来的是发现、训练、用户访问还是无效负载。

智核增长的判断

智核增长建议把AI Bot准入列为GEO项目的独立技术门,而不是robots.txt中的几行附属规则。SSOT中应为每类Bot记录用途、官方来源、准入结论、执行层、负责人、最后核验日期和例外条件,并在CDN或WAF改版后重新测试。

对多数希望获得AI搜索可见性的企业,搜索发现类Bot通常应保持可访问;训练类Bot是否开放,应由内容资产价值、合同、地区法规和公司政策决定;用户触发Agent则更接近一次由用户发起的访问,需要关注登录、表单、支付和敏感操作边界。三者不能用一份默认名单永久管理。

执行清单

  1. 1. 列出Google、Bing、OpenAI及主要Agent的官方User-Agent、用途说明和验证方式。
  2. 2. 把robots规则与CDN/WAF实际规则逐项比对,检查是否出现“允许声明、边缘拦截”。
  3. 3. 从服务器日志抽样AI相关请求,记录状态码、路径、IP验证、响应体大小与频率。
  4. 4. 为搜索发现、训练授权、用户触发访问和未知混合Bot分别确定处理策略。
  5. 5. 给证据库、下载文件、登录区和公开知识页设定不同的访问与速率边界。
  6. 6. 每次平台修改爬虫名称或IP规则后重新执行准入测试并更新责任人。

限制条件

Cloudflare数字反映其客户网络与识别方法,不能直接替代单个官网的日志分析,也不能证明某个平台一定训练、引用或推荐了某个页面。

robots偏好、合同许可、版权和数据保护属于不同层面。本文提供技术治理框架,不构成法律意见;涉及高价值资料或地区合规时,应由企业法务和安全负责人共同确认。

官方来源