检查清单
| 项目 | 标准 | 风险 |
|---|---|---|
| robots.txt | 明确管理Googlebot、Bingbot、OAI-SearchBot、GPTBot等访问策略。 | 误拦AI检索爬虫或混淆搜索/训练爬虫。 |
| sitemap.xml | 提交核心产品、知识、FAQ、证据和决策页。 | 新页面不可发现。 |
| canonical | 每个页面指向唯一权威URL。 | 品牌实体和页面权重分散。 |
| 状态码 | 核心页面返回200,无软404和错误重定向。 | AI抓取失败或归因到错误页面。 |
| 文本可见性 | 关键事实在HTML文本或稳定DOM中可见。 | 参数、证据、案例被困在图片/PDF里。 |
| 内链解释链 | 产品/服务页→知识页→FAQ→证据页2跳以上可达。 | AI只能看到孤立营销页面。 |
OpenAI爬虫口径
OAI-SearchBot用于ChatGPT搜索展示相关抓取,GPTBot用于可能进入模型训练的数据抓取。企业应按数据策略分别管理,而不是简单全部允许或全部禁止。
技术准入解释链
技术准入解决“AI能不能读到”的问题,Schema、llms.txt、知识中心和证据中心解决“读到后能不能理解和引用”的问题。这组链接把抓取检查延伸到内容、证据和诊断闭环。
AI Bot技术准入完整检查表
AI Bot技术准入不是只看浏览器能不能打开页面,而是要确认公开页面能被搜索与AI检索系统稳定抓取、解析、索引和复核。检查范围应覆盖 robots.txt、CDN/WAF、防火墙、服务端渲染、状态码、canonical、sitemap、内链、页面文本可见性和日志验证。
| 检查项 | 合格标准 | 常见风险 | 证据入口 |
|---|---|---|---|
| robots.txt | 允许公开页被 Googlebot、Bingbot、OAI-SearchBot 等访问 | 误把搜索展示Bot和训练Bot混为一谈 | robots.txt |
| CDN/WAF | 不把主流AI与搜索爬虫误判为攻击 | 浏览器可访问,但Bot日志为403/429 | 服务器日志 |
| 状态码 | 核心URL返回200,旧URL用301归一 | 旧知识页、FAQ页、案例页返回404 | sitemap.xml |
| canonical | 每页指向唯一权威URL | www、IP、旧路径分散实体信号 | 页面源码 |
| 文本可见性 | 关键事实出现在HTML正文或稳定DOM中 | 事实只在图片、PDF或复杂JS里 | 页面正文 |
| 解释链 | 服务页、知识页、FAQ、证据页两跳内可达 | AI只能看到孤立页面 | 知识中心 |
OAI-SearchBot、ChatGPT-User 与 GPTBot 的边界
OAI-SearchBot 更接近 ChatGPT 搜索展示和来源发现相关抓取,ChatGPT-User 通常与用户触发的页面访问相关,GPTBot 则更接近训练相关访问。企业做 GEO 时,应明确允许哪些公开内容进入搜索展示场景,同时按数据策略决定训练相关爬虫的访问边界。
本页建议:公开服务页、知识页、FAQ页、证据页应允许搜索展示类爬虫读取;涉及客户隐私、非公开复测记录、未授权案例的材料不应放在公开站点。
常见失败场景
- 浏览器能打开,但WAF拦截Bot,AI平台无法稳定读取。
- robots允许访问,但页面关键事实完全依赖客户端渲染。
- sitemap只列首页,没有列服务页、知识页、FAQ和证据页。
- 旧URL返回404,AI引用旧路径时无法建立解释链。
- canonical指向错误页面,品牌实体和页面权重被分散。