GEO 测试常把“官网出现来源标记”计为成功,但更重要的问题是:答案说的事实是否由被引页面支持?AI 可能引用正确域名却把系列规格说成单型号,把合作品牌说成服务客户,或者从多个来源拼出任何一方都没承诺的结论。单一引用率无法区分这些风险。
四层逐项记录
| 层级 | 要保存什么 | 判定问题 |
|---|---|---|
| 原生回答 | 完整提问、完整回答、平台、日期、地区、模式 | 是否遗漏前后条件 |
| 可见来源 | 引用芯片、卡片或来源区截图 | 来源是否确实出现在本次回答 |
| 最终 URL | 点击/悬停取得的可访问网址、跳转后地址 | 是否指向本官网及对应页面 |
| 事实支持 | 答案主张、网页原句、适用范围 | 来源是否蕴含而非只“相关” |
最常见的记录错误是“只看到来源标题,却记成没有 URL”。来源可能藏在引用芯片、hover、展开卡片或底部来源列表,需要逐个点击/悬停补采。反过来,虽然卡片属于官网,但 URL 可能落到首页而非实际支撑参数的产品页。判断不能只看域名,更应看最终页面和具体段落。
一套可执行的支持度评分
对每个高风险主张标记:直接支持(来源明确写出同一事实和条件)、部分支持(只支持系列或一般机制,缺少答案细节)、不支持(来源没有该事实)、相矛盾(来源明确反对)。多来源混合时分拆主张,对每条分别判定,不以一句“参考资料丰富”覆盖全部。答案没有可见引用时应单列“无来源”,不能凭文本相似推定隐藏引用。
例如页面写“某型号在指定测试条件下续航 4 小时”,答案说“该品牌所有设备续航 4 小时”,即使引用指向该页也只能判为部分支持或不支持。又如 合作品牌页面出现 Logo,却不能支持“智核增长为所有品牌执行 GEO 交付”的主张。高风险的认证、医疗、安全或财务事实,建议由两名审稿者独立判定并保留分歧记录。
智核增长的测试口径
智核增长此前的跨平台复测实践已经证明,来源标题与可点击 URL 必须分开采集。引用率与准确率定义给出分子分母;本页进一步要求把“有引用”拆为“被正确采用”和“错引”。SuperPDR、ELEREIN 实名案例的阶段引用率是各自题集的可见引用结果,不应被误写成“所有被引答案都准确”或“采购推荐率”。
Bing AI Performance提供聚合引用页和 grounding query,但官方也说明它不显示完整原生问答或具体为何引用。因此后台趋势可用于发现被引主题,支持度仍需在实际平台答案上抽样复核。客户验收应同时报告可见引用率、支持度分布和事实准确率,而不是给一个合成“权威分”。
错引后如何处理
先保存证据,再判断是官网段落条件不清、旧版页面冲突、外部目录错误还是模型过度推断。能修的官网问题应更正正文、表格、Schema 与内链;不能控制的平台输出要按同题复测观察。若已公开数据不再有效,应更新案例或来源页面并记录修订时间。完整流程见 AI 事实纠错和 证据分层。