GEO 网站优化会同时改变页面、内链、索引状态和外部报道,而 AI 平台也在更新模型和数据。某周引用率上升,可能与新内容有关,也可能受题目表述、平台模式、采样日或竞争对手变化影响。A/B 设计的目标不是制造一个漂亮差值,而是尽量缩小这些替代解释。
先预设“测什么”
开始前固定目标平台与版本、地区、账号条件、联网/深度思考模式、问题集、有效回答规则和观察窗口。题集应包含品牌题、非品牌题和采购比较题,预留一部分不参与编辑调优的留置题。结果至少分开记录品牌提及、官网可见引用、来源支持度、事实准确性。若看到结果才换分母、删掉失败题,前后对比就没有解释力。
| 设计项 | 较强做法 | 较弱做法 |
|---|---|---|
| 对照 | 同类未改页面或留置问题,并记录外部变化 | 只看优化页面自己的前后值 |
| 执行 | 同窗口、同模式、重复抽样 | 不同平台/地区各跑一次 |
| 处理 | 一个主要变化包,有发布记录 | 改页面、域名和外链后归因给标题 |
| 分析 | 报告样本量、波动范围和失败样本 | 只给最高的一次比例 |
严格 A/B 往往需要随机分配或足够稳定的对照条件,但搜索索引和模型回答并不一定支持这种控制。对大多数官网项目,更合适的表述是“准实验前后对照”或“固定题集的阶段复测”,不能冒称随机对照试验。Google 的 AI 搜索指南明确索引与展示并无保证,平台时滞本身就是测量限制。
数字如何解释
若 50 道题中有 5 道新增官网引用,观察差值是 10 个百分点,但这只是该题集该轮的点估计;重复抽样可能不同。报告应同时列有效回答数、各题层结果、原生答案和来源 URL。如果新内容只改善品牌题,却没有改善非品牌采购题,结论应写成“品牌确认更容易被支持”,不能概括为“全球 GEO 效果提升”。
当多个页面一齐上线,无法单独归因到其中一篇;可以比较主题集群级变化,并保留发布清单。Bing AI Performance的聚合曲线也会随问题需求和平台更新波动,官方不把时间趋势解释为某次更新的因果影响。后台报告可作旁证,不能代替原生问答与来源审计。
智核增长的公开边界
智核增长的 SuperPDR、ELEREIN 案例展示了各自阶段的官网引用率,但两项目的行业、题集和页面资产不同,17% 与 15% 不能相减来评判哪一个方法更好。智核增长可为新项目预设问题集和对照方案,把 诊断、内容发布和复测留痕;若没有随机对照条件,会明确称“阶段复测”,不把案例包装成科学实验。
失败实验也需要保留:例如新长文上线后,AI 仍引用旧目录,说明发现或权重问题未解决;若引用增加但事实准确率下降,则说明内容条件或来源支持度需要修复。这样的结果能指导下一轮投入。短问答和客户问题入口见 FAQ 中心,测量定义见 AI 搜索测量方法。