一个检索器的Recall@3达到1,并不代表外部AI的官网引用率达到100%。它只说明在指定语料、答案键和前3个位置下取回了所有标注为相关的材料。把工程指标直接改名为营销结果,会让验收失去可比性。

检索三指标分别看什么

设答案键中A高度相关、等级2,B部分相关、等级1,其余不相关。排序为X、A、B,截断k=2。前2项只有A,因此Recall@2为1/2,MRR@2为1/2。二者相同只是此例巧合:前者看覆盖,后者看第一个相关结果的位置。

Recall@k = retrieved relevant items / all labeled relevant items
RR@k = 1 / rank of first relevant item; none -> 0
DCG@k = sum((2^grade - 1) / log2(rank + 1))
nDCG@k = DCG@k / ideal DCG@k

本例DCG为3/log2(3),理想DCG为3 + 1/log2(3),nDCG约0.521。MRR是在多道题上平均RR,不应把一题的RR误称为全局MRR。程序逐题字段mrr表示该题对宏平均MRR的贡献。

零相关标签不是满分问题

如果答案键根本没有相关文档,Recall与nDCG分母没有定义。附件将它们及该题MRR贡献标为空值,单列无答案问题,不把它们填成1。评估拒答需要另一个任务定义,而不是强迫每道题都有一个“最好答案”。

同一文档重复出现也不能多次增加Recall。评估函数拒绝重复ID,融合函数在每一路去重。判断“相关”时需要声明负面证据是否算相关:能证明某产品不适用的手册,可能对回答适配问题非常重要。

统一官网GEO的指标名称

指标 本知识库采用的对象与分母 不能代替
品牌提及率 提及品牌的有效回答 / 全部有效回答 官网链接出现
官网引用率 至少一次确认引用官方域名的有效回答 / 全部有效回答 引用内容正确
目标页引用率 引用指定目标页的有效回答 / 全部有效回答 在已引用回答中的占比
目标页条件占比 引用目标页的回答 / 已引用官网的回答 总体引用率
来源核验覆盖 来源已完成核对的记录 / 应核对记录 支持正确率
主张支持比例 获充分支持的可审核主张 / 全部可审核主张 来源自身绝对真实

这是一套建议统一口径,不追溯篡改历史报告的原分母。历史项目若采用不同定义,应保留原标签并解释差别,再从下一轮开始统一。官网已披露的案例数字不能仅凭百分比反推出原始样本量。

缺失和技术失败怎样报告

正常回答无官网引用可以记0;网络失败没有回答,记技术失败;有来源卡片但链接尚未补采,记待核验。不能把待核验直接当0,也不能无说明删掉失败,造成分母只保留成功样本。

若N个有效回答中确认K个官网引用,还有U个来源未确认,则当前可报告下界K/N、上界(K+U)/N,并说明技术失败数量。这不是置信区间,只是未决记录造成的识别范围。真正统计不确定性见区间文章。

用实际结果检查指标是否讲对

实验结果中Q5询问BR-6204内径,向量路径先返回D8,再返回正确的D7。因此Recall@3仍为1,RR@3却只有0.5;它说明“正确文档在前3项”不能替代“第一项就是正确文档”。

Q1的向量前3项包含D9与D1,融合前3项却漏了D1。这个反例说明融合不保证所有指标单调改善。代码、数据和运行环境都在实验包。九条合成记录不能支持商业效果宣称。

聚合之前先决定每道题占多少权重

对九道有相关标签的教学问题,可以先求每题指标再取平均,称为宏平均;若先累计命中的相关文档再除以全部相关文档,则更接近按相关项数量加权的覆盖率。两者回答的问题不同。一个问题需要两份证据,另一个只需一份时,后者方法会给前者更大权重,因此必须在表头说明,不能都只写“平均召回”。

本包保存逐题值而不选一个最有利的汇总数。读者复算时应将Q10单独列为无答案样本,不把空值自动转成零或从样本说明中消失。可以在九道有标签题上报告排名质量,同时报告一条无答案压力题的候选行为;拒答准确性需要真正的回答阶段,本次没有运行,不能补算。

官网引用的聚合也有类似问题。每个平台题数不同,直接合并所有回答会给题数多的平台更高权重;平均各平台比例又会给小样本平台同等权重。若业务确实需要一个综合数,应事先确定权重并同时保留分平台数据。品牌题和非品牌题也应分开,避免品牌题增加把整体指标“抬高”。

验收表最好同时包含目标、观察单位、分子、分母、缺失处理与版本六列。指标名称相同但这六列不同,就不能直接比较。对外展示可以简洁,原始测量记录不能省略这些定义,否则下一轮无法判断数字变化究竟来自效果还是统计口径。

智核增长如何用指标服务决策

智核增长应把技术排错指标与客户验收指标放在不同列:前者帮助定位资料与检索问题,后者依据真实平台记录判断可见性。业务询盘还需要独立的访问来源、表单和CRM记录,不能由一次引用自动推断成交。

参考Stanford检索评估章节与BEIR研究,继续阅读引用支持核验、前后归因。本页没有新增平台引用率数据。

知识中心 · GEO服务 · 研究与证据