混合检索是一种候选组合方法,不是“关键词加向量必然更好”的承诺。词法结果可能保留准确型号,语义结果可能找出不使用同一词语的说明;它们也可能同时遗漏关键限制。本文用同一答案键比较各路径,保留失败问题。

为什么原始分数不能直接相加

本实验的SQLite BM25越小越好,归一化向量点积则越大越接近。即使统一方向,两个分数的尺度和分布仍不同。直接计算bm25 + cosine会让数值范围较大的一方主导排序。分数归一化可以设计,但需要验证集与分布监控,不能凭一条成功查询定权重。

RRF只利用名次。对于出现在多个结果列表中的文档,把各列表贡献相加;未出现的文档不获得那一路贡献。Azure混合检索说明提供了RRF的工程说明,不能据此断言其他商业AI系统使用相同配置。

用三个文档手算一次

lexical: A, B, C
dense:   B, D, A
RRF(d) = sum(1 / (c + rank_i(d)))
c = 60; ranks start at 1

A的得分为1/61 + 1/63,B为1/62 + 1/61,D只有1/62。B得到两个列表较靠前的共同支持,可能排到A前面。但这不证明B满足电压或认证限制,只表明两种排序都倾向于它。常量60是本例的公开配置,不是跨任务最佳值。

同一文档在同一路检索中重复出现时,不能获得重复投票。示例只取首次出现的原始名次计算贡献,跳过重复项,不压缩后续名次;相同分数按文档ID稳定排序,便于复现。

本实验究竟融合了哪些候选

完整程序分别取BM25前5项和向量前5项,融合后交给重排的也是前5项。语料只有9条记录,这个窗口只用于教学。向量路径有完整9项,词法路径可能不足5项;不能擅自补零分虚构词法命中。

记录字段 用途 常见误读
bm25 词法排名 误当作事实准确率
dense_scores 每条语料的相似度 误当作回答可信概率
rrf 两路前5项融合结果 误以为包含整个语料库
reranked 对融合前5项再排序 误以为能找回窗口外证据

输入和答案键在数据文件,逐题结果在运行记录。Q10没有可回答的资料,仍会有融合候选,这正是“有排名不等于有答案”的反例。

怎样判断融合是否值得

应比较相同问题上的Recall@3、MRR@3与nDCG@3,再检查型号、条件、语义和未知问题等分组。平均值改善而电气条件组下降,不能直接判定可用于采购辅助。小样本不适合据此给出“提高多少引用率”的营销结论。

生产评测中的延迟应分项记录语料编码、索引构建、单次检索、融合和重排。当前附件的词法耗时包含索引构建,不能与预计算向量后的查询耗时直接比较;这些单次CPU耗时只证明程序运行,不是稳定性能测试。若用于系统选型,应拆开计时、预热后重复运行、报告分位数、控制线程与缓存。

逐题观察:融合有改善,也有退步

本次Q2的词法前3项为D1、D2、D8,只覆盖一份相关证据;融合结果为D1、D9、D2,找回另一份限定电压的材料,Recall@3从0.5变为1。这个变化只属于该合成问题、该窗口和该标签集,不能翻译成官网引用提升50个百分点。

Q1则相反:向量前3项D9、D2、D1已经覆盖两份证据,融合后变为D9、D2、D3,D1被挤出前3项。两路共同偏好的干扰文档可能占据位置;融合并不是对每一道题自动选择表现最好的那一路。

Q9的中文压力查询也没有被融合直接解决,前3项仍是D2、D1、D3。只展示Q2会形成选择性宣传,因此本包保留10题全部输出,包含无答案的Q10。读者应先看哪些类型收益、哪些类型退步,再判断是否值得扩大候选窗口或添加明确约束。

若调整融合常量或候选数量,应在独立验证集上选择,再到留出的测试集评估。否则反复用这10题调参,得到的最佳配置只是对这组教学材料的拟合。对生产场景,还需测量更大目录中的更新延迟、重复版本和权限过滤,而不是直接复制本例常量。

候选去重和缺失排名怎样复核

去重应使用稳定文档ID,而不是截断后的标题。同一手册在两路都命中时累加贡献;同一路重复出现时只采用第一次排名。另一条路线没有返回该文档,就贡献零,不能凭空补一个第六名。对不同版本的手册也不能仅因标题相同合并,需要先明确版本是否已经被批准替换。

一个实用排查顺序是先打印两路原始列表,再打印每个文档的贡献与总和,最后检查排序和截断。若分数完全相同,要固定并公布打破平局的规则,否则文件读取顺序可能制造排名变化。本包采用稳定文档ID打破平局。生产系统还应记录过滤动作发生在融合之前还是之后,因为先过滤会改变候选数量,后过滤则可能使最终不足k条。

降低常数c并不意味着一定更准确,它只是改变前列名次差异对融合的影响。选参数时应把调参问题与最终评估问题分开,并保留未参与调参的型号歧义题。本轮固定c=60,没有对十道题反复调参后挑最好结果,因此这里给出的是单一配置的可复核行为,不是最佳配置证明。

智核增长将精确型号事实与买家场景表达一起治理:前者帮助身份核验,后者帮助不同问法找到相关材料。官网不需要暴露内部权重,更不应把RRF得分写成客户收益。面向中国出海企业,优先补足型号与说明书关联、事实范围和可验证证据,再讨论检索方案。

继续阅读重排的候选边界、RAG链路和检索指标。本实验没有证明任何外部平台会因采用某种页面结构而优先引用智核增长。

知识中心 · GEO服务 · 研究与证据