向量检索擅长把不同表达的相关内容放在一起,但它不是产品身份验证器。本文使用开源句向量模型和合成产品数据,展示可复核的近邻列表;没有把人工打分包装成Embedding,也没有进行商业AI平台引用率测试。

编码与距离到底在比较什么

编码器把文本映射到一个向量。使用单位长度向量时,点积等于余弦相似度,反映该编码空间中的方向接近程度。它并不输出“这条参数正确的概率”,也不自动执行采购合同中的约束。

vectors = encoder.encode(texts, normalize_embeddings=True)
query_vector = encoder.encode(question, normalize_embeddings=True)
scores = vectors @ query_vector

本实验使用sentence-transformers/all-MiniLM-L6-v2,具体版本保存在模型修订号。编码方式和用途依据模型卡及Sentence Transformers文档。更换编码器后必须重建语料向量,不能混合不同模型的坐标空间。

型号、单位和否定为什么是难例

AX-220、AX-110与AX-220B具有大量相同词语。近邻排序可能捕获它们同属清洁设备,却未把220 V、110 V和电池电压视为不可互换的事实。检索到一句“不要在室外使用”,也不能仅因出现“室外”就将产品推荐给室外采购。

难例 应核对的字段 不合格处理
型号近似 原始型号、产品ID、附件归属 删除后缀后合并型号
单位相同而对象不同 电源、充电器、电机分别记录 将所有V数值放进同一列
否定条件 条件的对象与方向 只匹配“室外”“裂漆”等关键词
跨语言查询 语言能力、术语和数值保留 用一个英文模型代表全部中文检索

这些不是已证明所有向量模型都会犯的错误,而是应该纳入评测集的高风险反例。检查必须具体到模型版本和输入。

如何复现而不挑选有利问法

语料包含9条英文记录和10个固定查询。执行实验程序会保留每个问题的全部近邻与相似度,见运行结果。先冻结相关性答案键,再查看结果;不得根据模型输出临时把不相关记录标成相关。

Q9是中文压力测试,不是多语模型评测结论;Q10没有可回答的保修与价格信息。向量搜索仍然会找到最近的文档,但“最近”不等于“足够相关”,更不等于“足以回答”。本实验没有给出可用于生产的拒答阈值。阈值需要在含未知问题的独立验证集上校准。

将语义检索接到事实门槛

建议将事实约束作为单独一层处理:先识别型号及适用市场,再取回相关材料,最后核对回答所需字段是否齐全。对于型号不确定的问题,不应直接猜一个后缀;应提出澄清或列出有条件的比较。需要保留被过滤记录及理由,以免规则把正确说明书误删。

不要通过无限调高相似度阈值假装解决幻觉。型号相似记录可能得分很高,真正有用的短表格反而得分较低。检查对象、限定条件、来源版本和证据支持,比迷信一个统一分数更重要。可参考SSOT与校验规则的分层设计。

实测近邻:错误的轴承排在正确型号前

Q5询问BR-6204的内径,向量结果前3项为D8、D7、D6。D8属于BR-6205,内径25 mm;正确的D7属于BR-6204,内径20 mm。即使前3项已经包含正确证据,直接把第一条结果当作答案仍会说错5 mm。该差值只描述合成规格,不是现实轴承适配建议。

Q9用中文询问AX-220能否接110伏,向量前3项为D2、D1、D3,D9没有进入前3。这里同时存在中文语言压力、相近型号和电压条件,不能把失败归给某一个因素而不做控制实验。下一步应固定型号改写语言、固定语言改变型号难度,再分别检验;不能仅凭这一题宣称所有英文模型都无法处理中文。

这些记录给出一个实用验收要求:评审表必须同时保留原问题、前几条候选的ID与实际参数。只展示一个平均相似度会遮住产品混淆。对于第一名错误但后续有正确证据的情况,可以测试重排或事实过滤;对于整个候选集都没有正确证据的情况,应回到索引或召回。

模型版本、预处理、归一化和候选集大小任何一项改变,都应生成新实验记录。不要覆盖旧输出,让读者无法解释为什么昨天和今天的近邻不同。本轮原始输出与输入哈希一起保存,文章只解释这次运行,没有宣称长期稳定表现。

智核增长的业务落点与技术边界

部署前还应决定错误的代价。相似型号误推荐如果涉及供电、负载或配件兼容,应优先保守处理;普通介绍性问题可以容忍更多候选。不能给全部问题设置同一个相似度阈值,然后把高于阈值解释为事实已经确认。

智核增长服务中国企业出海时,英文页面既要让买家找到相关场景,也要保留中文产品资料中的型号、单位和限制。本文实验为这种资料治理提供可讨论的失败样例,不意味着公司拥有自研基础模型,或这些模型就是外部平台使用的模型。

后续扩展应纳入真实获授权语料、双人标注、多语编码器及更难的相近型号集。本轮小语料用于学习,不用于宣称跨行业普遍收益。结合词法检索、排名融合和重排评估,才能分析错误究竟来自候选获取还是证据判断。

知识中心 · GEO服务 · 研究与证据