先把跨语言问题拆成四个方向

中文问题检索中文资料、中文检索英文、英文检索中文和英文检索英文是四种配置。只测试一种方向,无法知道性能变化来自查询语言还是资料语言。每道问题应有对应的语义等价译文,型号与约束保持一致。

本实验使用12条合成产品事实和12道双语问题。10题有作者定义的正确文档,2题在语料中没有答案。事实包括电压、容量、连接器、适用材质、采购量与重量,数据不是客户真实产品。四种配置共48条查询排名,不能把它称作48个独立产品或48次外部平台测试。

模型与复现条件是什么

实际运行模型为sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2,固定修订版本记录在model-revisions.json。程序对中英文事实和问题生成归一化向量,以余弦相似度排序,保留前三项及分值。

这里没有调用ChatGPT、Google AI或Perplexity,没有生成最终回答,也没有使用重排器。模型是公开组件,不是智核增长自研基础模型。复现时应保持模型版本、文本、查询顺序与相似度实现一致;模型下载耗时不能当作纯推理延迟比较。

实际排名结果与分母

查询语言 语料语言 有答案题Top1命中 有答案题Recall@3
中文 中文 8/10 10/10
中文 英文 7/10 10/10
英文 中文 8/10 10/10
英文 英文 8/10 10/10

2道无答案题未进入这两个指标的分母,但仍保留排名。搜索器总能给相近文档,不意味着相近文档能回答“保修多久”或“是否有CE认证”。本实验没有训练拒答阈值,不能用高相似度擅自补出不存在的事实。

错误样例具体说明什么

Q4询问J连接器,部分配置把相似型号的其他连接器记录排在前面;Q6询问仅干用条件,也发生错误排序。Q5涉及不适用于未处理木材,在中文查英文和英文查英文配置中未达到Top1。错误集中在哪里应查原始分值和文本,不能据此断言模型对所有否定句都失败。

四组Recall@3都达到10/10,并不意味着最终回答必然正确。若生成阶段优先使用第一名、混合两个型号,或忽略否定限制,仍会答错。要验证最终效果,需要另设答案生成与事实支持实验,本轮未执行该步骤。

怎样改进而不污染测试

先检查型号与约束是否完整,再考虑精确标识符匹配、双语别名、关键词与向量混合、重排和条件过滤。不能看完这12题后不断修改测试问题,再报告“模型进步”。应将调整用样本与最终保留集区分,并记录每次变化。

译文也要复核:容量、包装重量和净重是不同字段,connector J不能被宽泛译成compatible connector。若英语问题丢失关键条件,检索变化不能全部归因于模型。建议同时报告语言方向、问题意图与无答案处理,避免一个平均数掩盖某市场的风险。

智核增长如何使用这些结果

智核增长可用这类实验诊断英文资料是否能被正确关联到中文采购问题,或中文事实是否适合生成等价英文资产。实际交付应替换为获授权的产品字段、真实问题分层和独立复核标签,并保留访问权限;公开教学语料不能代表客户行业覆盖。

本站的品牌出海定位需要可核验英文内容与事实治理,而非只翻译标题。与术语控制、混合检索及单位校验结合,才能定位错误在哪一层。改善本地排名也不保证外部AI引用。

重跑实验时的核对清单

检查项 正确操作 常见失真
语料数量 保持12个事实标识 把译文算成新产品
查询分母 10题有答案,2题单列 删除无答案题的原始排名
方向组合 四种组合分别汇总 只报最好的语言方向
相关性标签 固定作者定义与版本 看排名后改正确答案
截断长度 使用同一模型设置 不记录不同文本截断
输出保存 前三名及分值一起保留 只保存Top1是否命中

手工复查失败题时,先阅读问题和正确文档,再比较被排在前面的邻近文档。若两者仅差型号、电压或否定词,下一步可以设计精确约束检查,而不是直接断言需要更大模型。改进实验应保存原基线并新增结果文件;即使新配置变好,也要保留退步题,核对是否只是从一种歧义转移到另一种。

原始结果与参考

比较两次运行前,应先核对数据文件校验值和模型修订号;任一变化都应建立新的实验版本,不能覆盖旧结果后继续沿用原报告的结论。

下载完整运行材料,model-results.json保存48条排名,benchmark.json保存数据与作者标签。参考Sentence Transformers预训练模型文档。所有数字仅描述这一固定小样本,不是市场级性能估计。

知识中心 · GEO服务 · 研究与证据