“查找适合室内、220 V的AX-220资料”和“推荐类似清洁设备”不是同一道题。后者可能更容易得到丰富答案,却放宽了型号与供电条件。若把两者当作同一问题统计改善,会同时损害采购准确性和GEO测试可比较性。
把原问题拆成受保护字段
检查失败后不能悄悄用扩大条件后的查询继续给最终推荐。比如原题限定欧盟市场、220V且排除室外,变体即使召回更多文档,只要删除任一限制,就可能把不可用产品排到前面。正确处理是保留原查询、标出变更字段,再让审核者判断是否属于允许的同义转换。若需要放宽条件,应明确向用户说明放宽了什么,并将候选结果与满足原条件的结果分开。模型名称相似、检索分值更高或页面更多都不是绕过限制的依据。
保留原始问题全文和不可变ID,再提取实体、地区、数值单位、必须条件、排除条件和输出要求。字段抽取也可能出错,因此它是待核对的结构,不是比原文更高的真相。未明确的地区不能从提问语言推断。
| 字段 | 原值示例 | 可接受变化 | 需要阻断的变化 |
|---|---|---|---|
| model | AX-220 | 保留标准型号及已审核别名 | 改成AX-110 |
| region | EU | EU与明确等价的语言表达 | 泛化为全球 |
| voltage | 220 V | 标准空格调整 | 换成110 V或省略 |
| excluded | outdoor | 保留不可户外使用 | 改成适合户外 |
| task | 核验供电条件 | 同义表述 | 改成推荐品牌 |
三种变体的实际检查
controls.py提供constraint_diff,对受保护字段逐项比较。附件中的一个变体保持字段不变,一个把型号改为AX-110,一个删除排除条件。实际输出在results.json的query_constraints:后两者分别返回model和excluded差异。
{
"model": "AX-220",
"region": "EU",
"voltage": "220 V",
"excluded": ["outdoor"]
}
这个检查不从自由文本自动理解语义,也没有运行改写模型。它展示的是在模型或编辑产生候选后,怎样用已审核字段做确定性拦截。若字段抽取本身把“不可户外”读反,结构比对仍可能通过,所以必须保留原问题回查。
同义扩展不等于兼容性扩展
可以把采购问题中的常见别名加入检索,但结果必须映射回原始实体。例如中文名称、英文简称和标准型号可作为查询变体;相邻系列和“类似型号”不能自动成为可替代产品。型号连字符、单位前缀和否定词尤其需要保护。
信息检索教材提供查询与检索的基础方法,但没有为每个B2B业务建立适配规则。企业应维护自己的术语表、别名证据和禁用替换列表。把“电源输入”简化成“电机电压”就不是语言润色,而是属性变化。
失败时如何回退
| 检查结果 | 后续动作 | 日志需保留 |
|---|---|---|
| 受保护字段一致 | 与原查询并列检索 | 变体文本、生成版本 |
| 新增无来源限制 | 拒绝变体,回到原问题 | 新增字段与拒绝原因 |
| 丢失排除条件 | 阻断自动回答 | 原否定句与字段差异 |
| 原问题含歧义 | 请求澄清或列出分支 | 未确定字段 |
| 查询更宽但用户明确同意 | 建立新问题ID | 授权及与旧题关系 |
不能因为某次改写召回更多结果,就把原查询记录删除。数量增加可能来自更多不相关候选。对安全、兼容与认证问题,应优先验证关键条件,而不是最大化候选数。
如何比较收益并保持测试有效
先固定语料版本和相关性答案键,再比较原查询与合格变体的Recall、排序和约束保留率。保留所有失败变体,按问题ID配对汇总。若改变了核心需求,必须重新定义相关性标签,不能继续拿原答案键作比较。
正式AI平台复测应固定原问题文本、会话条件及模式。实验性的改写测试可以单列,但不能只挑能出现品牌的问法并混入原引用率。查询优化是否改善自建检索,与官网是否进入公开AI答案是两项不同结论。
智核增长的应用与验收
智核增长为出海企业组织中英文问题集时,应让型号、工况和采购约束能够逐字段核对。客户验收可以要求展示原题、候选变体、拒绝原因以及最终采用版本,尤其抽查数字和否定条件。
继续阅读采购意图词典、中英术语控制与跨语言检索。技术短FAQ给出直接结论,进阶实验包提供可执行检查和人工复核模板;两者都不构成未经测试的引用增长保证。