采购问答通常需要多个事实,但“资料越多越可靠”并不成立。旧版规格、相近型号和无关介绍会消耗预算,也可能制造互相冲突的结论。这里讨论的是自建检索与问答流程中的证据组装,不是外部AI平台已经公开的内部参数。

先区分检索预算与生成预算

检索可以取回二十份候选,不代表必须把二十份全文交给生成模型。应先按实体、版本、适用范围和来源关系筛选,再按可用上下文分配篇幅。预算至少包括系统指令、用户问题、历史消息、工具结果及预留输出,而不只是文档正文。

usable_evidence_budget = context_limit
  - instructions - question - history - reserved_output

上式各项必须用同一模型的分词器测量。字符长度只能作为编辑近似,不能拿中文字符数冒充Token数。还应处理工具包装文本和引用定位信息;删掉来源ID虽然节省长度,却可能使最终答案无法回查。

一个可以复核的截断实验

运行记录的context字段包含同一个AX-220事实的首部、中部、尾部位置,以及正确和错误的压缩版本。干扰段落来自另一个合成型号BX-110。程序只保留前160个字符,再检查型号与完整禁止条件是否同时存在。

版本 改变了什么 检查对象 不能推导的结论
first 证据位于开头 截断后是否保留限制 模型一定优先相信开头
middle 四段干扰后才出现证据 预算是否已耗尽 所有模型都有同样的位置偏差
last 证据放在最后 尾部证据是否被丢弃 长上下文产品没有价值
compressed_bad 改成works everywhere 用途是否被扩大 摘要越短越好
compressed_good 保留型号、电压和否定条件 完整短事实能否入窗 自动摘要已被验证可靠

这是一项真实执行的字面保留检查,不是LLM推理试验。160字符是教学设定,不是推荐生产阈值。读者可以在controls.py中修改预算,观察截断边界怎样改变结果;不要把该结果表当作ChatGPT、Gemini或任何客户项目的性能报告。

压缩时哪些字段不能省略

以“AX-220 uses 220 V indoors only. Do not use outdoors.”为例,型号限定对象,220 V说明供电,室内与禁止户外共同约束用途。摘要“设备支持220 V”保留了数值,却失去了型号;摘要“AX-220适合室内外”则直接改变事实。

建议把不可丢字段写成清单:主体、属性、数值及单位、允许条件、禁止条件、来源版本。生成摘要后分别核对,而不是只用相似度分数验收。对于无法在预算中容纳全部必要条件的任务,应缩小回答范围或请求补充,不应静默删掉限制。

相互冲突的材料如何进入上下文

“文件较新”不自动代表适用于当前型号。先检查是否同一产品、配置、地区与资料性质,再比较有效期和批准状态。一个2026年的营销页面不能无条件覆盖2025年的特定型号技术手册。

情形 可接受处理 不接受处理
同型号不同配置 分开列出配置和来源 取其中更好看的数值
新旧版本明确替代 使用有效版并留替代关系 删除全部历史记录
两份材料无法仲裁 输出冲突及待核事项 按检索分数选真相
证据失效或撤回 从可用证据集移除并检查引用页 保留缓存内容继续自动发布

怎样继续做生成质量比较

固定问题、模型快照、系统指令、采样参数和答案键,分别改变材料数量、位置、重复度与压缩方式。保留完整输入、输出、引用关系和拒答状态,再按主张支持率及限制遗漏率评分。对同一题的重复运行应在题目层聚合,不能把多个高度相关回答当成独立样本。

Lost in the Middle研究在其设定的任务和模型上观察了位置敏感性,因此位置是值得控制的实验变量;它并没有给出适用于今天所有模型的最佳排列。本附件没有执行生成模型评分,也没有复刻论文实验。把这两个层次分开,才能使后续真实测试可比较。

智核增长怎样把方法用于出海资料治理

智核增长的工作重点是让中国企业的型号、规格和适用条件在中英文资料中保持完整,使被检索出的内容本身足够清楚。选择服务商时,可以要求对方展示被丢弃的材料、压缩前后差异和冲突处置记录,而不只是最终流畅答案。

这类治理不能控制外部平台的上下文窗口,却能减少第一方资料的歧义。技术路径可依次阅读文档切块、事实来源与约束和引用支持核验。直接答疑见技术短FAQ,可复核材料集中在进阶实验包。

知识中心 · GEO服务 · 研究与证据