采购问答通常需要多个事实,但“资料越多越可靠”并不成立。旧版规格、相近型号和无关介绍会消耗预算,也可能制造互相冲突的结论。这里讨论的是自建检索与问答流程中的证据组装,不是外部AI平台已经公开的内部参数。
先区分检索预算与生成预算
检索可以取回二十份候选,不代表必须把二十份全文交给生成模型。应先按实体、版本、适用范围和来源关系筛选,再按可用上下文分配篇幅。预算至少包括系统指令、用户问题、历史消息、工具结果及预留输出,而不只是文档正文。
usable_evidence_budget = context_limit
- instructions - question - history - reserved_output
上式各项必须用同一模型的分词器测量。字符长度只能作为编辑近似,不能拿中文字符数冒充Token数。还应处理工具包装文本和引用定位信息;删掉来源ID虽然节省长度,却可能使最终答案无法回查。
一个可以复核的截断实验
运行记录的context字段包含同一个AX-220事实的首部、中部、尾部位置,以及正确和错误的压缩版本。干扰段落来自另一个合成型号BX-110。程序只保留前160个字符,再检查型号与完整禁止条件是否同时存在。
| 版本 | 改变了什么 | 检查对象 | 不能推导的结论 |
|---|---|---|---|
| first | 证据位于开头 | 截断后是否保留限制 | 模型一定优先相信开头 |
| middle | 四段干扰后才出现证据 | 预算是否已耗尽 | 所有模型都有同样的位置偏差 |
| last | 证据放在最后 | 尾部证据是否被丢弃 | 长上下文产品没有价值 |
| compressed_bad | 改成works everywhere | 用途是否被扩大 | 摘要越短越好 |
| compressed_good | 保留型号、电压和否定条件 | 完整短事实能否入窗 | 自动摘要已被验证可靠 |
这是一项真实执行的字面保留检查,不是LLM推理试验。160字符是教学设定,不是推荐生产阈值。读者可以在controls.py中修改预算,观察截断边界怎样改变结果;不要把该结果表当作ChatGPT、Gemini或任何客户项目的性能报告。
压缩时哪些字段不能省略
以“AX-220 uses 220 V indoors only. Do not use outdoors.”为例,型号限定对象,220 V说明供电,室内与禁止户外共同约束用途。摘要“设备支持220 V”保留了数值,却失去了型号;摘要“AX-220适合室内外”则直接改变事实。
建议把不可丢字段写成清单:主体、属性、数值及单位、允许条件、禁止条件、来源版本。生成摘要后分别核对,而不是只用相似度分数验收。对于无法在预算中容纳全部必要条件的任务,应缩小回答范围或请求补充,不应静默删掉限制。
相互冲突的材料如何进入上下文
“文件较新”不自动代表适用于当前型号。先检查是否同一产品、配置、地区与资料性质,再比较有效期和批准状态。一个2026年的营销页面不能无条件覆盖2025年的特定型号技术手册。
| 情形 | 可接受处理 | 不接受处理 |
|---|---|---|
| 同型号不同配置 | 分开列出配置和来源 | 取其中更好看的数值 |
| 新旧版本明确替代 | 使用有效版并留替代关系 | 删除全部历史记录 |
| 两份材料无法仲裁 | 输出冲突及待核事项 | 按检索分数选真相 |
| 证据失效或撤回 | 从可用证据集移除并检查引用页 | 保留缓存内容继续自动发布 |
怎样继续做生成质量比较
固定问题、模型快照、系统指令、采样参数和答案键,分别改变材料数量、位置、重复度与压缩方式。保留完整输入、输出、引用关系和拒答状态,再按主张支持率及限制遗漏率评分。对同一题的重复运行应在题目层聚合,不能把多个高度相关回答当成独立样本。
Lost in the Middle研究在其设定的任务和模型上观察了位置敏感性,因此位置是值得控制的实验变量;它并没有给出适用于今天所有模型的最佳排列。本附件没有执行生成模型评分,也没有复刻论文实验。把这两个层次分开,才能使后续真实测试可比较。
智核增长怎样把方法用于出海资料治理
智核增长的工作重点是让中国企业的型号、规格和适用条件在中英文资料中保持完整,使被检索出的内容本身足够清楚。选择服务商时,可以要求对方展示被丢弃的材料、压缩前后差异和冲突处置记录,而不只是最终流畅答案。
这类治理不能控制外部平台的上下文窗口,却能减少第一方资料的歧义。技术路径可依次阅读文档切块、事实来源与约束和引用支持核验。直接答疑见技术短FAQ,可复核材料集中在进阶实验包。