“这台设备适合我们吗”可能是选型,也可能是预算审核。标签应描述问题中可观察的需求,不推断用户所属公司、购买能力或个人特征。对未明确的信息,保留unknown比自信补全更有用。

建立可操作的标签词典

一条问题可以同时包含“适不适合”和“怎么采购”,例如“这款设备能清洁油污地面吗,最少买几台”。应保留完整原文,再拆成适用性验证与采购条件两个子任务;不能因为句末出现数量就忽略前面的安全和使用边界。标注者不知道用户职位时,角色留未知,不从措辞猜成采购经理。发生分歧时,裁决记录写明哪一段文字支持标签,是否需要多标签以及是否拆题。最终统计的单位仍是原问题还是子任务,必须预先确定,否则拆题本身就会改变类别比例。

先定义主意图,再记录可并存的风险和约束。主意图用于分层统计,附加标签用于定位缺证。标签定义应包含准入条件、排除条件和最容易混淆的邻近类别。

标签 包含 不包含 首选证据
discover 概念、类别、适用任务 已明确型号的规格确认 定义与适用范围
validate 型号、兼容、工况、参数确认 只问谁更便宜 手册、测试条件、版本
compare 替代方案与供应商取舍 单个型号事实查询 同口径矩阵与差异
procure MOQ、交期、报价和合同边界 无采购行动的原理学习 配置化报价及责任条款
support 故障、维护、耗材和服务 首次了解产品类别 维护文档与服务范围

品牌题和非品牌题是另一维,不应替代主意图。“AX-220支持什么电压”是品牌或型号限定的技术验证;“室内硬地面用什么设备”是未指定品牌的任务探索。两者的命中概率和评测目的不同。

多标签怎样不失控

每题必须有一个主意图,可以有多个受控风险标签,例如electrical、surface、delivery;不得随意新建近义标签。若问题同时要求“适用性和报价”,主意图按阻断决策的前置条件确定,另保留第二意图。无法裁定时进入复核,不应由最新标注者覆盖原记录。

角色只在明确出现时填写。题目说“作为经销商”可以记录distributor;题目只问“最小起订量”不能自动断定提问者是经销商。地区、语言、型号与预算也应按显式信息记录。

用正反例约束解释空间

问题示例 主意图 附加记录 易错判断
AX-220能在潮湿区域用吗 validate 安全、环境 当成产品介绍
哪个方案三年总成本更低 compare 成本、周期 只比较单价
DW-1四箱可以下单吗 procure MOQ、包装 只查每箱件数
设备不吸水怎么排查 support 故障、停机 直接推荐买新机

这些问题是合成教学例子,不对应客户的真实询盘。标签并不决定答案正确性;正确归类的题目仍可能没有足够证据回答。

标注流程与一致性检查

先共同学习词典,再各自独立标一组相同问题;锁定两份原始标签后才讨论分歧。记录两人标签、引用的规则、仲裁结果和词典版本。修改词典后,应重标受影响的历史样本,而不是只改最终结果。

材料包提供review-templates.json,独立复核字段保持空值。运行记录中的annotation_demo是作者构造的两列分歧,用于验证计算,不是两位真人完成的评审。该例六题五题一致,原始一致率为5/6;Cohen's kappa另扣除由边际分布估计的偶然一致。两种指标都不能证明词典本身正确。

哪些情况下统计会误导

类别高度不平衡时,把多数题都标为同一类也可能得到很高一致率。应同时查看混淆表和每类分歧,不只看总分。多标签集合还需要明确完全一致还是按标签计算,不能把两种口径混写。

scikit-learn的kappa文档说明了该统计量的定义;本文附件用小规模同口径演算实现,不把它当行业验收阈值。若两列标签完全相同且只含一个类别,偶然一致项为1,kappa分母为0,本程序返回空值而不是漂亮的满分。

智核增长怎样使用这套词典

智核增长可据此把出海采购问题映射到知识页、产品事实、短FAQ与证据页,分别发现“不会解释”和“没有证据”的缺口。客户评审时应抽查高风险问题,而不是只接受自动聚类截图。

继续阅读问题聚类、查询改写约束和问题分解。技术短FAQ负责快速答疑,长文与实际演算负责说明方法。标签服务于证据选择,不代表外部AI平台采用相同分类。

知识中心 · GEO服务 · 研究与证据