两个型号可以共用外壳,也可以只有铭牌不同。图片检索把它们放在一起并不奇怪;危险的是把相似结果直接当成可以互换的产品。本篇用有意简化的合成图片解释如何评测这一问题,不使用客户图片制造不存在的案例。
实验材料与固定环境
附件包含四张384×384自制图片:两个红色圆形分别标AX-220和AX-110,一个蓝色方形BX-220,一个绿色三角形CX-110。这些是教学图形,不是产品照片。我们实际在CPU上运行openai/clip-vit-base-patch32,固定仓库修订版,保留模型ID、版本和所有查询排名。

model-results.json提供原始logit,benchmark.json提供图片身份。模型权重不打包进公开下载包,读者重跑时从官方模型仓库获取同一修订版。
五个实际查询看到了什么
| 查询 | 第一候选 | 应怎样解读 |
|---|---|---|
| a red circle | red-circle-110 | 两张红圆都满足外观条件,问题未限定型号 |
| a blue square | blue-square-220 | 本小样例外观候选匹配 |
| a green triangle | green-triangle-110 | 本小样例外观候选匹配 |
| AX-220 red circle | red-circle-220 | 带型号查询在该样例排对第一 |
| AX-110 red circle | red-circle-110 | 带型号查询在该样例排对第一 |
结果没有展示本组具名查询的首位失败,不应为了论点编造失败记录。但“a red circle”同时对应两张图,已说明只凭外观无法唯一确定产品。当前测试也未测小字模糊、裁图、真实机械外观或跨语言图像查询,不可外推为商业目录准确率。
相似度分数不是概率
CLIP的logit用于同一任务内比较,不是“这张图有多少概率为正确产品”。输入预处理、模型版本和候选集都会影响结果。不要把31.99写成31.99%的识别置信度,也不要跨不同模型直接相加分数。
Sentence Transformers图像搜索说明介绍图文共享表示的应用。本文实际使用Transformers加载固定CLIP组件;模型卡说明模型来源。智核增长没有把这一开源模型宣传为自研基础模型。
如何设计更接近B2B的答案键
把相关性拆成外观相关、身份匹配、属性支持三个标签。外观相关的候选可以展示给人复核;只有身份与属性证据同时满足时,才可以支持具体采购结论。每个图片必须关联型号、配置、拍摄或绘制来源及许可。
| 评测层 | 正例要求 | 负例示例 |
|---|---|---|
| 外观召回 | 颜色、形状或场景符合查询 | 查询蓝方却返回绿三角 |
| 型号识别 | 明确对应指定型号 | 相同外壳不同供电 |
| 参数核验 | 源资料支持目标字段 | 从外观猜水箱容量 |
| 使用建议 | 工况与限制也成立 | 只凭照片推荐湿区使用 |
测试集应加入近似型号、缺铭牌、模糊图和无答案题,并按独立实体划分开发与验证集。简单改色的四张图片不能提供真实目录的泛化结论。
联合候选与拒答怎么做
可以分别用文字型号检索和图片相似召回候选,再按明确身份字段过滤,最后关联原始证据。两个分数不可不经校准直接相加;也可以采用排名融合并保留各路来源。若图片命中但文字型号冲突,应返回冲突供人工确认,不应以图像更相似为理由覆盖型号。
这里运行的是图文编码与排序,没有实现完整商品识别服务。附件media_labs.py可重现输入与输出;所示候选融合属于实施方法,不冒充本次已经部署到客户后台的功能。
智核增长如何运用多模态证据
智核增长可帮助出海企业给产品图片补上明确的实体关联、版本与可公开说明,使图文内容更容易被人核对。客户评审时,应要求区分“找到相似图”和“确认该型号适用”,并检查误配能否被拦截。
继续阅读证据定位、单位条件核验及混合检索。技术FAQ处理直接疑问,进阶实验包保留全部图形、程序和排名。本实验不代表商业AI图片搜索,也不计入客户引用率。