如何用 AI 构建并压力测试产品分类体系:概念边界与歧义样本裁决

如何用 AI 构建并压力测试产品分类体系:概念边界与歧义样本裁决

Olivia Park
2026年9月6日· 9 分钟阅读

要用 AI 构建产品分类体系,先定义稳定的商品概念和业务规则,再让模型建议标签或归类。随后用普通、边界、多归属、信息不足、新商品和本地化样本压力测试。商品运营与数据治理负责人必须裁决歧义并批准生产变更。

负责任使用 AI 的流程可帮助你把候选结构与获批真源分开。本文针对面向消费者或内部运营的商品目录,不处理文档分类、采购支出、数据库字段或组织部门,也不授权 AI 直接改写线上目录。

关键要点

  • 定义概念,而不只设计好看的标签。
  • 每个节点都有稳定 ID、范围、包含和排除规则。
  • 分开商品类型、属性、变体、用途、人群和受监管状态。
  • 单一标签会误导时,保留 multi_fit 和 unknown。
  • 通过已标注样本和独立人工裁决测试边界。
  • 分类体系、映射、测试和迁移必须共同版本化。

步骤 1:定义 AI 产品分类体系

产品分类体系是一组受治理的商品概念与关系。可见导航标签只是表现形式,真正稳定的单位是带身份、定义、范围、关系和决定规则的概念。

W3C SKOS 把概念和标签分开,并支持首选标签、替代标签、定义、注释和上下级关系。[1]GS1 GPC 同样以层级和属性按共同特征组织商品。[2]这些是设计原则,不代表每个目录都必须照搬外部标准。

字段用途
分类体系版本标识获批结构
Concept ID不随文字变化的稳定键
首选标签与 locale面向用户或操作员的名称
同义词和废弃词支持搜索与迁移
定义明确概念含义
包含规则描述哪些商品符合该概念
排除规则区分相近的邻接概念
父子 ID以身份维护层级
必需属性归类所需证据
变体规则分开尺寸、颜色、套装和型号
正反例让边界可复核
负责人和修订控制变更

明确目录任务和决定人

说明分类体系要支持浏览、搜索筛选、报表、外部平台、履约规则还是其他目标。一棵面向购物者的树,与会计或仓储分类不同,并不意味着其中一方错误。

指定分类体系、类目、商品数据、本地化、受监管商品和生产部署负责人。冻结输入库存和当前版本。AI 可以提出候选结构,但不能决定商业战略、法律分类、安全义务或用户语言。

步骤 2:把商品类型与其他维度分开

许多薄弱的分类体系把不同的问题混在一棵树里。“跑鞋”“红色”“女款”“促销”“防水”和“品牌 X”可能都成了同级节点,尽管它们分别代表商品类型、颜色、受众、促销、功能和品牌。

设计节点之前,先画一张维度图:

  • 商品类型:这件商品是什么;
  • 功能或用途:它支持什么任务;
  • 属性:材料、容量、功率、兼容性或特性;
  • 变体:尺码、颜色、包装数量或型号选项;
  • 受众或适配:仅在有依据且合适时使用;
  • 商业状态:价格、促销、库存或渠道;
  • 治理状态:受监管、受限制、危险品或有年龄限制。

当用户需要跨多个商品类型筛选时,就把该特性保留为属性。只有当它代表一个边界稳定、内涵一致的商品概念时,才建立类别。这样能减少重复的分支,也让含糊的归类更容易解释。

步骤 3:草拟概念和关系

从目录和用户任务中提炼出一小组高价值的概念开始。为每个概念写出通俗的定义、纳入和排除规则、正例、反例、所需证据,以及与上位或下位概念的关系。

GS1 说明,GPC 通过 segment、family、class 和 brick 等层级对商品分类,并在适当的层级附加属性。[2]其入门材料也提供了结构定义和标准维护资源。[3]把这当作“层级和属性都需要治理”的证据,而不是要求把 GS1 的标签照搬到每一个目录中。

不要让标签承担全部规则。没有明确的上级和排除规则时,“配件”通常过于含糊。“其他”应当是一个受监控的临时结果,而不是一个永久的箱子,把概念缺口藏起来。

步骤 4:约束 AI 提议

提供概念记录、获批的维度、最小化的商品样本、允许的关系和明确的输出结构。请它提出候选概念、映射、冲突和问题,而不是一棵完成的生产用分类树。

只使用提供的商品事实和分类字段。
保留商品 ID、概念 ID、locale、单位和缺失值。
提出映射时引用所依据的输入属性,并说明置信理由。
AI 不得推断成分、兼容性、受众、监管状态或预期用途。
明确返回 MULTI_FIT、INSUFFICIENT_INFO、NOVEL_CONCEPT 和 RULE_CONFLICT。
不要编辑获批的分类体系或生产目录。

NIST 的生成式 AI 配置文件强调了虚构内容、信息完整性、隐私和人机配置方面的风险。[5]严格的结构和人工审核可以降低这些风险,但并不会让模型的置信度成为商品的事实属性。

步骤 5:建立经裁决的分类体系测试集

由商品数据和类目专家按书面规则标注合成或获批准的商品记录。审核人意见冲突时,应先保留分歧并修正规则,再把该样本作为 gold set。

测试集包括正常商品、接近边界的商品、合理多归属、信息不足、新概念、同义词与本地化、变体和类型混淆,以及涉及兼容性、人群、安全和监管的禁止推断。文档分类边界测试使用类似思路,但商品分类必须保护商品概念和变体语义。

步骤 6:压力测试歧义商品类别

每次测试固定分类体系版本、提示或映射逻辑和模型配置,保存候选概念、使用的证据字段、替代概念、不确定状态与审核决定。

测试混合用途充电器、缺少设备型号的替换带、没有年龄字段的儿童风格商品、混合套装、新材料和不同语言下的同一概念。分别计算覆盖率、单分类一致率、多归属召回、unknown 识别、规则冲突率和各概念错误;单一平均准确率可能隐藏一整个失败类别。

商品案例预期结果需要防范的错误
兼顾桌面和旅行的混合型充电器采用获批的多归属或主类型规则强制分配单一标签
未提供设备型号的替换表带信息不足虚构兼容性
没有年龄字段的儿童风格设计目标人群未知推断年龄组
包含无关商品类型的套装采用套装规则按第一个名词选择类别
不在允许值中的新材料新属性静默替换为同义词
同一概念使用两个本地化标签一个概念配多个本地化标签创建重复概念

步骤 7:改变层级前先诊断错误

把每个错误归入以下类别:商品数据缺失、定义不清、概念重叠、维度错误、缺少概念、同义词或 locale 问题、模型转换错误,或审核人之间的分歧。补救方法取决于原因。

用数据字典定义来源字段和允许值,用数据验证清单发现不完整的单位、标识和枚举值。不要为了弥补一个有缺陷的商品数据源而重组分类体系。

如果两个概念重叠,就澄清纳入、排除、优先和多重归属规则。如果需要新概念,就估算受影响的商品数量和对导航的影响。如果审核人意见不一,就更新决策指引并重新裁决受影响的样本,而不是让多数票悄悄重新定义概念。

步骤 8:批准并安全迁移变更

准备一份带版本号的变更集,包括新增、修改、合并、拆分、移动和弃用的概念;新旧映射;受影响的商品数量;各 locale 标签的变化;重定向或导航方面的影响;回滚限制;以及批准记录。

绝不要让 AI 直接写入生产目录。先在冻结的副本上运行新的分类体系,复核发生变化的映射,测试下游数据源和筛选项,并由目录平台团队负责分阶段部署。如果只是标签变化,就保持概念 ID 稳定。

Google Merchant Center 说明了其商品类别属性,以及商家提供的值与 Google 可能自动分配的类别之间的区别。[4]外部渠道可能有各自的结构和决定。把获批的分类体系分别明确映射到每个渠道,而不是把某个外部类别当作内部的权威。

上线后如何维护?

监控“未知”数量、多重归属情况、人工推翻率、搜索退出、零结果查询、客服反馈、类别失衡和外部结构的变化。复查错误队列中的样本,而不只是高流量的成功归类。

使用提示基准测试流程维护一套可重复的评估集。当分类体系、提示、模型、字段映射、locale 规则或商品数据源发生变化时,重新运行同一个留出集,并按类别比较结果。

治理规则变化时,不要覆盖历史测试标签。为预期结果建立版本并说明原因。这样团队才能区分“模型变好了”与“业务规则变了”。

常见失败方式

  • 只从标签开始: 先定义稳定的概念和规则。
  • 混淆类别与属性: 把商品类型、功能、变体和商业状态分开。
  • 强行只归一类: 在政策允许时,保留多重归属和“未知”结果。
  • 推断缺失的商品事实: 把不完整的记录退回数据负责人。
  • 把模型置信度当作证据: 引用实际的属性和书面规则。
  • 只优化平均准确率: 检查各类别和边界样本的错误。
  • 直接修改生产环境: 使用带版本的审核、迁移和回滚控制。
  • 盲目照搬外部层级: 按目录获批的用途映射标准和渠道。

总结

  • 明确目录任务、维度、负责人和输入库存。
  • 为概念设置稳定身份、定义、边界、关系和样本。
  • AI 只提出候选映射和明确异常状态。
  • 测试正常、边界、多归属、未知、新概念和 locale 场景。
  • 区分数据、规则、概念、模型和裁决错误。
  • 生产迁移前完成版本化批准。

常见问题

产品分类体系就是导航菜单吗?

不是。菜单只是部分概念的展示;分类体系还承载稳定身份、定义、关系、本地化标签、映射和治理。

AI 能只根据商品标题创建类别吗?

它可以建议候选,但标题常常不完整或带营销措辞。材质、功能、兼容性和套装内容必须由数据支持。

每件商品必须只有一个类别吗?

取决于获批规则。系统可以要求一个主要类型,同时允许多条发现路径或筛选属性。

什么是歧义类别样本?

商品事实支持多个概念、与规则冲突、缺少必要证据或暴露定义重叠时,就是歧义样本;歧义是审核状态,不是猜测许可。

测试集应有多大?

它应覆盖重要概念、常见商品、低频高影响错误和全部设计边界。大量来自单一简单类别的样本并不能提供强证据。

能否按模型置信度决定审核范围?

不能单独依赖它。还要结合校准结果、类别风险、新颖性、缺失字段、规则和变更影响。

什么时候应新增概念?

当稳定商品类型或用户任务确实缺失,并且治理负责人批准边界时。短期潮流、缺少属性或一条糟糕标题不足以建新概念。

多语言分类体系如何处理?

把概念身份与本地化标签分开,由 locale 专家审核首选和替代词,并测试翻译是否意外创造重复概念。

免责声明: 本文只提供一般目录治理和 AI 风险信息,不决定商品法律分类、安全义务、受监管状态、平台合规或商业战略。

来源

  1. W3C, SKOS Simple Knowledge Organization System Primer — https://www.w3.org/TR/skos-primer/
  2. GS1, How Global Product Classification Works — https://www.gs1.org/standards/gpc/how-gpc-works
  3. GS1, Get Started with Global Product Classification — https://www.gs1.org/standards/gpc/get-started
  4. Google Merchant Center, Product category attribute — https://support.google.com/merchants/answer/6324436?hl=en
  5. NIST, Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile — https://www.nist.gov/publications/artificial-intelligence-risk-management-framework-generative-artificial-intelligence

Sources checked 2026 年 9 月 6 日。

延伸阅读

开启 3 天免费试用

注册即可免费体验全部高级功能。

*仅限新用户;每位用户只能获得一次试用。

如何用 AI 构建并压力测试产品分类体系:概念边界与歧义样本裁决 | AethoVPN