实体归并流程
01

标准化:名称、地址、单位与编码

02

候选:确定键与相似规则

03

决议:匹配、非匹配、待确认

04

黄金记录:字段来源与优先级

05

治理:版本、拆分与下游通知

结论:误合并通常比漏合并更危险

把两个不同客户合成一个会混合交易、权限和隐私;漏合并主要造成重复统计。不同场景应设置不同阈值和人工复核。

先定义“同一实体”的业务标准,再选择证据。姓名相同、地址相似或商品标题接近都不足以单独决定。

标准化但保留原值

统一大小写、空格、行政区、单位、公司后缀和电话格式,并保留来源原值以便审计。条码、证件或系统主键等确定性标识也要验证质量。

标准化规则版本化,避免规则更新后历史匹配无法解释。

候选生成与决议分开

先用阻塞键、编码或相似度找小范围候选,再用多字段证据判断。输出匹配分、证据和冲突,不直接覆盖源记录。

高风险客户、供应商和高价值商品保留人工确认;无法判断的记录进入待处理队列。

黄金记录要记录字段来源

名称可能以 CRM 为准,地址以最近验证为准,商品规格以主档为准。每个字段记录来源、时间和优先级,不是简单选择最长值。

合并决议必须可拆分和回滚,并通知依赖的指标、模型、权限和报告重新计算。

选型用真实脏数据验收

测试同名不同人、改名、旧地址、共享电话、组合商品、多条码和错误编码。分别评估误合并、漏合并、人工量和回滚。

BuildTable 可作为整理 AI 友好主数据模型的候选;匹配算法、人工工作流、黄金记录和跨系统回写需逐项确认。

公开参考资料

开始构建 AI 友好的数据基础

下载 BuildTable,或联系我们讨论企业数据建模场景。

下载 BuildTable