信息整理

识别并处理 Excel 重复记录

定义重复身份、检测精确与近似匹配,并保留冲突供检查

7 分钟准备已测试:ChatGPT复核日期: 2026-08-28
1

补充你的背景

你填写的内容只保留在当前浏览器中,AILesson 提示语不会将其发送给模型或服务器。

2

生成的提示语

未填写的字段会保留为占位符,你仍然可以复制后自行编辑

请设计一套在 Excel 中识别并处理重复记录的流程。

重复定义:
[identity]

列与代表性重复情况:
[layout]

处理策略:
[policy]

区分完全重复行、重复业务键和可能的近似匹配。在身份规则和冲突策略明确前,不要建议直接使用“删除重复项”。请返回辅助公式或条件格式规则、重复组编号、冲突检查,并分别处理可安全删除的完全重复、字段冲突的重复和不确定的近似匹配。保留来源行,并说明处理前后如何对账。
默认保护隐私提示语在浏览器本地组装。除非所在组织明确允许,否则不要把机密信息提交给任何 AI 服务。

从输入到成果

实际案例

看看具体背景如何通过这条配方转化为可使用的成果

实际输入

重复定义
对于联系人导出,规范化邮箱是业务键。即使姓名大小写不同,相同邮箱的两行也是可能重复。邮箱为空的行不能仅凭姓名自动匹配。
列与重复样本
A RowID;B FullName;C Email;D UpdatedAt;E Source;F Phone。示例:R10/Ana/ANA@example.com/6 月 1 日/Web/123;R14/Ana Pérez/ana@example.com/6 月 4 日/CRM/空白;R20/Ana Perez/空白/6 月 5 日/Event/123。
处理策略
完全相同行可以标记为冗余。相同规范邮箱的记录应先显示冲突,再考虑保留最新的非空值。邮箱为空的近似匹配必须人工检查。绝不删除原始表。

示例输出

建立 G 列 NormalizedEmail:=IF(C2="","",LOWER(TRIM(C2)));H 列 EmailCount:=IF(G2="","",COUNTIF($G:$G,G2));I 列 DuplicateGroup:=IF(H2>1,"EMAIL-"&G2,"")。邮箱为空时不分组。再增加冲突标记,例如对非空电话检查可使用 =IF(I2="","",COUNTA(UNIQUE(FILTER($F:$F,$I:$I=I2)))>1),必要时调整以排除空白。

R10 和 R14 会进入同一邮箱组,但不能安全删除,因为姓名、更新时间、来源和电话完整性不同。R20 仍是不确定的近似匹配,应标记 ManualReview,而不是加入邮箱组。建立操作列:ExactRedundant、MergeReview、NearMatchReview 或 Unique。保留 Raw_ReadOnly,另建处理结果表,并在 ResolutionLog 中记录被移除 RowID、保留 RowID、规则、审核人和日期。对账关系为:原始行数 = 结果行数 + 完全冗余行 + 日志记录的合并行;同时比较处理前后的唯一规范邮箱数量。

为什么有效

  1. 1

    删除前定义身份可以防止合法的重复事件被误删。

  2. 2

    把冲突归组可以为人工合并决定保留证据。

检查结果

  • 重复键是否反映业务身份,而不只是外观相似?

  • 冲突值是否被保留并进入人工检查?

  • 被移除的行是否可以追溯到保留记录?

更多探索方式

这条配方出现在哪里

继续完成任务