这个工具是什么
CSV Deduplicator 先解析真实 CSV,再比较字段数组。您可以使用整行内容作为键,也可以按一个或多个列索引组合去重。默认保留第一条记录,表头不会参与数据去重。
如何使用
- 粘贴 CSV 或选择 UTF-8 文件,确认分隔符及表头设置。
- 解析后选择整行去重,或按带列序号的名称选择一个或多个字段。
- 点击“删除重复记录”,查看原始、唯一和删除记录数。
- 检查有限表格预览,复制或下载正确转义的 CSV。
使用示例
- a,b / 1,2 / 1,2 / 2,3 按整行去重后保留两条记录。
- id,name / 1,Tom / 1,Jack / 2,Amy 按 id 去重后保留 1,Tom 和 2,Amy。
- 重复表头 name (第1列) 与 name (第2列) 可以独立选择,不混淆数据。
处理规则与限制
默认首行为表头,去重保留首次记录及原始顺序。比较键基于字段数组的无歧义序列化,不把字段用可能冲突的普通分隔符简单拼接。字段按原文精确比较,不隐式修剪或改写数值。输出由同一 Papa Parse 核心生成,正确引用含分隔符、双引号或换行的字段。输入最多 2 MiB、100,000 条记录、500 列及 500,000 个单元格;预览最多 500 行、100 列及 10,000 个单元格。
常见用途
- 删除重复导出的数据记录。
- 按 ID、邮箱或组合字段保留第一条记录。
- 在不覆盖重复表头的前提下整理 CSV。
隐私说明
文本、文件读取、转换和预览均在当前浏览器本地完成,不上传输入,不使用后台、数据库、在线 API 或第三方 CDN,也不会自动保存您的内容。复制和下载由浏览器本地完成。
FAQ
按整行去重是什么意思?
只有全部字段内容和位置均一致时才视为重复。选定列模式则只比较您选择的字段。
重复记录保留哪条?
保留首次出现的完整记录,其他字段也取自该条记录,输出顺序保持稳定。
重复表头会丢失数据吗?
不会。内部使用列索引,界面给出列序号,不依赖名称作为唯一键。
输出如何处理引号?
含分隔符、引号或换行的字段按 CSV 规则引用;字段内部的双引号转义为两个双引号。
会自动修改公式或字段空格吗?
默认按原文字段处理,不自动修剪或改写字段。将结果导入电子表格时,应按实际数据用途选择文本或其他列类型。