Outils de texte et de données

Dédoublonnage CSV

Repérez les doublons par ligne entière ou par champs, conservez la première occurrence et exportez le CSV.

Contenu CSV

CSV sans doublons

Aperçu du tableau

Supprimez les doublons par ligne ou par colonnes, en conservant la première occurrence et un CSV correctement échappé.

Les fichiers CSV sont traités uniquement dans votre navigateur et ne sont pas envoyés à un serveur.

Présentation de l’outil

Cet outil analyse le CSV avant de comparer les tableaux de champs. La clé de comparaison peut être la ligne entière ou une combinaison de colonnes repérées par leur position. La première occurrence est conservée ; la ligne d’en-tête est exclue du dédoublonnage.

Mode d’emploi

  1. Collez du CSV ou choisissez un fichier UTF-8, puis vérifiez le séparateur et l’option d’en-tête.
  2. Après l’analyse, choisissez la ligne entière ou un ou plusieurs champs identifiés par leur nom et leur numéro de colonne.
  3. Cliquez sur « Supprimer les doublons » pour consulter les nombres de lignes initiales, uniques et supprimées.
  4. Vérifiez l’aperçu limité du tableau, puis copiez ou téléchargez le CSV correctement échappé.

Exemples

  • a,b / 1,2 / 1,2 / 2,3 donne deux lignes de données après dédoublonnage par ligne entière.
  • id,name / 1,Tom / 1,Jack / 2,Amy conserve 1,Tom et 2,Amy avec la colonne id comme clé.
  • Les en-têtes identiques name (colonne 1) et name (colonne 2) restent sélectionnables séparément.

Règles et limites

La première ligne est un en-tête par défaut. Le dédoublonnage conserve la première occurrence et l’ordre initial. Les clés utilisent une sérialisation non ambiguë des tableaux de champs, et non une simple concaténation avec un séparateur susceptible d’apparaître dans les données. Les champs sont comparés exactement, sans suppression implicite d’espaces ni modification des nombres. Papa Parse produit la sortie et entoure correctement de guillemets les champs contenant séparateurs, guillemets ou retours à la ligne. Limites : 2 MiB, 100 000 lignes, 500 colonnes et 500 000 cellules en entrée ; 500 lignes, 100 colonnes et 10 000 cellules dans l’aperçu.

Usages courants

  • Supprimer les lignes exportées plusieurs fois.
  • Conserver la première occurrence selon un identifiant, une adresse e-mail ou plusieurs champs.
  • Nettoyer un CSV sans écraser les colonnes dont les en-têtes sont identiques.

Confidentialité

Le traitement du texte, la lecture des fichiers, la conversion et l’aperçu s’effectuent localement dans votre navigateur. Votre saisie n’est pas envoyée à un serveur et aucun serveur applicatif, base de données, API en ligne ou CDN tiers n’est utilisé. Votre contenu n’est pas enregistré automatiquement. La copie et le téléchargement s’effectuent également dans le navigateur.

FAQ

Que signifie le dédoublonnage par ligne entière ?

Une ligne est un doublon uniquement si tous ses champs ont le même contenu dans le même ordre. Le mode par colonnes compare seulement les champs sélectionnés.

Quelle occurrence est conservée ?

La première ligne complète rencontrée est conservée, avec tous ses autres champs. L’ordre de sortie reste stable.

Des en-têtes identiques entraînent-ils une perte de données ?

Non. Les colonnes sont repérées par leur position et leur numéro est affiché. Leur nom n’est pas utilisé comme identifiant unique.

Comment les guillemets sont-ils traités en sortie ?

Les champs contenant un séparateur, des guillemets ou un retour à la ligne sont entourés de guillemets selon les règles CSV. Chaque guillemet interne est doublé.

Les formules et les espaces sont-ils modifiés automatiquement ?

Non. Les champs conservent leur contenu, sans suppression automatique d’espaces. Lors de l’importation dans un tableur, choisissez le type texte ou un autre type de colonne selon l’usage prévu.

Retour au répertoire des outils pour développeurs