Nettoyage de listes · Gratuit

Supprimer les lignes en double

Collez une liste et récupérez-la sans les doublons, ou avec les doublons seulement. Casse, espaces parasites, ponctuation et accents sont chacun un réglage de comparaison distinct, et les lignes conservées sont restituées exactement telles que vous les avez saisies.

Dédoublonné dans votre navigateur · Rien n'est importé
Signaler un problème

5 lignes en sortie sur 9, 4 supprimées pour 3 lignes répétées.

Votre liste

Collez un élément par ligne

9 lignes en entrée, dont 0 sans contenu.210 / 200,000
Lignes en sortie
5
Supprimées
4
Lignes répétées
3
Distinctes
5
Liste nettoyée

5 lignes

Supprimées : 4 sur 9.

[email protected]
[email protected]
[email protected]
[email protected]
[email protected]
115 caractères en sortie4 copies en double trouvées0 ligne vide
Ce qui se répète

3 lignes apparaissent plus d'une fois

Triées selon leur nombre d'occurrences. Lorsque deux graphies ont été considérées comme la même ligne, les autres graphies sont listées en dessous, et c'est souvent là qu'apparaît un espace égaré ou une majuscule.

Chaque ligne répétée avec le nombre de fois où elle est apparue
FoisLignePremière apparition
3[email protected]ligne 1
2[email protected]Correspondent aussi : « [email protected]  »ligne 2
2[email protected]ligne 3
Comment ça marche

Un seul passage, une table de hachage et une règle sur ce qu'il ne faut pas toucher.

Chaque ligne est transformée en clé de comparaison selon les règles de correspondance que vous avez choisies, et les clés sont placées dans une table qui retient la première ligne ayant produit chacune d'elles, le nombre de lignes qui ont suivi et les autres graphies arrivées sous la même clé. C'est un seul passage sur la liste, et non une comparaison de chaque ligne avec toutes les autres, ce qui explique que cinquante mille lignes restent instantanées. L'essentiel est ce qui arrive au texte lui-même : rien. La clé sert à la comparaison puis est abandonnée, et le résultat est votre ligne d'origine, octet pour octet. Les options qui modifient vos données et celles qui modifient votre comparaison sont deux choses différentes, et c'est en les confondant qu'un nettoyage tourne à la perte de données.

  1. 01

    Collez la liste, un élément par ligne

    Adresses e-mail, tags, noms de fichiers, URL, SKU ou tout ce qui arrive à raison d'un élément par ligne. Les lignes vides sont supprimées par défaut, et les nombres de caractères et de lignes se mettent à jour pendant le collage, pour vérifier tout de suite que l'export complet est bien arrivé.

  2. 02

    Décidez quand deux lignes sont identiques

    La casse, les espaces aux extrémités, les espaces internes répétés, la ponctuation et la normalisation des accents sont des réglages distincts. Un espace final invisible est de loin la raison la plus fréquente pour laquelle un doublon survit à un dédoublonnage naïf, c'est pourquoi ce réglage est activé par défaut.

  3. 03

    Choisissez ce qui reste, puis triez

    Gardez la première copie, gardez la dernière, gardez seulement les lignes apparues exactement une fois, ou inversez la logique et gardez seulement les lignes répétées. Triez ensuite par ordre alphabétique, en ordre naturel pour que item2 passe avant item10, par longueur ou selon le nombre d'occurrences de chaque ligne.

Pour les exports, listes de diffusion, jeux de tags et listes de fichiers

Dédoublonnez, inversez, triez naturellement et voyez ce qui se répète.

Les options de comparaison ne réécrivent jamais votre texte

Ignorer la casse, les espaces ou la ponctuation change uniquement ce qui compte comme doublon. Ce qui reste est restitué exactement tel que vous l'avez saisi, avec ses majuscules et ses espaces d'origine. Un outil de dédoublonnage qui vous rend un texte en minuscules a modifié vos données en silence au lieu de les filtrer, et on s'en aperçoit généralement bien plus tard.

Quatre façons de conserver, dont l'inverse

Gardez la première occurrence, gardez la dernière, gardez seulement les lignes apparues exactement une fois, ou gardez seulement les lignes répétées. Ce dernier mode est celui que la plupart des outils oublient, et c'est celui qu'il vous faut quand les doublons sont justement ce que vous cherchez : des numéros de commande répétés, des noms réservés deux fois, un terme qui figure deux fois dans un glossaire.

Tri naturel, pour que item2 passe avant item10

Un tri alphabétique simple place report-10 avant report-2, car il compare caractère par caractère. Le tri naturel lit les chiffres comme des nombres, ce qui correspond presque toujours à ce qu'attend une liste de noms de fichiers ou de versions. Les deux sont proposés, ainsi que le tri par longueur et par fréquence.

Le tableau des répétitions montre les quasi-doublons

Chaque ligne apparue plus d'une fois est listée avec son nombre d'occurrences et sa première position. Lorsque deux graphies différentes ont été considérées comme la même ligne, les autres graphies sont affichées en dessous, si bien qu'une majuscule égarée ou une virgule finale reste visible au lieu d'être simplement absorbée.

Une normalisation des accents qui repère les différences invisibles

Le texte copié depuis des noms de fichiers macOS est souvent en Unicode NFD, où un caractère accentué est stocké sous la forme d'une lettre suivie d'un signe diacritique combinant. Il paraît identique à la forme NFC, mais la comparaison les juge différents. Normaliser en NFC avant la comparaison permet d'attraper cette catégorie de doublons, qu'il est sinon presque impossible de déceler à l'œil nu.

Des comptages à coller avec le résultat

Activez les comptages et chaque ligne du résultat est précédée de son nombre d'occurrences, ce qui transforme une liste dédoublonnée en tableau de fréquences à coller directement dans un tableur. La numérotation est un réglage distinct, pour les listes destinées à un document.

Questions sur les listes

Conserver l'ordre, caractères invisibles, e-mails et recherche des doublons.

Comment supprimer les lignes en double sans perdre l'ordre ?+

Utilisez le réglage par défaut, qui garde la première occurrence de chaque ligne et laisse le tri sur l'ordre d'origine. Chaque ligne reste là où elle est apparue pour la première fois, et seules les copies suivantes sont supprimées. C'est plus important qu'il n'y paraît : une liste dont l'ordre a un sens, comme une liste de lecture, une séquence de compilation ou une suite d'étapes, est gâchée par un outil de dédoublonnage qui trie au passage. Si vous préférez garder la dernière occurrence, par exemple quand les lignes suivantes d'un export sont la version la plus récente d'un enregistrement, choisissez de garder la dernière.

Pourquoi un doublon évident a-t-il survécu ?+

Presque toujours à cause d'un caractère invisible : un espace final, une espace insécable collée depuis une page web, une virgule égarée provenant d'une colonne CSV, ou une différence de majuscules. Activez « Ignorer les espaces aux extrémités » et désactivez « Respecter la casse », et la plupart fusionnent aussitôt. Si une paire refuse toujours de correspondre, regardez le tableau des répétitions : les entrées listées sous « Correspondent aussi » montrent quelles graphies ont été traitées comme la même ligne, ce qui rend en général la différence évidente. Des caractères Unicode réellement différents mais qui se ressemblent, comme une apostrophe courbe et une apostrophe droite, ne correspondent pas, et ne doivent pas correspondre.

Puis-je trouver les doublons plutôt que les supprimer ?+

Oui, c'est le mode « Seulement les lignes répétées ». Il affiche une entrée par ligne apparue plus d'une fois, et le tableau en dessous indique le nombre d'occurrences et la première position de chacune. C'est le bon mode pour vérifier qu'un export ne contient pas d'entrées en double, trouver un mot-clé qui figure deux fois dans une liste censée être unique, ou confirmer qu'une fusion n'a pas introduit de copies. Le mode opposé, « Lignes présentes une seule fois », écarte entièrement chaque ligne répétée, y compris sa première copie, ce qu'il vous faut quand une répétition signifie que la ligne est suspecte.

Qu'est-ce que le tri naturel ?+

Un tri qui lit les suites de chiffres comme des nombres plutôt que comme des caractères. Le tri alphabétique ordinaire compare position par position, si bien que « report-10 » passe avant « report-2 », car le caractère 1 se classe avant 2. Le tri naturel compare 10 et 2 en tant que nombres et les remet dans le bon ordre. C'est ce qu'utilisent les gestionnaires de fichiers, et c'est presque toujours ce qu'il vous faut pour tout ce qui porte un suffixe numérique : versions, chapitres, numéros de facture, séquences d'images.

Est-ce que cela fonctionne pour une liste d'e-mails ?+

Oui, et les adresses e-mail en sont l'usage le plus courant. Deux points à connaître. Selon la spécification, les noms de domaine sont insensibles à la casse : vous pouvez donc laisser « Respecter la casse » désactivé sans risque, ce qui attrape la paire très courante [email protected] et [email protected]. Les parties locales, c'est-à-dire ce qui précède l'arobase, sont techniquement sensibles à la casse, mais en pratique quasiment aucun fournisseur ne les traite ainsi. Les points et l'adressage avec un plus de Gmail sont une autre affaire : [email protected], [email protected] et [email protected] arrivent dans la même boîte de réception mais sont des chaînes réellement différentes, et cet outil ne les fusionnera pas, car ce serait faux pour tous les autres fournisseurs.

Combien de lignes peut-il traiter ?+

Jusqu'à 200,000 caractères ou 50,000 lignes, selon la première limite atteinte, et il reste réactif parce que le travail consiste en un seul passage sur la liste avec une table de hachage, plutôt qu'en une comparaison de chaque ligne avec toutes les autres. Une liste qui dépasse ce plafond est tronquée, et la page l'indique au lieu d'en traiter une partie en silence. Pour un export très volumineux, découpez le fichier et traitez-le en plusieurs passes, ou dédoublonnez-le sur place avec sort et uniq en ligne de commande.

Les lignes vides sont-elles considérées comme des doublons les unes des autres ?+

Si vous les gardez, oui : chaque ligne vide est identique à toutes les autres, donc une série de lignes vides se réduit à une seule. C'est généralement le comportement souhaité pour une liste. Si les lignes vides ont un sens dans votre texte, par exemple parce qu'elles séparent des paragraphes, cet outil n'est pas adapté à ce contenu, puisque tout son principe repose sur l'idée qu'une ligne est un élément.

La liste est-elle importée ?+

Non. La comparaison, le tri et le comptage se font tous dans cet onglet, et rien n'est transmis ni stocké. C'est la principale raison d'utiliser une page comme celle-ci plutôt que de coller une liste de clients, un ensemble d'URL internes ou un export d'e-mails d'utilisateurs dans un service qui les traite sur un serveur.

Quelle est la différence entre lignes distinctes et lignes en sortie ?+

« Distinctes » indique combien de lignes différentes contient votre saisie selon les règles de correspondance actuelles. « Lignes en sortie » indique combien de lignes le mode de conservation actuel écrit réellement. Les deux sont égaux quand vous gardez la première ou la dernière copie de tout, et diffèrent dans les deux autres modes : garder seulement les lignes présentes une fois exclut toutes les lignes répétées, et garder seulement les répétitions exclut tout ce qui n'est apparu qu'une fois. Comparer les deux nombres permet de voir rapidement quelle part de votre liste était en double.

Puis-je trier sans rien supprimer ?+

Pas avec cet outil, et c'est voulu. Il sert à dédoublonner, donc chaque ligne conservée est unique selon vos règles de correspondance. Si vous voulez trier une liste en gardant ses répétitions, activez plutôt les comptages : vous obtenez une entrée par ligne distincte avec son nombre d'occurrences à côté, ce qui porte la même information sous une forme plus facile à lire et à coller dans un tableur.

D'autres outils ciblés, prêts quand vous l'êtes.

Découvrez une collection grandissante pour les calculs, les documents, la rédaction et le travail de tous les jours.

Voir tous les outils