Comment supprimer les lignes en double sans perdre l'ordre ?+
Utilisez le réglage par défaut, qui garde la première occurrence de chaque ligne et laisse le tri sur l'ordre d'origine. Chaque ligne reste là où elle est apparue pour la première fois, et seules les copies suivantes sont supprimées. C'est plus important qu'il n'y paraît : une liste dont l'ordre a un sens, comme une liste de lecture, une séquence de compilation ou une suite d'étapes, est gâchée par un outil de dédoublonnage qui trie au passage. Si vous préférez garder la dernière occurrence, par exemple quand les lignes suivantes d'un export sont la version la plus récente d'un enregistrement, choisissez de garder la dernière.
Pourquoi un doublon évident a-t-il survécu ?+
Presque toujours à cause d'un caractère invisible : un espace final, une espace insécable collée depuis une page web, une virgule égarée provenant d'une colonne CSV, ou une différence de majuscules. Activez « Ignorer les espaces aux extrémités » et désactivez « Respecter la casse », et la plupart fusionnent aussitôt. Si une paire refuse toujours de correspondre, regardez le tableau des répétitions : les entrées listées sous « Correspondent aussi » montrent quelles graphies ont été traitées comme la même ligne, ce qui rend en général la différence évidente. Des caractères Unicode réellement différents mais qui se ressemblent, comme une apostrophe courbe et une apostrophe droite, ne correspondent pas, et ne doivent pas correspondre.
Puis-je trouver les doublons plutôt que les supprimer ?+
Oui, c'est le mode « Seulement les lignes répétées ». Il affiche une entrée par ligne apparue plus d'une fois, et le tableau en dessous indique le nombre d'occurrences et la première position de chacune. C'est le bon mode pour vérifier qu'un export ne contient pas d'entrées en double, trouver un mot-clé qui figure deux fois dans une liste censée être unique, ou confirmer qu'une fusion n'a pas introduit de copies. Le mode opposé, « Lignes présentes une seule fois », écarte entièrement chaque ligne répétée, y compris sa première copie, ce qu'il vous faut quand une répétition signifie que la ligne est suspecte.
Qu'est-ce que le tri naturel ?+
Un tri qui lit les suites de chiffres comme des nombres plutôt que comme des caractères. Le tri alphabétique ordinaire compare position par position, si bien que « report-10 » passe avant « report-2 », car le caractère 1 se classe avant 2. Le tri naturel compare 10 et 2 en tant que nombres et les remet dans le bon ordre. C'est ce qu'utilisent les gestionnaires de fichiers, et c'est presque toujours ce qu'il vous faut pour tout ce qui porte un suffixe numérique : versions, chapitres, numéros de facture, séquences d'images.
Est-ce que cela fonctionne pour une liste d'e-mails ?+
Oui, et les adresses e-mail en sont l'usage le plus courant. Deux points à connaître. Selon la spécification, les noms de domaine sont insensibles à la casse : vous pouvez donc laisser « Respecter la casse » désactivé sans risque, ce qui attrape la paire très courante [email protected] et [email protected]. Les parties locales, c'est-à-dire ce qui précède l'arobase, sont techniquement sensibles à la casse, mais en pratique quasiment aucun fournisseur ne les traite ainsi. Les points et l'adressage avec un plus de Gmail sont une autre affaire : [email protected], [email protected] et [email protected] arrivent dans la même boîte de réception mais sont des chaînes réellement différentes, et cet outil ne les fusionnera pas, car ce serait faux pour tous les autres fournisseurs.
Combien de lignes peut-il traiter ?+
Jusqu'à 200,000 caractères ou 50,000 lignes, selon la première limite atteinte, et il reste réactif parce que le travail consiste en un seul passage sur la liste avec une table de hachage, plutôt qu'en une comparaison de chaque ligne avec toutes les autres. Une liste qui dépasse ce plafond est tronquée, et la page l'indique au lieu d'en traiter une partie en silence. Pour un export très volumineux, découpez le fichier et traitez-le en plusieurs passes, ou dédoublonnez-le sur place avec sort et uniq en ligne de commande.
Les lignes vides sont-elles considérées comme des doublons les unes des autres ?+
Si vous les gardez, oui : chaque ligne vide est identique à toutes les autres, donc une série de lignes vides se réduit à une seule. C'est généralement le comportement souhaité pour une liste. Si les lignes vides ont un sens dans votre texte, par exemple parce qu'elles séparent des paragraphes, cet outil n'est pas adapté à ce contenu, puisque tout son principe repose sur l'idée qu'une ligne est un élément.
La liste est-elle importée ?+
Non. La comparaison, le tri et le comptage se font tous dans cet onglet, et rien n'est transmis ni stocké. C'est la principale raison d'utiliser une page comme celle-ci plutôt que de coller une liste de clients, un ensemble d'URL internes ou un export d'e-mails d'utilisateurs dans un service qui les traite sur un serveur.
Quelle est la différence entre lignes distinctes et lignes en sortie ?+
« Distinctes » indique combien de lignes différentes contient votre saisie selon les règles de correspondance actuelles. « Lignes en sortie » indique combien de lignes le mode de conservation actuel écrit réellement. Les deux sont égaux quand vous gardez la première ou la dernière copie de tout, et diffèrent dans les deux autres modes : garder seulement les lignes présentes une fois exclut toutes les lignes répétées, et garder seulement les répétitions exclut tout ce qui n'est apparu qu'une fois. Comparer les deux nombres permet de voir rapidement quelle part de votre liste était en double.
Puis-je trier sans rien supprimer ?+
Pas avec cet outil, et c'est voulu. Il sert à dédoublonner, donc chaque ligne conservée est unique selon vos règles de correspondance. Si vous voulez trier une liste en gardant ses répétitions, activez plutôt les comptages : vous obtenez une entrée par ligne distincte avec son nombre d'occurrences à côté, ce qui porte la même information sous une forme plus facile à lire et à coller dans un tableur.