Limpieza de listas · Gratis

Eliminar líneas duplicadas

Pega una lista y recupérala sin las repeticiones, o solo con las repeticiones. Las mayúsculas, los espacios sueltos, la puntuación y los acentos son interruptores de coincidencia independientes, y las líneas que se conservan se escriben exactamente como las tecleaste.

Duplicados eliminados en tu navegador · No se sube nada
Informar de un problema

5 líneas resultantes de 9, con 4 eliminadas en 3 líneas repetidas.

Tu lista

Pega un elemento por línea

9 líneas de entrada, 0 en blanco.210 / 200,000
Líneas resultantes
5
Eliminadas
4
Líneas repetidas
3
Distintas
5
Lista limpia

5 líneas

4 eliminadas de 9.

[email protected]
[email protected]
[email protected]
[email protected]
[email protected]
115 caracteres resultantes4 copias duplicadas encontradas0 líneas en blanco
Qué se repitió

3 líneas aparecen más de una vez

Ordenadas por las veces que apareció cada una. Cuando dos grafías se compararon como la misma línea, las otras grafías se muestran debajo, que suele ser donde aparece un espacio suelto o una mayúscula.

Cada línea repetida con el número de veces que apareció
VecesLíneaPrimera aparición
3[email protected]línea 1
2[email protected]También coinciden: "[email protected] "línea 2
2[email protected]línea 3
Cómo funciona

Una pasada, un mapa hash y una regla sobre lo que no se toca.

Cada línea se convierte en una clave de comparación aplicando las reglas de coincidencia que hayas elegido, y las claves van a un mapa que recuerda la primera línea que produjo cada una, cuántas líneas la siguieron y qué otras grafías llegaron con la misma clave. Es una sola pasada por la lista en lugar de comparar cada línea con todas las demás, y por eso cincuenta mil filas siguen siendo instantáneas. Lo importante es lo que le pasa al texto en sí: nada. La clave se usa para comparar y luego se descarta, y el resultado es tu línea original, byte a byte. Las opciones que cambian tus datos y las que cambian tu comparación son cosas distintas, y confundirlas es justo lo que convierte una limpieza en una pérdida de datos.

  1. 01

    Pega la lista, un elemento por línea

    Correos electrónicos, etiquetas, nombres de archivo, URL, SKU o cualquier otra cosa que llegue una por fila. Las líneas en blanco se descartan por defecto, y los recuentos de caracteres y de líneas se actualizan al pegar, así que ves enseguida si ha llegado toda la exportación.

  2. 02

    Decide cuándo dos líneas cuentan como iguales

    Las mayúsculas, los espacios en los extremos, los espacios internos repetidos, la puntuación y la normalización de acentos son interruptores independientes. Un espacio final invisible es la razón más habitual por la que un duplicado sobrevive a una deduplicación ingenua, así que esa opción viene activada por defecto.

  3. 03

    Elige qué se conserva y luego ordénalo

    Conserva la primera copia, conserva la última, conserva solo las líneas que aparecieron exactamente una vez, o dale la vuelta y conserva solo las que se repitieron. Después ordena alfabéticamente, de forma natural para que item2 vaya antes que item10, por longitud o por las veces que apareció cada línea.

Para exportaciones, listas de correo, conjuntos de etiquetas y listados de archivos

Elimina duplicados, invierte el filtro, ordena de forma natural y mira qué se repitió.

Las opciones de coincidencia nunca reescriben tu texto

Ignorar mayúsculas, espacios o puntuación solo cambia lo que cuenta como duplicado. Lo que se conserva se escribe exactamente como lo tecleaste, con sus mayúsculas y su espaciado originales intactos. Un eliminador de duplicados que te devuelve el texto en minúsculas ha editado tus datos en silencio en lugar de filtrarlos, y eso suele descubrirse mucho más tarde.

Cuatro formas de conservar, incluida la inversa

Conserva la primera aparición, conserva la última, conserva solo las líneas que aparecieron exactamente una vez o conserva solo las que se repitieron. Ese último modo es el que la mayoría de las herramientas omite, y es el que necesitas cuando los duplicados son el hallazgo: números de pedido repetidos, nombres reservados dos veces, un término que aparece dos veces en un glosario.

Orden natural, para que item2 vaya antes que item10

El orden alfabético simple coloca report-10 antes que report-2, porque compara carácter a carácter. El orden natural lee los dígitos como números, que es casi siempre lo que de verdad necesita una lista de nombres de archivo o de versiones. Se ofrecen los dos, además de ordenar por longitud y por frecuencia.

La tabla de repeticiones muestra los casi iguales

Cada línea que apareció más de una vez se lista con su recuento y su primera posición. Cuando dos grafías distintas se compararon como la misma línea, las otras grafías se muestran debajo, así que una mayúscula suelta o una coma final se ven en lugar de quedar simplemente absorbidas.

Normalización de acentos que detecta diferencias invisibles

El texto copiado de nombres de archivo de macOS suele estar en Unicode NFD, donde un carácter acentuado se guarda como una letra más una marca combinable. Se ve idéntico a la forma NFC, pero la comparación no los considera iguales. Normalizar a NFC antes de comparar detecta ese tipo de duplicado, que de otro modo es casi imposible de ver a simple vista.

Recuentos que puedes pegar con el resultado

Activa los recuentos y cada línea del resultado irá precedida por las veces que apareció, lo que convierte una lista sin duplicados en una tabla de frecuencias que puedes pegar directamente en una hoja de cálculo. La numeración es un interruptor aparte para cuando la lista va a un documento.

Preguntas sobre listas

Conservar el orden, caracteres invisibles, correos y encontrar repeticiones.

¿Cómo elimino líneas duplicadas sin perder el orden?+

Usa la opción predeterminada, que conserva la primera aparición de cada línea y deja la ordenación en el orden original. Cada línea se queda donde apareció por primera vez y solo se descartan las copias posteriores. Eso importa más de lo que parece: una lista en la que el orden tiene significado, como una lista de reproducción, una secuencia de compilación o una serie de pasos, queda arruinada por un eliminador de duplicados que ordena como efecto secundario. Si prefieres conservar la última aparición, por ejemplo cuando las filas posteriores de una exportación son la versión más reciente de un registro, cambia a conservar la última.

¿Por qué ha sobrevivido un duplicado evidente?+

Casi siempre por un carácter invisible: un espacio final, un espacio de no separación pegado desde una página web, una coma suelta que quedó de una columna CSV o una diferencia de mayúsculas. Activa "Ignorar espacios en los extremos" y desactiva "Distinguir mayúsculas", y la mayoría se fusionan al instante. Si un par sigue sin coincidir, mira la tabla de repeticiones: las entradas que aparecen en "También coinciden" muestran qué grafías se trataron como la misma línea, lo que suele hacer evidente la diferencia. Los caracteres Unicode realmente distintos que se parecen, como un apóstrofo curvo frente a uno recto, no coinciden, y no deben hacerlo.

¿Puedo encontrar los duplicados en lugar de eliminarlos?+

Sí, ese es el modo "Solo las líneas repetidas". Muestra una fila por cada línea que apareció más de una vez, y la tabla de abajo da el recuento y la primera posición de cada una. Es el modo adecuado para revisar una exportación en busca de entradas dobles, encontrar una palabra clave que aparece dos veces en una lista que debería ser única o confirmar que una combinación no introdujo copias. El modo opuesto, "Solo las líneas que aparecen una vez", descarta por completo cada línea repetida, incluida su primera copia, que es lo que quieres cuando una repetición significa que la fila es sospechosa.

¿Qué es el orden natural?+

Una ordenación que lee las secuencias de dígitos como números y no como caracteres. El orden alfabético corriente compara posición a posición, así que "report-10" va antes que "report-2" porque el carácter 1 se ordena antes que el 2. El orden natural compara 10 con 2 como números y los coloca en el orden correcto. Es lo que usan los gestores de archivos, y es casi siempre lo que quieres para cualquier cosa con un sufijo numérico: versiones, capítulos, números de factura, secuencias de imágenes.

¿Sirve para una lista de correos electrónicos?+

Sí, y las direcciones de correo son su uso más habitual. Conviene saber dos cosas. Por especificación, los dominios no distinguen mayúsculas, así que puedes dejar desactivado "Distinguir mayúsculas" sin riesgo, y así se detecta el par tan común [email protected] frente a [email protected]. Las partes locales, lo que va antes de la arroba, técnicamente sí distinguen mayúsculas, pero en la práctica casi ningún proveedor las trata así. Los puntos y las direcciones con signo más de Gmail son otra cuestión: [email protected], [email protected] y [email protected] llegan a la misma bandeja de entrada, pero son cadenas realmente distintas, y esta herramienta no las fusiona, porque hacerlo sería incorrecto para cualquier otro proveedor.

¿Cuántas líneas admite?+

Hasta 200,000 caracteres o 50,000 líneas, lo que llegue primero, y sigue respondiendo con fluidez porque el trabajo es una sola pasada por la lista con un mapa hash, en lugar de comparar cada línea con todas las demás. Una lista que supera ese límite se trunca y la página lo indica, en lugar de procesar una parte en silencio. Para una exportación muy grande, divide el archivo y procésalo en varias pasadas, o elimina los duplicados allí donde está con sort y uniq en la línea de comandos.

¿Las líneas en blanco se consideran duplicadas entre sí?+

Si las dejas, sí: cada línea vacía es igual a cualquier otra línea vacía, así que una serie de ellas se reduce a una. Ese suele ser el comportamiento deseado en una lista. Si las líneas en blanco tienen significado en tu texto, por ejemplo porque separan párrafos, esta no es la herramienta adecuada para ese contenido, ya que todo el modelo aquí es que una línea es un elemento.

¿Se sube la lista?+

No. La comparación, la ordenación y el recuento se hacen en esta pestaña, y no se transmite ni se guarda nada. Es la razón principal para usar una página como esta en lugar de pegar una lista de clientes, un conjunto de URL internas o una exportación de correos de usuarios en un servicio que los procesa en un servidor.

¿Qué diferencia hay entre líneas distintas y líneas resultantes?+

Distintas es cuántas líneas diferentes hay en tu entrada según las reglas de coincidencia actuales. Líneas resultantes es cuántas escribe de verdad el modo de conservación actual. Coinciden cuando conservas la primera o la última copia de todo, y difieren en los otros dos modos: conservar solo las líneas que aparecen una vez excluye cada línea repetida, y conservar solo las repetidas excluye todo lo que apareció una vez. Comparar los dos números es una forma rápida de ver qué parte de tu lista estaba duplicada.

¿Puedo ordenar sin eliminar nada?+

No con esta herramienta, y es a propósito. Eliminar duplicados es lo que hace, así que cada línea que se conserva es única según tus reglas de coincidencia. Si quieres ordenar una lista con sus repeticiones intactas, activa los recuentos: obtienes una fila por cada línea distinta con su número de apariciones al lado, que contiene la misma información en una forma más fácil de leer y de pegar en una hoja de cálculo.

Más herramientas especializadas, listas cuando las necesites.

Explora una colección cada vez más amplia para cálculos, documentos, escritura y el trabajo diario.

Ver todas las herramientas