¿Cómo elimino líneas duplicadas sin perder el orden?+
Usa la opción predeterminada, que conserva la primera aparición de cada línea y deja la ordenación en el orden original. Cada línea se queda donde apareció por primera vez y solo se descartan las copias posteriores. Eso importa más de lo que parece: una lista en la que el orden tiene significado, como una lista de reproducción, una secuencia de compilación o una serie de pasos, queda arruinada por un eliminador de duplicados que ordena como efecto secundario. Si prefieres conservar la última aparición, por ejemplo cuando las filas posteriores de una exportación son la versión más reciente de un registro, cambia a conservar la última.
¿Por qué ha sobrevivido un duplicado evidente?+
Casi siempre por un carácter invisible: un espacio final, un espacio de no separación pegado desde una página web, una coma suelta que quedó de una columna CSV o una diferencia de mayúsculas. Activa "Ignorar espacios en los extremos" y desactiva "Distinguir mayúsculas", y la mayoría se fusionan al instante. Si un par sigue sin coincidir, mira la tabla de repeticiones: las entradas que aparecen en "También coinciden" muestran qué grafías se trataron como la misma línea, lo que suele hacer evidente la diferencia. Los caracteres Unicode realmente distintos que se parecen, como un apóstrofo curvo frente a uno recto, no coinciden, y no deben hacerlo.
¿Puedo encontrar los duplicados en lugar de eliminarlos?+
Sí, ese es el modo "Solo las líneas repetidas". Muestra una fila por cada línea que apareció más de una vez, y la tabla de abajo da el recuento y la primera posición de cada una. Es el modo adecuado para revisar una exportación en busca de entradas dobles, encontrar una palabra clave que aparece dos veces en una lista que debería ser única o confirmar que una combinación no introdujo copias. El modo opuesto, "Solo las líneas que aparecen una vez", descarta por completo cada línea repetida, incluida su primera copia, que es lo que quieres cuando una repetición significa que la fila es sospechosa.
¿Qué es el orden natural?+
Una ordenación que lee las secuencias de dígitos como números y no como caracteres. El orden alfabético corriente compara posición a posición, así que "report-10" va antes que "report-2" porque el carácter 1 se ordena antes que el 2. El orden natural compara 10 con 2 como números y los coloca en el orden correcto. Es lo que usan los gestores de archivos, y es casi siempre lo que quieres para cualquier cosa con un sufijo numérico: versiones, capítulos, números de factura, secuencias de imágenes.
¿Sirve para una lista de correos electrónicos?+
Sí, y las direcciones de correo son su uso más habitual. Conviene saber dos cosas. Por especificación, los dominios no distinguen mayúsculas, así que puedes dejar desactivado "Distinguir mayúsculas" sin riesgo, y así se detecta el par tan común [email protected] frente a [email protected]. Las partes locales, lo que va antes de la arroba, técnicamente sí distinguen mayúsculas, pero en la práctica casi ningún proveedor las trata así. Los puntos y las direcciones con signo más de Gmail son otra cuestión: [email protected], [email protected] y [email protected] llegan a la misma bandeja de entrada, pero son cadenas realmente distintas, y esta herramienta no las fusiona, porque hacerlo sería incorrecto para cualquier otro proveedor.
¿Cuántas líneas admite?+
Hasta 200,000 caracteres o 50,000 líneas, lo que llegue primero, y sigue respondiendo con fluidez porque el trabajo es una sola pasada por la lista con un mapa hash, en lugar de comparar cada línea con todas las demás. Una lista que supera ese límite se trunca y la página lo indica, en lugar de procesar una parte en silencio. Para una exportación muy grande, divide el archivo y procésalo en varias pasadas, o elimina los duplicados allí donde está con sort y uniq en la línea de comandos.
¿Las líneas en blanco se consideran duplicadas entre sí?+
Si las dejas, sí: cada línea vacía es igual a cualquier otra línea vacía, así que una serie de ellas se reduce a una. Ese suele ser el comportamiento deseado en una lista. Si las líneas en blanco tienen significado en tu texto, por ejemplo porque separan párrafos, esta no es la herramienta adecuada para ese contenido, ya que todo el modelo aquí es que una línea es un elemento.
¿Se sube la lista?+
No. La comparación, la ordenación y el recuento se hacen en esta pestaña, y no se transmite ni se guarda nada. Es la razón principal para usar una página como esta en lugar de pegar una lista de clientes, un conjunto de URL internas o una exportación de correos de usuarios en un servicio que los procesa en un servidor.
¿Qué diferencia hay entre líneas distintas y líneas resultantes?+
Distintas es cuántas líneas diferentes hay en tu entrada según las reglas de coincidencia actuales. Líneas resultantes es cuántas escribe de verdad el modo de conservación actual. Coinciden cuando conservas la primera o la última copia de todo, y difieren en los otros dos modos: conservar solo las líneas que aparecen una vez excluye cada línea repetida, y conservar solo las repetidas excluye todo lo que apareció una vez. Comparar los dos números es una forma rápida de ver qué parte de tu lista estaba duplicada.
¿Puedo ordenar sin eliminar nada?+
No con esta herramienta, y es a propósito. Eliminar duplicados es lo que hace, así que cada línea que se conserva es única según tus reglas de coincidencia. Si quieres ordenar una lista con sus repeticiones intactas, activa los recuentos: obtienes una fila por cada línea distinta con su número de apariciones al lado, que contiene la misma información en una forma más fácil de leer y de pegar en una hoja de cálculo.