Saltar al contenido
TextArray
Totalmente local

Eliminar filas duplicadas por columna

Elimine las filas CSV/TSV cuyo valor en una columna elegida ya apareció.

Entrada

Eliminar filas duplicadas por columna

La deduplicación de línea completa pasa por alto el problema real: dos filas rara vez son idénticas, simplemente comparten el mismo correo electrónico, ID o SKU, mientras que todo lo demás difiere. Esta herramienta juzga las filas según una columna de su elección: la misma clave que aparece dos veces elimina la fila posterior, manteniendo el conjunto de datos una fila por clave sin una fórmula de hoja de cálculo a la vista.

Pegue CSV, TSV o cualquier fila delimitada; el delimitador se detecta desde la primera línea de datos (coma, punto y coma, tabulación o barra vertical) con una anulación manual para casos extremos. Elija la columna clave por su número basado en 1, indique a la herramienta si la primera fila es un encabezado (los encabezados se conservan y nunca se comparan) y elija qué ocurrencia sobrevive. Mantener primero es el valor predeterminado; Mantener al final es el truco clásico para registros de cambios y exportaciones donde la fila más nueva por clave se encuentra en la parte inferior. Los valores se recortan antes de la comparación y un interruptor de ignorar casos fusiona [email protected] con [email protected].

El recuento informa las eliminaciones y el recuento de líneas en cada lado, por lo que un pegado que silenciosamente no hizo nada (columna incorrecta, delimitador incorrecto) es inmediatamente visible. Las filas más cortas que la columna clave cuentan como si tuvieran un valor vacío allí y se deduplican entre sí.

Una limitación honesta: la división es simple, no es un análisis CSV completo, por lo que un campo entre comillas que contenga el delimitador en sí confundirá el recuento de columnas; primero ejecute dichos archivos a través del cambiador de delimitadores CSV. Todo se ejecuta localmente en su navegador; sus datos nunca salen de su dispositivo.

Preguntas frecuentes

¿En qué se diferencia esto de eliminar líneas duplicadas?
La eliminación de líneas duplicadas necesita que toda la fila coincida. Aquí solo se compara la columna elegida: dos filas con el mismo ID de cliente pero diferentes marcas de tiempo cuentan como duplicados, que suele ser lo que realmente necesita un conjunto de datos.
¿Cuándo debo conservar la última aparición en lugar de la primera?
Cuando el archivo se ordena por agregados y gana el registro más nuevo: exportaciones donde cada actualización agrega una fila, registros y secuencias de eventos. Mantener último le proporciona el último estado por clave; mantener primero conserva la entrada original.
¿Cómo funciona la detección automática del delimitador?
La primera línea de datos se escanea en busca de comas, punto y coma, tabulaciones y barras verticales, y gana la más frecuente. El recuento muestra cuál se utilizó; si adivinó mal, fuerce la respuesta correcta con la opción delimitadora.
¿Qué pasa con los campos entre comillas que contienen comas?
La división es deliberadamente sencilla, por lo que un campo entre comillas con un delimitador incrustado desplaza las columnas de esa fila. Para dichos archivos, normalícelos primero con la herramienta delimitadora CSV (por ejemplo, en pestañas) y luego deduplica aquí.
¿Mis datos se cargan en algún lugar?
No. La deduplicación se ejecuta completamente en su navegador y sus datos nunca salen de su dispositivo.