Eliminar filas duplicadas por columna
Elimine las filas CSV/TSV cuyo valor en una columna elegida ya apareció.
Eliminar filas duplicadas por columna
La deduplicación de línea completa pasa por alto el problema real: dos filas rara vez son idénticas, simplemente comparten el mismo correo electrónico, ID o SKU, mientras que todo lo demás difiere. Esta herramienta juzga las filas según una columna de su elección: la misma clave que aparece dos veces elimina la fila posterior, manteniendo el conjunto de datos una fila por clave sin una fórmula de hoja de cálculo a la vista.
Pegue CSV, TSV o cualquier fila delimitada; el delimitador se detecta desde la primera línea de datos (coma, punto y coma, tabulación o barra vertical) con una anulación manual para casos extremos. Elija la columna clave por su número basado en 1, indique a la herramienta si la primera fila es un encabezado (los encabezados se conservan y nunca se comparan) y elija qué ocurrencia sobrevive. Mantener primero es el valor predeterminado; Mantener al final es el truco clásico para registros de cambios y exportaciones donde la fila más nueva por clave se encuentra en la parte inferior. Los valores se recortan antes de la comparación y un interruptor de ignorar casos fusiona [email protected] con [email protected].
El recuento informa las eliminaciones y el recuento de líneas en cada lado, por lo que un pegado que silenciosamente no hizo nada (columna incorrecta, delimitador incorrecto) es inmediatamente visible. Las filas más cortas que la columna clave cuentan como si tuvieran un valor vacío allí y se deduplican entre sí.
Una limitación honesta: la división es simple, no es un análisis CSV completo, por lo que un campo entre comillas que contenga el delimitador en sí confundirá el recuento de columnas; primero ejecute dichos archivos a través del cambiador de delimitadores CSV. Todo se ejecuta localmente en su navegador; sus datos nunca salen de su dispositivo.