Vai al contenuto
TextArray
100% locale

Rimuovi le righe duplicate per colonna

Rilascia le righe CSV/TSV il cui valore è già apparso in una colonna scelta.

Ingresso

Rimuovi le righe duplicate per colonna

La deduplicazione dell'intera linea non risolve il vero problema: due righe raramente sono identiche, condividono semplicemente lo stesso indirizzo e-mail, ID o SKU mentre tutto il resto è diverso. Questo strumento giudica le righe in base a una colonna a tua scelta: la stessa chiave che appare due volte rimuove la riga successiva, mantenendo il set di dati una riga per chiave senza una formula del foglio di calcolo in vista.

Incolla CSV, TSV o qualsiasi riga delimitata; il delimitatore viene rilevato dalla prima riga dati (virgola, punto e virgola, tabulazione o barra verticale) con un override manuale per i casi limite. Scegli la colonna chiave in base al suo numero in base 1, indica allo strumento se la prima riga è un'intestazione (le intestazioni vengono conservate e mai confrontate) e scegli quale occorrenza sopravvive. Mantieni prima è l'impostazione predefinita; mantieni l'ultimo è il classico trucco per i log delle modifiche e le esportazioni in cui la riga più recente per chiave si trova in fondo. I valori vengono tagliati prima del confronto e un'opzione da ignorare unisce [email protected] con [email protected].

Il conteggio riporta le rimozioni e il conteggio delle righe su entrambi i lati, quindi un incolla che silenziosamente non ha fatto nulla (colonna sbagliata, delimitatore sbagliato) è immediatamente visibile. Le righe più corte della colonna chiave vengono conteggiate come aventi un valore vuoto e vengono deduplicate tra loro.

Una limitazione onesta: la suddivisione è semplice, non un'analisi CSV completa, quindi un campo tra virgolette contenente il delimitatore stesso confonderà il conteggio delle colonne: esegui prima tali file attraverso il commutatore di delimitatori CSV. Tutto funziona localmente nel tuo browser; i tuoi dati non lasciano mai il tuo dispositivo.

FAQ

In cosa differisce dalla rimozione di righe duplicate?
Per rimuovere la riga duplicata è necessario che l'intera riga corrisponda. Qui viene confrontata solo la colonna scelta: due righe con lo stesso ID cliente ma timestamp diversi contano come duplicati, che di solito è ciò di cui effettivamente ha bisogno un set di dati.
Quando dovrei conservare l'ultima occorrenza anziché la prima?
Quando il file viene aggiunto in ordine e prevale il record più recente: esportazioni in cui ogni aggiornamento aggiunge una riga, registri e flussi di eventi. Mantieni ultimo ti fornisce lo stato più recente per chiave; mantieni prima conserva la voce originale.
Come funziona il rilevamento automatico del delimitatore?
La prima riga di dati viene scansionata alla ricerca di virgole, punti e virgola, tabulazioni e barre verticali e vince quella più frequente. Il conteggio mostra quale è stato utilizzato: se ha sbagliato, forza quello giusto con l'opzione delimitatore.
Che dire dei campi tra virgolette che contengono virgole?
La suddivisione è deliberatamente semplice, quindi un campo tra virgolette con un delimitatore incorporato sposta le colonne di quella riga. Per tali file, normalizzali prima con lo strumento delimitatore CSV (ad esempio nelle schede), quindi deduplicali qui.
I miei dati vengono caricati da qualche parte?
No. La deduplicazione viene eseguita interamente nel tuo browser e i tuoi dati non lasciano mai il tuo dispositivo.