Sări la conținut
TextArray
Complet local

Eliminați rândurile duplicate după coloană

Eliminați rândurile CSV/TSV a căror valoare într-o coloană aleasă a apărut deja.

Intrare

Eliminați rândurile duplicate după coloană

Deduplicarea întregii linii ratează adevărata problemă: două rânduri sunt rareori identice, ele partajează doar același e-mail, ID sau SKU, în timp ce totul diferă. Acest instrument judecă rândurile după o coloană la alegerea dvs. - aceeași cheie care apare de două ori elimină rândul ulterioară, păstrând setul de date un rând pe cheie, fără o formulă de foaie de calcul la vedere.

Lipiți CSV, TSV sau orice rând delimitat; delimitatorul este detectat din prima linie de date (virgulă, punct și virgulă, tab sau pipe) cu o suprascriere manuală pentru cazurile marginale. Alegeți coloana cheie după numărul său bazat pe 1, spuneți instrumentului dacă primul rând este un antet - anteturile sunt păstrate și nu sunt comparate niciodată - și alegeți ce apariție supraviețuiește. Păstrați primul este implicit; păstrați ultimul este trucul clasic pentru jurnalele de modificări și exporturi, în care cel mai nou rând pe cheie se află în partea de jos. Valorile sunt tăiate înainte de comparare, iar un comutator de ignorare a majusculei îmbină [email protected] cu [email protected].

Numărul raportează eliminările și numărul liniilor de fiecare parte, astfel încât o pastă care nu a făcut nimic în tăcere - coloană greșită, delimitator greșit - este imediat vizibilă. Rândurile mai scurte decât coloana cheie sunt considerate ca având o valoare goală acolo și se deduplică între ele.

O limitare sinceră: împărțirea este simplă, nu o analiză CSV completă, așa că un câmp citat care conține delimitatorul în sine va încurca numărul de coloane - rulați mai întâi astfel de fișiere prin schimbătorul de delimitare CSV. Totul rulează local în browserul dvs.; datele tale nu părăsesc niciodată dispozitivul tău.

FAQ

Cum este diferit acest lucru de eliminarea liniilor duplicate?
Eliminarea liniilor duplicate necesită ca întregul rând să se potrivească. Aici este comparată doar coloana aleasă - două rânduri cu același ID de client, dar marcaje temporale diferite sunt considerate duplicate, ceea ce este de obicei necesar unui set de date.
Când ar trebui să păstrez ultima apariție în loc de prima?
Când fișierul este ordonat prin adăugare și cea mai nouă înregistrare câștigă: exporturi în care fiecare actualizare adaugă un rând, jurnalele, fluxurile de evenimente. Keep last vă oferă cea mai recentă stare per cheie; păstrează mai întâi păstrează intrarea originală.
Cum funcționează detectarea automată a delimitatorului?
Prima linie de date este scanată pentru virgule, punct și virgulă, file și conducte, iar cea mai frecventă câștigă. Numărul arată care a fost folosit - dacă a ghicit greșit, forțați-l pe cel potrivit cu opțiunea delimitare.
Dar câmpurile citate care conțin virgule?
Împărțirea este în mod deliberat simplă, astfel încât un câmp citat cu un delimitator încorporat deplasează coloanele pentru acel rând. Pentru astfel de fișiere, mai întâi normalizați cu instrumentul de delimitare CSV (de exemplu, la file), apoi deduplicați aici.
Datele mele sunt încărcate undeva?
Nu. Deduplicarea rulează în întregime în browserul dvs., iar datele dvs. nu părăsesc dispozitivul.