Eliminați rândurile duplicate după coloană
Eliminați rândurile CSV/TSV a căror valoare într-o coloană aleasă a apărut deja.
Eliminați rândurile duplicate după coloană
Deduplicarea întregii linii ratează adevărata problemă: două rânduri sunt rareori identice, ele partajează doar același e-mail, ID sau SKU, în timp ce totul diferă. Acest instrument judecă rândurile după o coloană la alegerea dvs. - aceeași cheie care apare de două ori elimină rândul ulterioară, păstrând setul de date un rând pe cheie, fără o formulă de foaie de calcul la vedere.
Lipiți CSV, TSV sau orice rând delimitat; delimitatorul este detectat din prima linie de date (virgulă, punct și virgulă, tab sau pipe) cu o suprascriere manuală pentru cazurile marginale. Alegeți coloana cheie după numărul său bazat pe 1, spuneți instrumentului dacă primul rând este un antet - anteturile sunt păstrate și nu sunt comparate niciodată - și alegeți ce apariție supraviețuiește. Păstrați primul este implicit; păstrați ultimul este trucul clasic pentru jurnalele de modificări și exporturi, în care cel mai nou rând pe cheie se află în partea de jos. Valorile sunt tăiate înainte de comparare, iar un comutator de ignorare a majusculei îmbină [email protected] cu [email protected].
Numărul raportează eliminările și numărul liniilor de fiecare parte, astfel încât o pastă care nu a făcut nimic în tăcere - coloană greșită, delimitator greșit - este imediat vizibilă. Rândurile mai scurte decât coloana cheie sunt considerate ca având o valoare goală acolo și se deduplică între ele.
O limitare sinceră: împărțirea este simplă, nu o analiză CSV completă, așa că un câmp citat care conține delimitatorul în sine va încurca numărul de coloane - rulați mai întâi astfel de fișiere prin schimbătorul de delimitare CSV. Totul rulează local în browserul dvs.; datele tale nu părăsesc niciodată dispozitivul tău.