Hoppa till innehåll
TextArray
100% lokalt

Ta bort dubbletter av rader efter kolumn

Släpp CSV/TSV-rader vars värde i en vald kolumn redan har visats.

Inmatning
Utmatning

Ta bort dubbletter av rader efter kolumn

Hellinjededuplicering missar det verkliga problemet: två rader är sällan identiska, de delar bara samma e-post, ID eller SKU medan allt annat skiljer sig. Det här verktyget bedömer rader efter en kolumn som du väljer - samma nyckel som visas två gånger tar bort den senare raden, vilket behåller datamängden en rad per nyckel utan en kalkylbladsformel i sikte.

Klistra in CSV, TSV eller andra avgränsade rader; avgränsaren detekteras från den första dataraden (komma, semikolon, tabb eller rör) med en manuell åsidosättning för kantfall. Välj nyckelkolumnen efter dess 1-baserade nummer, tala om för verktyget om den första raden är en rubrik - rubriker bevaras och jämförs aldrig - och välj vilken förekomst som överlever. Behåll först är standard; keep last är det klassiska tricket för ändringsloggar och exporter där den senaste raden per nyckel sitter längst ner. Värden beskärs före jämförelse, och en växel för ignorera skiftläge sammanfogar [email protected] med [email protected].

Sammanställningen rapporterar borttagningarna och radräkningen på vardera sidan, så en inklistring som inte gjorde något - fel kolumn, fel avgränsare - är omedelbart synlig. Rader som är kortare än nyckelkolumnen räknas som att ha ett tomt värde där och deduplicerar sinsemellan.

En ärlig begränsning: uppdelningen är enkel, inte en fullständig CSV-analys, så ett citerat fält som innehåller själva avgränsaren kommer att förvirra kolumnantalet – kör sådana filer genom CSV-avgränsarens växlare först. Allt körs lokalt i din webbläsare; din data lämnar aldrig din enhet.

FAQ

Hur skiljer sig detta från att ta bort dubblettlinjer?
Borttagning av dubbla rader kräver att hela raden matchar. Här jämförs bara den valda kolumnen — två rader med samma kund-ID men olika tidsstämplar räknas som dubbletter, vilket vanligtvis är vad en datamängd faktiskt behöver.
När ska jag behålla den sista förekomsten istället för den första?
När filen är append-ordnad och den senaste posten vinner: exporter där varje uppdatering lägger till en rad, loggar, händelseströmmar. Keep last ger dig det senaste tillståndet per nyckel; keep first bevarar den ursprungliga posten.
Hur fungerar den automatiska avgränsningsdetekteringen?
Den första dataraden skannas efter kommatecken, semikolon, tabbar och rör, och den vanligaste vinner. Sammanställningen visar vilken som användes - om den gissade fel, tvinga fram den rätta med avgränsningsalternativet.
Hur är det med citerade fält som innehåller kommatecken?
Uppdelningen är avsiktligt enkel, så ett fält med citattecken med en inbäddad avgränsare flyttar kolumnerna för den raden. För sådana filer, normalisera först med CSV-avgränsningsverktyget (t.ex. till flikar), sedan avduplicera här.
Laddas min data upp någonstans?
Nej. Dedupliceringen körs helt i din webbläsare och dina data lämnar aldrig din enhet.