Ga naar inhoud
TextArray
100% lokaal

Verwijder dubbele rijen per kolom

Verwijder CSV/TSV-rijen waarvan de waarde al in een gekozen kolom verscheen.

Invoer
Uitvoer

Verwijder dubbele rijen per kolom

Bij deduplicatie van hele regels wordt het echte probleem over het hoofd gezien: twee rijen zijn zelden identiek, ze delen alleen hetzelfde e-mailadres, ID of SKU, terwijl al het andere verschilt. Deze tool beoordeelt rijen op basis van één kolom naar keuze: als dezelfde sleutel twee keer verschijnt, wordt de latere rij verwijderd, waardoor de gegevensset één rij per sleutel blijft zonder dat er een spreadsheetformule in zicht is.

Plak CSV, TSV of gescheiden rijen; het scheidingsteken wordt gedetecteerd vanaf de eerste dataregel (komma, puntkomma, tab of pijp) met een handmatige overschrijving voor randgevallen. Kies de sleutelkolom op basis van het op 1 gebaseerde getal, vertel de tool of de eerste rij een koptekst is (kopteksten worden bewaard en nooit vergeleken) en kies welke gebeurtenis overleeft. Eerst bewaren is de standaard; als laatste bewaren is de klassieke truc voor changelogs en exports waarbij de nieuwste rij per sleutel onderaan staat. Waarden worden vóór vergelijking bijgesneden, en een schakelaar voor negeren van hoofdletters voegt [email protected] samen met [email protected].

De telling rapporteert de verwijderingen en het aantal regels aan weerszijden, dus een pasta die in stilte niets deed (verkeerde kolom, verkeerd scheidingsteken) is onmiddellijk zichtbaar. Rijen die korter zijn dan de sleutelkolom tellen daar als een lege waarde en worden onderling ontdubbeld.

Eén eerlijke beperking: het splitsen is duidelijk, geen volledige CSV-parsering, dus een veld tussen aanhalingstekens dat het scheidingsteken zelf bevat, zal het aantal kolommen verwarren - voer dergelijke bestanden eerst door de CSV-scheidingstekenwisselaar. Alles draait lokaal in uw browser; uw gegevens verlaten nooit uw apparaat.

FAQ

Hoe verschilt dit van het verwijderen van dubbele regels?
Bij het verwijderen van dubbele regels moet de hele rij overeenkomen. Hier wordt alleen de gekozen kolom vergeleken: twee rijen met dezelfde klant-ID maar verschillende tijdstempels tellen als duplicaten, wat meestal is wat een dataset eigenlijk nodig heeft.
Wanneer moet ik de laatste gebeurtenis behouden in plaats van de eerste?
Wanneer het bestand is geordend en de nieuwste record wint: exporteert waarbij elke update een rij toevoegt, logs, gebeurtenisstreams. Keep last geeft je de laatste status per sleutel; Bij Keep First blijft de oorspronkelijke invoer behouden.
Hoe werkt de automatische detectie van scheidingstekens?
De eerste dataregel wordt gescand op komma's, puntkomma's, tabs en pijpen, en de meest voorkomende wint. De telling laat zien welke er is gebruikt. Als er verkeerd is geraden, forceer dan de juiste met de optie voor scheidingstekens.
Hoe zit het met velden tussen aanhalingstekens die komma's bevatten?
De splitsing is bewust eenvoudig gehouden, dus een veld tussen aanhalingstekens en een ingebed scheidingsteken verschuift de kolommen voor die rij. Voor dergelijke bestanden moet u eerst normaliseren met het CSV-scheidingsteken (bijvoorbeeld naar tabbladen) en vervolgens hier ontdubbelen.
Worden mijn gegevens ergens geüpload?
Nee. De deduplicatie verloopt volledig in uw browser en uw gegevens verlaten uw apparaat nooit.