Aller au contenu
TextArray
Tout en local

Supprimer les lignes en double par colonne

Supprimez les lignes CSV/TSV dont la valeur dans une colonne choisie apparaît déjà.

Entrée

Supprimer les lignes en double par colonne

La déduplication de ligne entière ne répond pas au véritable problème : deux lignes sont rarement identiques, elles partagent simplement le même e-mail, ID ou SKU alors que tout le reste est différent. Cet outil juge les lignes en fonction d'une colonne de votre choix : la même clé apparaissant deux fois supprime la dernière ligne, conservant l'ensemble de données une ligne par clé sans formule de feuille de calcul en vue.

Collez CSV, TSV ou toute ligne délimitée ; le délimiteur est détecté à partir de la première ligne de données (virgule, point-virgule, tabulation ou barre verticale) avec un remplacement manuel pour les cas extrêmes. Choisissez la colonne clé par son numéro de base 1, indiquez à l'outil si la première ligne est un en-tête (les en-têtes sont conservés et jamais comparés) et choisissez quelle occurrence survit. Conserver en premier est la valeur par défaut ; keep last est l'astuce classique pour les journaux de modifications et les exportations où la ligne la plus récente par clé se trouve en bas. Les valeurs sont tronquées avant la comparaison et un commutateur ignorer la casse fusionne [email protected] avec [email protected].

Le décompte indique les suppressions et le nombre de lignes de chaque côté, de sorte qu'un collage qui n'a rien fait en silence (mauvaise colonne, mauvais délimiteur) est immédiatement visible. Les lignes plus courtes que la colonne clé sont considérées comme ayant une valeur vide et se doublonnent entre elles.

Une limitation honnête : le fractionnement est simple, pas une analyse CSV complète, donc un champ cité contenant le délimiteur lui-même confondra le nombre de colonnes - exécutez d'abord ces fichiers via le changeur de délimiteur CSV. Tout s'exécute localement dans votre navigateur ; vos données ne quittent jamais votre appareil.

FAQ

En quoi est-ce différent de la suppression des lignes en double ?
La suppression des lignes en double nécessite que la ligne entière corresponde. Ici, seule la colonne choisie est comparée : deux lignes avec le même identifiant client mais des horodatages différents comptent comme des doublons, ce qui correspond généralement à ce dont un ensemble de données a réellement besoin.
Quand dois-je conserver la dernière occurrence au lieu de la première ?
Lorsque le fichier est ajouté dans l'ordre et que l'enregistrement le plus récent l'emporte : exporte où chaque mise à jour ajoute une ligne, des journaux et des flux d'événements. Keep last vous donne le dernier état par clé ; keep first préserve l’entrée originale.
Comment fonctionne la détection automatique des délimiteurs ?
La première ligne de données est analysée à la recherche de virgules, de points-virgules, de tabulations et de barres verticales, et la plus fréquente l'emporte. Le décompte indique lequel a été utilisé — s’il s’est trompé, forcez le bon avec l’option de délimiteur.
Qu’en est-il des champs entre guillemets contenant des virgules ?
Le fractionnement est délibérément simple, donc un champ entre guillemets avec un délimiteur intégré décale les colonnes de cette ligne. Pour de tels fichiers, normalisez d'abord avec l'outil de délimiteur CSV (par exemple dans les onglets), puis dupliquez ici.
Mes données sont-elles téléchargées quelque part ?
Non. La déduplication s'exécute entièrement dans votre navigateur et vos données ne quittent jamais votre appareil.