Aller au contenu
Tout en local

Distance de Levenshtein

Mesurez la distance d'édition entre deux chaînes, plus un pourcentage de similarité.

Entrée
Comparez avec
Sortie

Distance de Levenshtein

La distance de Levenshtein est le plus petit nombre de modifications d'un seul caractère (insertions, suppressions et substitutions) nécessaires pour transformer une chaîne en une autre. Collez une chaîne de chaque côté et cet outil indique cette distance, ainsi qu'un rapport de similarité normalisé calculé comme (longueur la plus longue moins la distance) divisé par la longueur la plus longue : 100 % signifie que les deux chaînes sont identiques et le pourcentage diminue à mesure qu'elles divergent.

La distance d'édition est la mesure derrière les correcteurs orthographiques, la recherche floue, la déduplication et la comparaison des séquences d'ADN. Il répond "à quelle distance se trouvent ces deux valeurs" d'une manière qu'une simple vérification d'égalité ne peut pas faire - "chaton" et "assis" diffèrent de 3 modifications, ce qui est bien plus proche que deux mots sans rapport. Comparer les noms de produits, les SKU, les titres ou les courtes entrées utilisateur pour les quasi-doublons est exactement ce pour quoi il est conçu.

Trois options permettent d'affiner la comparaison. Ignorer la casse traite « Bonjour » et « Bonjour » comme égaux. Coupez les bandes d’espaces de début et de fin de chaque côté avant de comparer. Comparer par vous permet de passer des caractères aux mots : le mode mot mesure le nombre de mots entiers qui doivent changer, ce qui est la bonne unité pour comparer des phrases plutôt que des jetons. Les entrées très longues sont traitées en toute sécurité : étant donné que le calcul augmente avec le produit des deux longueurs, les paires extrêmement grandes renvoient un bref avis au lieu de geler l'onglet.

Tout s'exécute localement dans votre navigateur. Les deux chaînes ne sont jamais téléchargées, donc la comparaison de noms confidentiels, de clés ou de textes non publiés est totalement privée.

FAQ

Quelle est la distance de Levenshtein ?
Il s'agit du nombre minimum de modifications d'un seul caractère (insertions, suppressions ou substitutions) nécessaires pour transformer la première chaîne en seconde. Transformer "chaton" en "assis" nécessite 3 modifications, donc la distance est de 3.
Comment est calculé le pourcentage de similarité ?
Il s'agit de la longueur de la chaîne la plus longue moins la distance d'édition, divisée par cette longueur, affichée sous forme de pourcentage. Les chaînes identiques obtiennent un score de 100 % ; deux chaînes complètement différentes de longueur égale obtiennent un score de 0 %.
Quelle est la différence entre comparer par caractères et par mots ?
Le mode Caractère compte les modifications d'un seul caractère, ce qui convient aux chaînes courtes et à la détection des fautes de frappe. Le mode Mot traite chaque mot entier comme une seule unité, il mesure donc le nombre de mots modifiés – ce qui est idéal pour comparer des phrases ou des expressions.
Y a-t-il une limite sur la taille d'entrée ?
Le calcul augmente avec le produit des deux longueurs, donc des paires extrêmement grandes gèleraient l'onglet. Lorsque cette limite est atteinte, l'outil affiche un bref avis vous demandant de raccourcir les entrées plutôt que d'essayer de calculer.
Mon texte est-il téléchargé quelque part ?
Non. La comparaison s'exécute entièrement dans votre navigateur, sans requête réseau, les deux chaînes restent donc sur votre appareil.