Distance de Levenshtein
Mesurez la distance d'édition entre deux chaînes, plus un pourcentage de similarité.
Distance de Levenshtein
La distance de Levenshtein est le plus petit nombre de modifications d'un seul caractère (insertions, suppressions et substitutions) nécessaires pour transformer une chaîne en une autre. Collez une chaîne de chaque côté et cet outil indique cette distance, ainsi qu'un rapport de similarité normalisé calculé comme (longueur la plus longue moins la distance) divisé par la longueur la plus longue : 100 % signifie que les deux chaînes sont identiques et le pourcentage diminue à mesure qu'elles divergent.
La distance d'édition est la mesure derrière les correcteurs orthographiques, la recherche floue, la déduplication et la comparaison des séquences d'ADN. Il répond "à quelle distance se trouvent ces deux valeurs" d'une manière qu'une simple vérification d'égalité ne peut pas faire - "chaton" et "assis" diffèrent de 3 modifications, ce qui est bien plus proche que deux mots sans rapport. Comparer les noms de produits, les SKU, les titres ou les courtes entrées utilisateur pour les quasi-doublons est exactement ce pour quoi il est conçu.
Trois options permettent d'affiner la comparaison. Ignorer la casse traite « Bonjour » et « Bonjour » comme égaux. Coupez les bandes d’espaces de début et de fin de chaque côté avant de comparer. Comparer par vous permet de passer des caractères aux mots : le mode mot mesure le nombre de mots entiers qui doivent changer, ce qui est la bonne unité pour comparer des phrases plutôt que des jetons. Les entrées très longues sont traitées en toute sécurité : étant donné que le calcul augmente avec le produit des deux longueurs, les paires extrêmement grandes renvoient un bref avis au lieu de geler l'onglet.
Tout s'exécute localement dans votre navigateur. Les deux chaînes ne sont jamais téléchargées, donc la comparaison de noms confidentiels, de clés ou de textes non publiés est totalement privée.