distancia de Levenshtein
Mida la distancia de edición entre dos cadenas, más un porcentaje de similitud.
distancia de Levenshtein
La distancia de Levenshtein es el número más pequeño de ediciones de un solo carácter (inserciones, eliminaciones y sustituciones) necesarias para convertir una cadena en otra. Pegue una cadena en cada lado y esta herramienta informará esa distancia, junto con una relación de similitud normalizada calculada como (longitud más larga menos distancia) dividida por la longitud más larga: 100% significa que las dos cadenas son idénticas y el porcentaje cae a medida que divergen.
La distancia de edición es la métrica detrás de los correctores ortográficos, la búsqueda difusa, la deduplicación y la comparación de secuencias de ADN. Responde "qué tan separados están estos dos valores" de una manera que una simple verificación de igualdad no puede: "gatito" y "sentado" difieren en 3 ediciones, lo cual está mucho más cerca que dos palabras no relacionadas. Comparar nombres de productos, SKU, encabezados o entradas breves del usuario para encontrar casi duplicados es exactamente para lo que está diseñado.
Tres opciones afinan la comparación. Ignorar mayúsculas y minúsculas trata "Hola" y "hola" como iguales. Recorte las tiras de espacios en blanco que van al principio y al final de cada lado antes de comparar. Comparar por le permite cambiar de caracteres a palabras: el modo palabra mide cuántas palabras completas deben cambiar, que es la unidad adecuada para comparar oraciones en lugar de tokens. Las entradas muy largas se manejan de forma segura: debido a que el cálculo crece con el producto de las dos longitudes, los pares extremadamente grandes devuelven un aviso breve en lugar de congelar la pestaña.
Todo se ejecuta localmente en su navegador. Las dos cadenas nunca se cargan, por lo que comparar nombres confidenciales, claves o textos no publicados es completamente privado.