Similitud de texto
Mide qué tan similares son dos textos: porcentaje de similitud, distancia de Levenshtein y superposición de palabras.
Similitud de texto
Pegue dos textos y obtenga un informe de similitud en dos niveles. A nivel de carácter, se ve la distancia de Levenshtein (el número de inserciones, eliminaciones y sustituciones de un solo carácter necesarias para convertir un texto en otro) y un porcentaje de similitud derivado de ella: 100 % significa idéntico, 0 % significa nada en común. A nivel de palabras, el informe muestra la similitud Jaccard de los dos conjuntos de palabras, además de cuántas palabras únicas comparten los textos y cuántas aparecen solo en uno de ellos.
Los dos niveles responden a preguntas diferentes. La similitud de caracteres es adecuada para los casi duplicados: dos versiones de un párrafo, una traducción corregida del original, descripciones de productos copiadas y pegadas y ligeramente editadas. La superposición de palabras es correcta cuando el orden y la redacción difieren, pero el vocabulario debe coincidir: verificar si dos artículos cubren el mismo tema o cuánto cambió realmente una reescritura.
"Ignorar mayúsculas y minúsculas" está activado de forma predeterminada para que "Hola" y "hola" no cuenten como una diferencia; active "Ignorar puntuación" para comparar las palabras solas. Para textos muy largos existe un límite de seguridad: las métricas de caracteres se calculan en los primeros 5.000 caracteres de cada texto (el informe lo dice cuando sucede), porque el cálculo de la distancia de edición crece con el producto de ambas longitudes. Las métricas de Word siempre utilizan los textos completos.
Ambos textos se comparan íntegramente en su navegador: no se carga nada, por lo que los contratos, manuscritos y copias no publicadas están seguros aquí.