Aller au contenu
TextArray
Tout en local

Similitude du texte

Mesurez la similitude de deux textes : pourcentage de similarité, distance de Levenshtein et chevauchement de mots.

Entrée
Deuxième texte
Sortie

Similitude du texte

Collez deux textes et obtenez un rapport de similarité à deux niveaux. Au niveau des caractères, vous voyez la distance de Levenshtein — le nombre d'insertions, de suppressions et de substitutions d'un seul caractère nécessaires pour transformer un texte en un autre — et un pourcentage de similarité qui en dérive : 100 % signifie identique, 0 % signifie rien en commun. Au niveau des mots, le rapport montre la similitude Jaccard des deux ensembles de mots, ainsi que le nombre de mots uniques que les textes partagent et combien n'apparaissent que dans l'un d'entre eux.

Les deux niveaux répondent à des questions différentes. La similarité des caractères est bonne pour les quasi-doublons : deux versions d'un paragraphe, une traduction corrigée par rapport à l'original, des descriptions de produits copiées et légèrement modifiées. Le chevauchement des mots est correct lorsque l'ordre et la formulation diffèrent, mais le vocabulaire doit correspondre – en vérifiant si deux articles couvrent le même sujet ou dans quelle mesure une réécriture a réellement changé.

« Ignorer la casse » est activé par défaut afin que « Bonjour » et « bonjour » ne comptent pas comme une différence ; activez « Ignorer la ponctuation » pour comparer les mots seuls. Pour les textes très longs, il existe une limite de sécurité : les mesures de caractères sont calculées sur les 5 000 premiers caractères de chaque texte (le rapport l'indique lorsque cela se produit), car le calcul de la distance d'édition augmente avec le produit des deux longueurs. Les métriques Word utilisent toujours les textes intégraux.

Les deux textes sont entièrement comparés dans votre navigateur : rien n’est téléchargé, les contrats, manuscrits et copies non publiées sont donc en sécurité ici.

FAQ

Comment est calculé le pourcentage de similarité ?
C'est 1 moins la distance de Levenshtein divisée par la longueur du texte le plus long, exprimée en pourcentage. Les textes identiques obtiennent 100 % ; les textes sans caractères communs obtiennent un score de 0 %.
Quelle est la distance de Levenshtein ?
Le nombre minimum de modifications d'un seul caractère (insertions, suppressions ou substitutions) nécessaires pour transformer le premier texte en second. "chaton" à "assis" nécessite 3 modifications.
Que signifie le mot Jaccard chevauchement ?
Les mots uniques partagés par les deux textes divisés par tous les mots uniques qui les traversent. Il ignore l'ordre des mots et la répétition, et mesure donc le vocabulaire partagé plutôt que la formulation partagée.
Y a-t-il une limite de longueur ?
Les mesures de caractères utilisent les 5 000 premiers caractères de chaque texte. Au-delà, le calcul de la distance d'édition gèlerait l'onglet et le rapport note la troncature. Les métriques Word utilisent toujours les textes intégraux.
Mon texte est-il téléchargé quelque part ?
Non. Les deux textes sont entièrement comparés dans votre navigateur et ne quittent jamais votre appareil.