Similitude du texte
Mesurez la similitude de deux textes : pourcentage de similarité, distance de Levenshtein et chevauchement de mots.
Similitude du texte
Collez deux textes et obtenez un rapport de similarité à deux niveaux. Au niveau des caractères, vous voyez la distance de Levenshtein — le nombre d'insertions, de suppressions et de substitutions d'un seul caractère nécessaires pour transformer un texte en un autre — et un pourcentage de similarité qui en dérive : 100 % signifie identique, 0 % signifie rien en commun. Au niveau des mots, le rapport montre la similitude Jaccard des deux ensembles de mots, ainsi que le nombre de mots uniques que les textes partagent et combien n'apparaissent que dans l'un d'entre eux.
Les deux niveaux répondent à des questions différentes. La similarité des caractères est bonne pour les quasi-doublons : deux versions d'un paragraphe, une traduction corrigée par rapport à l'original, des descriptions de produits copiées et légèrement modifiées. Le chevauchement des mots est correct lorsque l'ordre et la formulation diffèrent, mais le vocabulaire doit correspondre – en vérifiant si deux articles couvrent le même sujet ou dans quelle mesure une réécriture a réellement changé.
« Ignorer la casse » est activé par défaut afin que « Bonjour » et « bonjour » ne comptent pas comme une différence ; activez « Ignorer la ponctuation » pour comparer les mots seuls. Pour les textes très longs, il existe une limite de sécurité : les mesures de caractères sont calculées sur les 5 000 premiers caractères de chaque texte (le rapport l'indique lorsque cela se produit), car le calcul de la distance d'édition augmente avec le produit des deux longueurs. Les métriques Word utilisent toujours les textes intégraux.
Les deux textes sont entièrement comparés dans votre navigateur : rien n’est téléchargé, les contrats, manuscrits et copies non publiées sont donc en sécurité ici.