Détecteur de jeu de caractères
Devinez l’encodage original derrière le texte tronqué et récupérez-le.
Détecteur de jeu de caractères
Collez le texte là où les lettres accentuées se sont transformées en chaînes comme « Préli » ou « Grève » et cet outil devine ce qui n'a pas fonctionné. La cause habituelle est un fichier UTF-8 ouvert, enregistré ou transmis via quelque chose qui supposait une page de codes à un octet : Windows-1250 ou ISO-8859-2 pour le texte d'Europe centrale, Windows-1252 pour le texte d'Europe occidentale. Chaque caractère accentué était à l'origine composé de deux ou trois octets UTF-8 ; lisez un octet à la fois sous la mauvaise page de codes, ils deviennent exactement ce genre de double déchet.
Le détecteur fonctionne en essayant l'inversion pour chaque page de codes candidate et en vérifiant si le résultat est UTF-8 bien formé - un test structurel qui ne réussit pratiquement jamais par accident, c'est pourquoi la détection automatique peut appliquer un correctif avec une réelle confiance plutôt qu'un tirage au sort. Lorsqu'il trouve une correspondance, il affiche l'encodage d'origine deviné, l'encodage mal lu et le texte récupéré, ainsi que le nombre de caractères supprimés par le correctif (mojibake est toujours plus long que le texte d'où il provient, car chaque caractère brisé en comptait plusieurs).
La détection automatique devine seulement la direction vérifiable – UTF-8 affiché via la mauvaise page de codes. Le cas inverse, plus rare, un fichier Windows-1250 ou ISO-8859-2 lu comme Latin-1, n'a pas de vérification équivalente, il est donc proposé comme option manuelle dans la liste déroulante quand vous le soupçonnez déjà, plutôt que deviné en silence. C'est un outil heuristique, pas une garantie : un texte mélangeant plusieurs langues ou des symboles hors de la page de codes cible peut ne pas être récupérable, et il l'indique clairement plutôt que de renvoyer une mauvaise réponse avec assurance.
Tout s'exécute localement dans votre navigateur en utilisant les mêmes tables d'encodage que les navigateurs utilisent pour afficher les pages Web : rien de ce que vous collez n'est téléchargé nulle part, ce qui compte ici plus que la plupart des outils, car le texte tronqué provient souvent de véritables enregistrements de clients, de bases de données exportées ou de tickets d'assistance.