Aller au contenu
Tout en local

Détecteur de jeu de caractères

Devinez l’encodage original derrière le texte tronqué et récupérez-le.

Entrée

Détecteur de jeu de caractères

Collez le texte là où les lettres accentuées se sont transformées en chaînes comme « Préli » ou « Grève » et cet outil devine ce qui n'a pas fonctionné. La cause habituelle est un fichier UTF-8 ouvert, enregistré ou transmis via quelque chose qui supposait une page de codes à un octet : Windows-1250 ou ISO-8859-2 pour le texte d'Europe centrale, Windows-1252 pour le texte d'Europe occidentale. Chaque caractère accentué était à l'origine composé de deux ou trois octets UTF-8 ; lisez un octet à la fois sous la mauvaise page de codes, ils deviennent exactement ce genre de double déchet.

Le détecteur fonctionne en essayant l'inversion pour chaque page de codes candidate et en vérifiant si le résultat est UTF-8 bien formé - un test structurel qui ne réussit pratiquement jamais par accident, c'est pourquoi la détection automatique peut appliquer un correctif avec une réelle confiance plutôt qu'un tirage au sort. Lorsqu'il trouve une correspondance, il affiche l'encodage d'origine deviné, l'encodage mal lu et le texte récupéré, ainsi que le nombre de caractères supprimés par le correctif (mojibake est toujours plus long que le texte d'où il provient, car chaque caractère brisé en comptait plusieurs).

La détection automatique devine seulement la direction vérifiable – UTF-8 affiché via la mauvaise page de codes. Le cas inverse, plus rare, un fichier Windows-1250 ou ISO-8859-2 lu comme Latin-1, n'a pas de vérification équivalente, il est donc proposé comme option manuelle dans la liste déroulante quand vous le soupçonnez déjà, plutôt que deviné en silence. C'est un outil heuristique, pas une garantie : un texte mélangeant plusieurs langues ou des symboles hors de la page de codes cible peut ne pas être récupérable, et il l'indique clairement plutôt que de renvoyer une mauvaise réponse avec assurance.

Tout s'exécute localement dans votre navigateur en utilisant les mêmes tables d'encodage que les navigateurs utilisent pour afficher les pages Web : rien de ce que vous collez n'est téléchargé nulle part, ce qui compte ici plus que la plupart des outils, car le texte tronqué provient souvent de véritables enregistrements de clients, de bases de données exportées ou de tickets d'assistance.

FAQ

Comment sait-il quel encodage a été utilisé ?
Il réencode le texte tronqué sous chaque page de codes candidate et vérifie si les octets résultants forment un UTF-8 valide. Un texte correctement codé ne réussit jamais ce contrôle par hasard, donc une correspondance est un signe fiable de ce qui s'est passé - pas une certitude, mais une proximité.
Pourquoi la détection automatique ne propose-t-elle pas de corriger « lire en Latin-1 » ?
Cette direction n'a pas de moyen équivalent de se vérifier : de nombreuses valeurs d'octets sont des lettres valides dans plusieurs pages de codes, elles peuvent donc produire un texte plausible mais erroné. Choisissez-le manuellement dans la liste déroulante lorsque vous savez déjà quelle est la situation.
Peut-il corriger le texte avec des emoji ou des langues mixtes ?
Uniquement si chaque caractère du texte appartient à la page de codes candidate. Un seul emoji ou un caractère en dehors de cette plage signifie que la ligne entière ne peut pas être inversée et l'outil la laisse inchangée plutôt que de la deviner.
Est-ce que c'est garanti que c'est exact ?
Non, il s'agit d'une heuristique, pas d'un convertisseur certifié. Il est très fiable pour reconnaître le véritable mojibake UTF-8-as-legacy-codepage et dira clairement quand il ne peut pas trouver une solution sûre, plutôt que de renvoyer une mauvaise réponse confiante.
Mon texte est-il téléchargé quelque part ?
Non. La détection et la récupération s'exécutent toutes deux entièrement dans votre navigateur en utilisant les mêmes tables de codage que celles déjà fournies pour le rendu des pages Web : le texte ne quitte jamais votre appareil.