Rilevatore di caratteri
Indovina la codifica originale dietro il testo confuso e recuperala.
Rilevatore di caratteri
Incolla il testo in cui le lettere accentate si sono trasformate in stringhe come "PrĂliš" o "GrĂ¶ĂŸe" e questo strumento indovina cosa è andato storto. La causa più comune è un file UTF-8 aperto, salvato o inviato tramite qualcosa che presupponeva una tabella codici a byte singolo: Windows-1250 o ISO-8859-2 per il testo dell'Europa centrale, Windows-1252 per il testo dell'Europa occidentale. Ogni carattere accentato era originariamente due o tre byte UTF-8; letti un byte alla volta nella code page sbagliata, diventano esattamente questo tipo di doppia spazzatura.
Il rilevatore funziona provando l'inversione per ciascuna code page candidata e controllando se il risultato è UTF-8 ben formato: un test strutturale che il testo codificato correttamente essenzialmente non passa mai per sbaglio, motivo per cui il rilevamento automatico può applicare una correzione con reale sicurezza anziché lanciare una moneta. Quando trova una corrispondenza mostra la codifica originale indovinata, la codifica interpretata erroneamente e il testo recuperato, oltre al numero di caratteri rimossi dalla correzione (mojibake è sempre più lungo del testo da cui proviene, poiché ogni carattere danneggiato era diverso).
Il rilevamento automatico indovina solo la direzione verificabile: UTF-8 mostrato attraverso la code page errata. Il caso inverso più raro, un file Windows-1250 o ISO-8859-2 letto come Latin-1, non ha un controllo strutturale equivalente, quindi viene offerto come opzione manuale nel menu a discesa per quando sospetti già che sia quello che è successo, piuttosto che indovinato in silenzio. Questo è uno strumento euristico, non una garanzia: il testo che mescola diverse lingue o contiene simboli al di fuori dell'intervallo della tabella codici di destinazione potrebbe non essere recuperabile, e lo dice chiaramente invece di restituire una risposta sbagliata sicura.
Tutto viene eseguito localmente nel tuo browser utilizzando le stesse tabelle di codifica utilizzate dai browser per eseguire il rendering delle pagine Web: nulla di ciò che incolli viene caricato da nessuna parte, il che conta qui più della maggior parte degli strumenti, poiché il testo confuso spesso proviene da record di clienti reali, database esportati o ticket di supporto.