Vai al contenuto
100% locale

Rilevatore di caratteri

Indovina la codifica originale dietro il testo confuso e recuperala.

Ingresso

Rilevatore di caratteri

Incolla il testo in cui le lettere accentate si sono trasformate in stringhe come "PrĂliš" o "GrĂ¶ĂŸe" e questo strumento indovina cosa è andato storto. La causa più comune è un file UTF-8 aperto, salvato o inviato tramite qualcosa che presupponeva una tabella codici a byte singolo: Windows-1250 o ISO-8859-2 per il testo dell'Europa centrale, Windows-1252 per il testo dell'Europa occidentale. Ogni carattere accentato era originariamente due o tre byte UTF-8; letti un byte alla volta nella code page sbagliata, diventano esattamente questo tipo di doppia spazzatura.

Il rilevatore funziona provando l'inversione per ciascuna code page candidata e controllando se il risultato è UTF-8 ben formato: un test strutturale che il testo codificato correttamente essenzialmente non passa mai per sbaglio, motivo per cui il rilevamento automatico può applicare una correzione con reale sicurezza anziché lanciare una moneta. Quando trova una corrispondenza mostra la codifica originale indovinata, la codifica interpretata erroneamente e il testo recuperato, oltre al numero di caratteri rimossi dalla correzione (mojibake è sempre più lungo del testo da cui proviene, poiché ogni carattere danneggiato era diverso).

Il rilevamento automatico indovina solo la direzione verificabile: UTF-8 mostrato attraverso la code page errata. Il caso inverso più raro, un file Windows-1250 o ISO-8859-2 letto come Latin-1, non ha un controllo strutturale equivalente, quindi viene offerto come opzione manuale nel menu a discesa per quando sospetti già che sia quello che è successo, piuttosto che indovinato in silenzio. Questo è uno strumento euristico, non una garanzia: il testo che mescola diverse lingue o contiene simboli al di fuori dell'intervallo della tabella codici di destinazione potrebbe non essere recuperabile, e lo dice chiaramente invece di restituire una risposta sbagliata sicura.

Tutto viene eseguito localmente nel tuo browser utilizzando le stesse tabelle di codifica utilizzate dai browser per eseguire il rendering delle pagine Web: nulla di ciò che incolli viene caricato da nessuna parte, il che conta qui più della maggior parte degli strumenti, poiché il testo confuso spesso proviene da record di clienti reali, database esportati o ticket di supporto.

FAQ

Come fa a sapere quale codifica è stata utilizzata?
Ricodifica il testo confuso sotto ciascuna code page candidata e controlla se i byte risultanti formano un UTF-8 valido. Il testo codificato correttamente essenzialmente non supera mai quel controllo per caso, quindi una corrispondenza è un segno affidabile di ciò che è accaduto: non una certezza, ma quasi.
Perché il rilevamento automatico non offre la possibilità di correggere "leggi come Latin-1"?
Questa direzione non ha un modo equivalente per verificare se stessa: molti valori di byte sono lettere valide in più di una tabella codici, quindi può produrre testo dall'aspetto plausibile ma sbagliato. Selezionalo manualmente dal menu a discesa quando sai già che è la situazione.
Può correggere il testo con emoji o lingue miste?
Solo se ogni carattere nel testo appartiene alla codepage candidata. Una singola emoji o un carattere al di fuori di tale intervallo significa che l'intera linea non può essere invertita e lo strumento la lascia invariata anziché indovinarla.
È garantito che sia corretto?
No, è un convertitore euristico, non certificato. È molto affidabile nel riconoscere il vero mojibake UTF-8-as-legacy-codepage e dirà chiaramente quando non riesce a trovare una soluzione sicura, piuttosto che restituire una risposta sbagliata sicura.
Il mio testo è caricato da qualche parte?
No. Sia il rilevamento che il ripristino vengono eseguiti interamente nel tuo browser utilizzando le stesse tabelle di codifica già fornite per il rendering delle pagine web: il testo non lascia mai il tuo dispositivo.