Sări la conținut
Complet local

Detector de set de caractere

Ghiciți codificarea originală din spatele textului deformat și recuperați-o.

Intrare
Ieșire

Detector de set de caractere

Lipiți text în care literele accentuate s-au transformat în șiruri precum „PrĂliš” sau „GrĂ¶ĂŸe”, iar acest instrument ghicește ce a mers prost. Cauza obișnuită este un fișier UTF-8 deschis, salvat sau transmis prin intermediul unui element care presupunea o pagină de cod de un singur octet - Windows-1250 sau ISO-8859-2 pentru textul Europei Centrale, Windows-1252 pentru textul Europei de Vest. Fiecare caracter accentuat era inițial doi sau trei octeți UTF-8; citiți câte un octet sub pagina de cod greșită, devin exact acest tip de gunoi dublu.

Detectorul funcționează încercând inversarea fiecărei pagini de cod candidat și verificând dacă rezultatul este bine format UTF-8 - un test structural care, în esență, textul codificat corect nu trece niciodată din întâmplare, motiv pentru care detectarea automată poate aplica o remediere cu încredere reală, mai degrabă decât o aruncare a monedei. Când găsește o potrivire, arată codarea originală ghicită, codificarea citită greșit ghicit și textul recuperat, plus câte caractere a eliminat corecția (mojibake este întotdeauna mai lung decât textul din care provine, deoarece fiecare caracter rupt era mai multe).

Detectarea automată ghicește doar direcția verificabilă - UTF-8 afișat prin pagina de cod greșită. Cazul invers mai rar, un fișier Windows-1250 sau ISO-8859-2 citit ca Latin-1, nu are o verificare structurală echivalentă, așa că este oferit ca o opțiune manuală în meniul derulant pentru atunci când bănuiți deja că asta sa întâmplat, mai degrabă decât să ghiciți în tăcere. Acesta este un instrument euristic, nu o garanție: textul care amestecă mai multe limbi sau care conține simboluri în afara intervalului paginii de cod țintă ar putea să nu poată fi recuperat și spune acest lucru clar în loc să returneze un răspuns greșit sigur.

Totul rulează local în browser-ul dvs. folosind aceleași tabele de codare pe care browserele le folosesc pentru a reda paginile web - nimic din ceea ce lipiți nu este încărcat oriunde, ceea ce contează aici mai mult decât majoritatea instrumentelor, deoarece textul deranjat provine adesea din înregistrările clienților reali, bazele de date exportate sau biletele de asistență.

FAQ

De unde știe care codificare a fost folosită?
Re-codifică textul deformat sub fiecare pagină de cod candidat și verifică dacă octeții rezultați formează UTF-8 valid. Textul codificat corect nu trece niciodată de verificarea întâmplătoare, așa că o potrivire este un semn de încredere al ceea ce s-a întâmplat - nu o certitudine, ci aproape.
De ce detectarea automată nu oferă remedierea „citește ca Latin-1”?
Această direcție nu are o modalitate echivalentă de a se verifica - multe valori ale octeților sunt litere valide în mai mult de o pagină de cod, astfel încât poate produce text cu aspect plauzibil, dar greșit. Alegeți-l manual din meniul drop-down când știți deja că aceasta este situația.
Poate remedia textul cu emoji sau limbi mixte?
Doar dacă fiecare caracter din text aparține paginii de cod candidat. Un singur emoji sau un caracter în afara acestui interval înseamnă că întreaga linie nu poate fi inversată, iar instrumentul o lasă neschimbată în loc să ghicească.
Este garantat că este corect?
Nu - este o euristică, nu un convertor certificat. Este foarte fiabil în recunoașterea mojibake-ului autentic UTF-8-as-legacy-codepage și va spune clar când nu poate găsi o soluție sigură, mai degrabă decât să returneze un răspuns greșit sigur.
Textul meu este încărcat undeva?
Nu. Detectarea și recuperarea rulează ambele în întregime în browser, folosind aceleași tabele de codare pe care le livră deja pentru redarea paginilor web - textul nu părăsește niciodată dispozitivul dvs.