Detector de set de caractere
Ghiciți codificarea originală din spatele textului deformat și recuperați-o.
Detector de set de caractere
Lipiți text în care literele accentuate s-au transformat în șiruri precum „PrĂliš” sau „GrĂ¶ĂŸe”, iar acest instrument ghicește ce a mers prost. Cauza obișnuită este un fișier UTF-8 deschis, salvat sau transmis prin intermediul unui element care presupunea o pagină de cod de un singur octet - Windows-1250 sau ISO-8859-2 pentru textul Europei Centrale, Windows-1252 pentru textul Europei de Vest. Fiecare caracter accentuat era inițial doi sau trei octeți UTF-8; citiți câte un octet sub pagina de cod greșită, devin exact acest tip de gunoi dublu.
Detectorul funcționează încercând inversarea fiecărei pagini de cod candidat și verificând dacă rezultatul este bine format UTF-8 - un test structural care, în esență, textul codificat corect nu trece niciodată din întâmplare, motiv pentru care detectarea automată poate aplica o remediere cu încredere reală, mai degrabă decât o aruncare a monedei. Când găsește o potrivire, arată codarea originală ghicită, codificarea citită greșit ghicit și textul recuperat, plus câte caractere a eliminat corecția (mojibake este întotdeauna mai lung decât textul din care provine, deoarece fiecare caracter rupt era mai multe).
Detectarea automată ghicește doar direcția verificabilă - UTF-8 afișat prin pagina de cod greșită. Cazul invers mai rar, un fișier Windows-1250 sau ISO-8859-2 citit ca Latin-1, nu are o verificare structurală echivalentă, așa că este oferit ca o opțiune manuală în meniul derulant pentru atunci când bănuiți deja că asta sa întâmplat, mai degrabă decât să ghiciți în tăcere. Acesta este un instrument euristic, nu o garanție: textul care amestecă mai multe limbi sau care conține simboluri în afara intervalului paginii de cod țintă ar putea să nu poată fi recuperat și spune acest lucru clar în loc să returneze un răspuns greșit sigur.
Totul rulează local în browser-ul dvs. folosind aceleași tabele de codare pe care browserele le folosesc pentru a reda paginile web - nimic din ceea ce lipiți nu este încărcat oriunde, ceea ce contează aici mai mult decât majoritatea instrumentelor, deoarece textul deranjat provine adesea din înregistrările clienților reali, bazele de date exportate sau biletele de asistență.