Detektor skupa znakova
Pogodite izvorno kodiranje iza iskrivljenog teksta i oporavite ga.
Detektor skupa znakova
Zalijepite tekst gdje su se slova s naglascima pretvorila u nizove poput "PrĂliš" ili "GrĂ¶ĂŸe" i ovaj alat će pogoditi što je pošlo po zlu. Uobičajeni uzrok je UTF-8 datoteka otvorena, spremljena ili proslijeđena kroz nešto što je pretpostavilo jednobajtnu kodnu stranicu — Windows-1250 ili ISO-8859-2 za srednjoeuropski tekst, Windows-1252 za zapadnoeuropski tekst. Svaki znak s naglaskom izvorno je bio dva ili tri UTF-8 bajta; čitati bajt po bajt pod pogrešnom kodnom stranicom, postaju upravo takvo dvostruko smeće.
Detektor radi tako da isprobava preokret za svaku kodnu stranicu kandidata i provjerava je li rezultat dobro oblikovan UTF-8 — strukturni test koji ispravno kodirani tekst zapravo nikad ne prolazi slučajno, zbog čega automatsko otkrivanje može primijeniti popravak sa stvarnim povjerenjem, a ne bacanjem novčića. Kada pronađe podudaranje, prikazuje pretpostavljeno izvorno kodiranje, pretpostavljeno pogrešno pročitano kodiranje i oporavljeni tekst, plus koliko je znakova popravak uklonio (mojibake je uvijek duži od teksta iz kojeg dolazi, budući da je svaki pokvareni znak nekada bio nekoliko).
Automatsko otkrivanje samo pogađa smjer koji se može provjeriti — UTF-8 prikazan kroz pogrešnu kodnu stranicu. Rjeđi obrnuti slučaj, Windows-1250 ili ISO-8859-2 datoteka koja se čita kao Latin-1, nema ekvivalentnu strukturnu provjeru, pa se nudi kao ručna opcija na padajućem izborniku za slučajeve kada već sumnjate da se to dogodilo, umjesto da se tiho nagađa. Ovo je heuristički alat, a ne jamstvo: tekst koji miješa nekoliko jezika ili sadrži simbole izvan raspona ciljne kodne stranice možda se neće moći oporaviti, a to jasno kaže umjesto vraćanja pouzdano pogrešnog odgovora.
Sve se izvodi lokalno u vašem pregledniku koristeći iste tablice kodiranja koje preglednici koriste za prikazivanje web-stranica — ništa što zalijepite nigdje se ne učitava, što je ovdje važnije od većine alata, budući da iskrivljeni tekst često dolazi iz stvarnih korisničkih zapisa, izvezenih baza podataka ili zahtjeva za podršku.