Preskoči na sadržaj
100% lokalno

Detektor skupa znakova

Pogodite izvorno kodiranje iza iskrivljenog teksta i oporavite ga.

Unos

Detektor skupa znakova

Zalijepite tekst gdje su se slova s naglascima pretvorila u nizove poput "PrĂliš" ili "GrĂ¶ĂŸe" i ovaj alat će pogoditi što je pošlo po zlu. Uobičajeni uzrok je UTF-8 datoteka otvorena, spremljena ili proslijeđena kroz nešto što je pretpostavilo jednobajtnu kodnu stranicu — Windows-1250 ili ISO-8859-2 za srednjoeuropski tekst, Windows-1252 za zapadnoeuropski tekst. Svaki znak s naglaskom izvorno je bio dva ili tri UTF-8 bajta; čitati bajt po bajt pod pogrešnom kodnom stranicom, postaju upravo takvo dvostruko smeće.

Detektor radi tako da isprobava preokret za svaku kodnu stranicu kandidata i provjerava je li rezultat dobro oblikovan UTF-8 — strukturni test koji ispravno kodirani tekst zapravo nikad ne prolazi slučajno, zbog čega automatsko otkrivanje može primijeniti popravak sa stvarnim povjerenjem, a ne bacanjem novčića. Kada pronađe podudaranje, prikazuje pretpostavljeno izvorno kodiranje, pretpostavljeno pogrešno pročitano kodiranje i oporavljeni tekst, plus koliko je znakova popravak uklonio (mojibake je uvijek duži od teksta iz kojeg dolazi, budući da je svaki pokvareni znak nekada bio nekoliko).

Automatsko otkrivanje samo pogađa smjer koji se može provjeriti — UTF-8 prikazan kroz pogrešnu kodnu stranicu. Rjeđi obrnuti slučaj, Windows-1250 ili ISO-8859-2 datoteka koja se čita kao Latin-1, nema ekvivalentnu strukturnu provjeru, pa se nudi kao ručna opcija na padajućem izborniku za slučajeve kada već sumnjate da se to dogodilo, umjesto da se tiho nagađa. Ovo je heuristički alat, a ne jamstvo: tekst koji miješa nekoliko jezika ili sadrži simbole izvan raspona ciljne kodne stranice možda se neće moći oporaviti, a to jasno kaže umjesto vraćanja pouzdano pogrešnog odgovora.

Sve se izvodi lokalno u vašem pregledniku koristeći iste tablice kodiranja koje preglednici koriste za prikazivanje web-stranica — ništa što zalijepite nigdje se ne učitava, što je ovdje važnije od većine alata, budući da iskrivljeni tekst često dolazi iz stvarnih korisničkih zapisa, izvezenih baza podataka ili zahtjeva za podršku.

FAQ

Kako zna koje je kodiranje korišteno?
Ponovno kodira iskrivljeni tekst ispod svake kodne stranice kandidata i provjerava da li rezultirajući bajtovi čine valjani UTF-8. Ispravno kodirani tekst u biti nikada slučajno ne prolazi tu provjeru, tako da je podudaranje pouzdan znak onoga što se dogodilo — ne siguran, ali blizak.
Zašto automatsko otkrivanje ne nudi popravak "čitaj kao Latin-1"?
Taj smjer nema ekvivalentan način da se potvrdi - mnoge vrijednosti bajtova su valjana slova u više od jedne kodne stranice, tako da može proizvesti uvjerljiv, ali pogrešan tekst. Odaberite ga ručno s padajućeg izbornika kada već znate da je to situacija.
Može li popraviti tekst s emotikonima ili miješanim jezicima?
Samo ako svaki znak u tekstu pripada kodnoj stranici kandidata. Jedan emoji ili znak izvan tog raspona znači da se cijeli redak ne može obrnuti, a alat ga ostavlja nepromijenjenim umjesto da pogađa.
Je li ovo zajamčeno točno?
Ne — to je heuristika, a ne certificirani pretvarač. Vrlo je pouzdan u prepoznavanju originalnog mojibakea UTF-8-as-legacy-codepage i jasno će reći kada ne može pronaći siguran popravak, radije nego vratiti pouzdano pogrešan odgovor.
Je li moj tekst negdje uploadan?
Ne. I otkrivanje i oporavak izvode se u cijelosti u vašem pregledniku koristeći iste tablice kodiranja koje već isporučuje za prikazivanje web stranica — tekst nikada ne napušta vaš uređaj.