Charset detektor
Találja ki az eredeti kódolást az elrontott szöveg mögött, és állítsa vissza.
Charset detektor
Illesszen be olyan szöveget, ahol az ékezetes betűk karakterláncokká alakultak, például „Pröš” vagy „GrĂ¶ĂŸe”, és ez az eszköz kitalálja, hogy mi történt. A szokásos ok egy olyan UTF-8 fájl megnyitása, mentése vagy átvezetése, amely egybájtos kódlapot feltételez – Windows-1250 vagy ISO-8859-2 közép-európai szöveg esetén, Windows-1252 nyugat-európai szöveg esetén. Minden ékezetes karakter eredetileg két vagy három UTF-8 bájt volt; rossz kódlap alatt egy-egy bájtot olvasnak, pontosan ilyen dupla szemétté válnak.
Az érzékelő úgy működik, hogy minden egyes jelölt kódlapnál megpróbálja a visszafordítást, és ellenőrzi, hogy az eredmény jól formázott UTF-8-e – egy szerkezeti teszt, amely a helyesen kódolt szöveget lényegében véletlenül sem megy át, ezért az automatikus észlelés valódi biztonsággal alkalmazhat javítást, nem pedig érmefeldobást. Ha egyezést talál, megmutatja a kitalált eredeti kódolást, a kitalált félreolvasott kódolást és a helyreállított szöveget, valamint azt, hogy hány karaktert távolított el a javítás (a mojibake mindig hosszabb, mint a szöveg, amelyből származik, mivel minden törött karakter több karakterből állt).
Az automatikus észlelés csak kitalálja az ellenőrizhető irányt – az UTF-8 rossz kódlapon keresztül jelenik meg. A ritkább fordított eset, a Latin-1-ként olvasott Windows-1250 vagy ISO-8859-2 fájl nem rendelkezik ezzel egyenértékű szerkezeti ellenőrzéssel, így kézi opcióként kínálja fel a legördülő listában, ha már gyanítja, hogy ez történt, nem pedig csendben. Ez egy heurisztikus eszköz, nem pedig garancia: előfordulhat, hogy a több nyelvet keverő vagy a célkódlap tartományán kívül eső szimbólumokat tartalmazó szöveg nem állítható helyre, és ezt egyértelműen kiírja ahelyett, hogy magabiztos rossz választ adna vissza.
Minden helyileg fut a böngészőben, ugyanazokkal a kódolási táblázatokkal, amelyeket a böngészők használnak a weboldalak megjelenítéséhez – semmi, amit beilleszt, nem kerül fel sehova, ami itt fontosabb, mint a legtöbb eszköz, mivel az elrontott szöveg gyakran valódi ügyfélrekordokból, exportált adatbázisokból vagy támogatási jegyekből származik.