Přeskočit na obsah
100% lokálně

Detektor znakové sady

Odhadněte původní kódování za zkomoleným textem a obnovte jej.

Vstup

Detektor znakové sady

Vložte text tam, kde se písmena s diakritikou změnila na řetězce jako „PrĂliš“ nebo „GrĂ¶ĂŸe“ a tento nástroj odhadne, co se pokazilo. Obvyklou příčinou je otevřený, uložený nebo procházející soubor UTF-8 přes něco, co předpokládalo jednobajtovou kódovou stránku – Windows-1250 nebo ISO-8859-2 pro středoevropský text, Windows-1252 pro západoevropský text. Každý znak s diakritikou měl původně dva nebo tři bajty UTF-8; číst jeden bajt po druhém pod špatnou kódovou stránkou, stávají se přesně tímto druhem dvojitého odpadu.

Detektor funguje tak, že zkouší obrácení pro každou kandidátskou kódovou stránku a kontroluje, zda je výsledek správně vytvořený UTF-8 – strukturální test, který správně zakódovaný text v podstatě nikdy neprojde náhodou, a proto může automatická detekce použít opravu se skutečnou důvěrou, spíše než hodem mincí. Když najde shodu, zobrazí uhádnuté původní kódování, uhádnuté chybně přečtené kódování a obnovený text plus počet znaků, které oprava odstranila (mojibake je vždy delší než text, ze kterého pochází, protože každý poškozený znak býval několik).

Automatická detekce pouze hádá ověřitelný směr — UTF-8 zobrazený přes nesprávnou kódovou stránku. Vzácnější obrácený případ, soubor Windows-1250 nebo ISO-8859-2 čtený jako Latin-1, nemá ekvivalentní strukturální kontrolu, takže je nabízen jako manuální možnost v rozevíracím seznamu, když už máte podezření, že se to stalo, spíše než tiše hádat. Toto je heuristický nástroj, nikoli záruka: text směšující několik jazyků nebo obsahující symboly mimo rozsah cílové kódové stránky nemusí být obnovitelný a říká to jasně, místo aby vrátil sebevědomou špatnou odpověď.

Vše běží lokálně ve vašem prohlížeči pomocí stejných kódovacích tabulek, které prohlížeče používají k vykreslování webových stránek – nic, co vložíte, se nikam nenahraje, což je zde důležitější než u většiny nástrojů, protože zkomolený text často pochází ze skutečných záznamů zákazníků, exportovaných databází nebo lístků podpory.

Časté dotazy

Jak ví, které kódování bylo použito?
Znovu zakóduje zkomolený text pod každou kandidátskou kódovou stránkou a zkontroluje, zda výsledné bajty tvoří platné UTF-8. Správně zakódovaný text v podstatě nikdy neprojde touto kontrolou náhodou, takže shoda je spolehlivým znakem toho, co se stalo – ne jistota, ale blízko.
Proč automatická detekce nenabízí opravu „číst jako Latin-1“?
Tento směr nemá žádný ekvivalentní způsob, jak se ověřit – mnoho bajtových hodnot jsou platná písmena ve více než jedné kódové stránce, takže může produkovat věrohodně vypadající, ale nesprávný text. Vyberte jej ručně z rozbalovací nabídky, když už víte, že je to situace.
Dokáže opravit text pomocí emotikonů nebo smíšených jazyků?
Pouze pokud každý znak v textu patří do kandidátní kódové stránky. Jediný emotikon nebo znak mimo tento rozsah znamená, že celý řádek nelze obrátit a nástroj jej ponechá beze změny, místo aby hádal.
Je to zaručeně správné?
Ne – je to heuristika, nikoli certifikovaný převodník. Je velmi spolehlivý při rozpoznání pravého UTF-8-as-legacy-codepage mojibake a řekne jasně, když nemůže najít bezpečnou opravu, místo aby vrátil sebevědomou špatnou odpověď.
Je můj text někde nahrán?
Ne. Detekce i obnova běží zcela ve vašem prohlížeči pomocí stejných kódovacích tabulek, které se již dodává pro vykreslování webových stránek – text nikdy neopustí vaše zařízení.