Teckenuppsättningsdetektor
Gissa den ursprungliga kodningen bakom förvrängd text och återställ den.
Teckenuppsättningsdetektor
Klistra in text där bokstäver med accent har förvandlats till strängar som "PrĂliš" eller "GrĂ¶ĂŸe" och det här verktyget gissar vad som gick fel. Den vanliga orsaken är en UTF-8-fil som öppnas, sparas eller leds genom något som antog en enkelbyte-kodsida - Windows-1250 eller ISO-8859-2 för centraleuropeisk text, Windows-1252 för västeuropeisk text. Varje tecken med accent var ursprungligen två eller tre UTF-8-byte; läser en byte i taget under fel teckentabell, blir de exakt den här typen av dubbelt skräp.
Detektorn fungerar genom att pröva omkastningen för varje kandidatkodtabell och kontrollera om resultatet är välformaterad UTF-8 - ett strukturellt test som korrekt kodad text i princip aldrig passerar av misstag, vilket är anledningen till att autodetektering kan tillämpa en fix med verkligt självförtroende snarare än en myntvändning. När den hittar en matchning visar den den gissade originalkodningen, den gissade fellästa kodningen och den återställda texten, plus hur många tecken fixeringen tog bort (mojibake är alltid längre än texten den kom från, eftersom varje brutet tecken brukade vara flera).
Auto-detect gissar bara den verifierbara riktningen - UTF-8 visas med fel teckentabell. Det mer sällsynta omvända fallet, en Windows-1250- eller ISO-8859-2-fil som läses som Latin-1, har ingen motsvarande strukturkontroll, så den erbjuds som ett manuellt alternativ i rullgardinsmenyn för när du redan misstänker att det är vad som hände, snarare än att gissade tyst. Det här är ett heuristiskt verktyg, inte en garanti: text som blandar flera språk eller innehåller symboler utanför målkodsidans intervall kanske inte går att återställa, och det säger så tydligt istället för att ge ett säkert fel svar.
Allt körs lokalt i din webbläsare med samma kodningstabeller som webbläsare använder för att rendera webbsidor - inget du klistrar in laddas upp någonstans, vilket är viktigare här än de flesta verktyg, eftersom förvrängd text ofta kommer från riktiga kundregister, exporterade databaser eller supportärenden.