Hoppa till innehåll
100% lokalt

Teckenuppsättningsdetektor

Gissa den ursprungliga kodningen bakom förvrängd text och återställ den.

Inmatning
Utmatning

Teckenuppsättningsdetektor

Klistra in text där bokstäver med accent har förvandlats till strängar som "PrĂliš" eller "GrĂ¶ĂŸe" och det här verktyget gissar vad som gick fel. Den vanliga orsaken är en UTF-8-fil som öppnas, sparas eller leds genom något som antog en enkelbyte-kodsida - Windows-1250 eller ISO-8859-2 för centraleuropeisk text, Windows-1252 för västeuropeisk text. Varje tecken med accent var ursprungligen två eller tre UTF-8-byte; läser en byte i taget under fel teckentabell, blir de exakt den här typen av dubbelt skräp.

Detektorn fungerar genom att pröva omkastningen för varje kandidatkodtabell och kontrollera om resultatet är välformaterad UTF-8 - ett strukturellt test som korrekt kodad text i princip aldrig passerar av misstag, vilket är anledningen till att autodetektering kan tillämpa en fix med verkligt självförtroende snarare än en myntvändning. När den hittar en matchning visar den den gissade originalkodningen, den gissade fellästa kodningen och den återställda texten, plus hur många tecken fixeringen tog bort (mojibake är alltid längre än texten den kom från, eftersom varje brutet tecken brukade vara flera).

Auto-detect gissar bara den verifierbara riktningen - UTF-8 visas med fel teckentabell. Det mer sällsynta omvända fallet, en Windows-1250- eller ISO-8859-2-fil som läses som Latin-1, har ingen motsvarande strukturkontroll, så den erbjuds som ett manuellt alternativ i rullgardinsmenyn för när du redan misstänker att det är vad som hände, snarare än att gissade tyst. Det här är ett heuristiskt verktyg, inte en garanti: text som blandar flera språk eller innehåller symboler utanför målkodsidans intervall kanske inte går att återställa, och det säger så tydligt istället för att ge ett säkert fel svar.

Allt körs lokalt i din webbläsare med samma kodningstabeller som webbläsare använder för att rendera webbsidor - inget du klistrar in laddas upp någonstans, vilket är viktigare här än de flesta verktyg, eftersom förvrängd text ofta kommer från riktiga kundregister, exporterade databaser eller supportärenden.

FAQ

Hur vet den vilken kodning som användes?
Den kodar om den förvrängda texten under varje kandidatkodtabell och kontrollerar om de resulterande byten bildar giltig UTF-8. Korrekt kodad text klarar i princip aldrig kontrollen av en slump, så en matchning är ett tillförlitligt tecken på vad som hände - inte en visshet, men nära.
Varför erbjuder inte auto-detect att fixa "läs som Latin-1"?
Den riktningen har inget likvärdigt sätt att verifiera sig själv - många bytevärden är giltiga bokstäver i mer än en teckentabell, så det kan producera plausibelt utseende men fel text. Välj det manuellt från rullgardinsmenyn när du redan vet att det är situationen.
Kan det fixa text med emoji eller blandade språk?
Endast om varje tecken i texten hör till kandidatens teckentabell. En enda emoji eller ett tecken utanför det intervallet betyder att hela linjen inte kan vändas, och verktyget lämnar den oförändrad snarare än att gissa.
Är detta garanterat korrekt?
Nej – det är en heuristik, inte en certifierad omvandlare. Det är mycket tillförlitligt för att känna igen äkta UTF-8-as-legacy-codepage mojibake och kommer att säga klart och tydligt när det inte kan hitta en säker fix, snarare än att returnera ett säkert fel svar.
Är min text uppladdad någonstans?
Nej. Detektering och återställning körs båda helt i din webbläsare med samma kodningstabeller som den redan levererar för att rendera webbsidor – texten lämnar aldrig din enhet.