Ga naar inhoud
100% lokaal

Tekenset-detector

Raad de originele codering achter de verminkte tekst en herstel deze.

Invoer
Uitvoer

Tekenset-detector

Plak tekst waar letters met accenten zijn veranderd in tekenreeksen zoals "PrĂliš" of "GrĂ¶ĂŸe", waarna deze tool raadt wat er mis is gegaan. De gebruikelijke oorzaak is een UTF-8-bestand dat is geopend, opgeslagen of doorgestuurd naar iets dat uitging van een codepagina van één byte: Windows-1250 of ISO-8859-2 voor Centraal-Europese tekst, Windows-1252 voor West-Europese tekst. Elk teken met accenten bestond oorspronkelijk uit twee of drie UTF-8-bytes; lees één byte tegelijk onder de verkeerde codepagina, ze worden precies dit soort dubbele rommel.

De detector werkt door voor elke kandidaat-codepagina de omkering uit te proberen en te controleren of het resultaat goed opgemaakte UTF-8 is – een structurele test die correct gecodeerde tekst in wezen nooit per ongeluk passeert. Daarom kan autodetectie met echt vertrouwen een oplossing toepassen in plaats van een muntje. Wanneer het een overeenkomst vindt, worden de geraden originele codering, de geraden verkeerd gelezen codering en de herstelde tekst weergegeven, plus hoeveel tekens de fix heeft verwijderd (mojibake is altijd langer dan de tekst waar het vandaan kwam, aangezien elk gebroken teken er meerdere was).

Automatische detectie raadt alleen de verifieerbare richting: UTF-8 weergegeven via de verkeerde codepagina. Het zeldzamere omgekeerde geval, een Windows-1250- of ISO-8859-2-bestand gelezen als Latin-1, heeft geen gelijkwaardige structurele controle, dus wordt het aangeboden als een handmatige optie in de vervolgkeuzelijst voor als u al vermoedt dat dit is gebeurd, in plaats van in stilte te raden. Dit is een heuristisch hulpmiddel, geen garantie: tekst die verschillende talen vermengt of symbolen bevat die buiten het bereik van de doelcodepagina vallen, kan mogelijk niet worden hersteld, en dat wordt ook duidelijk gezegd in plaats van een zelfverzekerd verkeerd antwoord terug te geven.

Alles draait lokaal in uw browser en gebruikt dezelfde coderingstabellen die browsers gebruiken om webpagina's weer te geven. Niets dat u plakt, wordt ergens geüpload, wat hier belangrijker is dan bij de meeste tools, omdat onleesbare tekst vaak afkomstig is van echte klantrecords, geëxporteerde databases of ondersteuningstickets.

FAQ

Hoe weet het welke codering is gebruikt?
Het codeert de verminkte tekst onder elke kandidaat-codepagina opnieuw en controleert of de resulterende bytes geldige UTF-8 vormen. Correct gecodeerde tekst passeert in principe nooit toevallig die controle, dus een match is een betrouwbaar teken van wat er is gebeurd - geen zekerheid, maar dichtbij.
Waarom biedt autodetectie niet aan om "lezen als Latin-1" te corrigeren?
Die richting heeft geen gelijkwaardige manier om zichzelf te verifiëren; veel bytewaarden zijn geldige letters in meer dan één codepagina, dus het kan plausibel ogende maar verkeerde tekst produceren. Kies het handmatig uit de vervolgkeuzelijst als u al weet dat dit de situatie is.
Kan het tekst repareren met emoji of gemengde talen?
Alleen als elk teken in de tekst tot de kandidaat-codepagina behoort. Een enkele emoji of een teken buiten dat bereik betekent dat de hele regel niet kan worden teruggedraaid, en de tool laat deze ongewijzigd in plaats van te raden.
Is dit gegarandeerd juist?
Nee – het is een heuristische, geen gecertificeerde converter. Het is zeer betrouwbaar in het herkennen van echte UTF-8-als-legacy-codepagina mojibake en zal duidelijk zeggen wanneer het geen veilige oplossing kan vinden, in plaats van een zelfverzekerd verkeerd antwoord te geven.
Wordt mijn tekst ergens geüpload?
Nee. Detectie en herstel worden beide volledig in uw browser uitgevoerd en gebruiken dezelfde coderingstabellen die al worden geleverd voor het weergeven van webpagina's: de tekst verlaat nooit uw apparaat.