Zeichensatzdetektor
Erraten Sie die ursprüngliche Kodierung hinter verstümmeltem Text und stellen Sie sie wieder her.
Zeichensatzdetektor
Fügen Sie Text dort ein, wo Buchstaben mit Akzent in Zeichenfolgen wie „PrĂ¶ĂŸe“ oder „GrĂ¶ĂŸe“ umgewandelt wurden, und dieses Tool errät, was schief gelaufen ist. Die übliche Ursache ist eine geöffnete, gespeicherte oder weitergeleitete UTF-8-Datei, die eine Einzelbyte-Codepage annimmt – Windows-1250 oder ISO-8859-2 für mitteleuropäischen Text, Windows-1252 für westeuropäischen Text. Jedes Zeichen mit Akzent bestand ursprünglich aus zwei oder drei UTF-8-Bytes; Wenn Sie ein Byte nach dem anderen unter der falschen Codepage lesen, werden sie zu genau dieser Art von doppeltem Müll.
Der Detektor versucht die Umkehrung für jede in Frage kommende Codepage und prüft, ob das Ergebnis wohlgeformtes UTF-8 ist – ein Strukturtest, bei dem korrekt codierter Text praktisch nie zufällig besteht, weshalb die automatische Erkennung mit echter Sicherheit einen Fix anwenden kann, anstatt einen Münzwurf. Wenn eine Übereinstimmung gefunden wird, werden die vermutete ursprüngliche Kodierung, die vermutete falsch gelesene Kodierung und der wiederhergestellte Text sowie die Anzahl der durch die Korrektur entfernten Zeichen angezeigt (Mojibake ist immer länger als der Text, aus dem es stammt, da es früher mehrere gebrochene Zeichen gab).
Die automatische Erkennung errät nur die überprüfbare Richtung – UTF-8 wird durch die falsche Codepage angezeigt. Für den selteneren umgekehrten Fall, eine Windows-1250- oder ISO-8859-2-Datei, die als Latin-1 gelesen wird, gibt es keine entsprechende Strukturprüfung. Daher wird sie als manuelle Option im Dropdown-Menü angeboten, wenn Sie bereits vermuten, dass dies passiert ist, anstatt stillschweigend zu vermuten. Dies ist ein heuristisches Tool, keine Garantie: Text, der mehrere Sprachen vermischt oder Symbole außerhalb des Bereichs der Zielcodepage enthält, kann möglicherweise nicht wiederhergestellt werden, und das wird deutlich gesagt, anstatt eine sichere falsche Antwort zurückzugeben.
Alles läuft lokal in Ihrem Browser und verwendet dieselben Codierungstabellen, die Browser zum Rendern von Webseiten verwenden – nichts, was Sie einfügen, wird irgendwo hochgeladen, was hier wichtiger ist als bei den meisten Tools, da verstümmelter Text oft aus echten Kundendatensätzen, exportierten Datenbanken oder Support-Tickets stammt.