Zum Inhalt springen
100% lokal

Zeichensatzdetektor

Erraten Sie die ursprüngliche Kodierung hinter verstümmeltem Text und stellen Sie sie wieder her.

Eingabe

Zeichensatzdetektor

Fügen Sie Text dort ein, wo Buchstaben mit Akzent in Zeichenfolgen wie „PrĂ¶ĂŸe“ oder „GrĂ¶ĂŸe“ umgewandelt wurden, und dieses Tool errät, was schief gelaufen ist. Die übliche Ursache ist eine geöffnete, gespeicherte oder weitergeleitete UTF-8-Datei, die eine Einzelbyte-Codepage annimmt – Windows-1250 oder ISO-8859-2 für mitteleuropäischen Text, Windows-1252 für westeuropäischen Text. Jedes Zeichen mit Akzent bestand ursprünglich aus zwei oder drei UTF-8-Bytes; Wenn Sie ein Byte nach dem anderen unter der falschen Codepage lesen, werden sie zu genau dieser Art von doppeltem Müll.

Der Detektor versucht die Umkehrung für jede in Frage kommende Codepage und prüft, ob das Ergebnis wohlgeformtes UTF-8 ist – ein Strukturtest, bei dem korrekt codierter Text praktisch nie zufällig besteht, weshalb die automatische Erkennung mit echter Sicherheit einen Fix anwenden kann, anstatt einen Münzwurf. Wenn eine Übereinstimmung gefunden wird, werden die vermutete ursprüngliche Kodierung, die vermutete falsch gelesene Kodierung und der wiederhergestellte Text sowie die Anzahl der durch die Korrektur entfernten Zeichen angezeigt (Mojibake ist immer länger als der Text, aus dem es stammt, da es früher mehrere gebrochene Zeichen gab).

Die automatische Erkennung errät nur die überprüfbare Richtung – UTF-8 wird durch die falsche Codepage angezeigt. Für den selteneren umgekehrten Fall, eine Windows-1250- oder ISO-8859-2-Datei, die als Latin-1 gelesen wird, gibt es keine entsprechende Strukturprüfung. Daher wird sie als manuelle Option im Dropdown-Menü angeboten, wenn Sie bereits vermuten, dass dies passiert ist, anstatt stillschweigend zu vermuten. Dies ist ein heuristisches Tool, keine Garantie: Text, der mehrere Sprachen vermischt oder Symbole außerhalb des Bereichs der Zielcodepage enthält, kann möglicherweise nicht wiederhergestellt werden, und das wird deutlich gesagt, anstatt eine sichere falsche Antwort zurückzugeben.

Alles läuft lokal in Ihrem Browser und verwendet dieselben Codierungstabellen, die Browser zum Rendern von Webseiten verwenden – nichts, was Sie einfügen, wird irgendwo hochgeladen, was hier wichtiger ist als bei den meisten Tools, da verstümmelter Text oft aus echten Kundendatensätzen, exportierten Datenbanken oder Support-Tickets stammt.

Häufige Fragen

Woher weiß es, welche Kodierung verwendet wurde?
Es kodiert den verstümmelten Text unter jeder Kandidaten-Codepage neu und prüft, ob die resultierenden Bytes gültiges UTF-8 bilden. Korrekt codierter Text besteht diese Prüfung grundsätzlich nie zufällig, daher ist eine Übereinstimmung ein zuverlässiges Zeichen dafür, was passiert ist – keine Gewissheit, aber naheliegend.
Warum bietet die automatische Erkennung keine Möglichkeit, „Als Latin-1 lesen“ zu beheben?
Für diese Richtung gibt es keine gleichwertige Möglichkeit, sich selbst zu überprüfen – viele Bytewerte sind gültige Buchstaben in mehr als einer Codepage, sodass plausibel aussehender, aber falscher Text erzeugt werden kann. Wählen Sie es manuell aus der Dropdown-Liste aus, wenn Sie bereits wissen, dass dies der Fall ist.
Kann es Text mit Emojis oder gemischten Sprachen korrigieren?
Nur wenn jedes Zeichen im Text zur Kandidatencodepage gehört. Ein einzelnes Emoji oder ein Zeichen außerhalb dieses Bereichs bedeutet, dass die gesamte Zeile nicht umgekehrt werden kann und das Tool sie unverändert lässt, anstatt zu raten.
Ist das garantiert richtig?
Nein – es handelt sich um eine Heuristik, nicht um einen zertifizierten Konverter. Es ist sehr zuverlässig bei der Erkennung von echtem UTF-8-als-Legacy-Codepage-Mojibake und sagt deutlich, wenn es keine sichere Lösung finden kann, anstatt eine sichere falsche Antwort zurückzugeben.
Wird mein Text irgendwo hochgeladen?
Nein. Die Erkennung und Wiederherstellung erfolgt vollständig in Ihrem Browser und verwendet dieselben Codierungstabellen, die bereits für die Darstellung von Webseiten bereitgestellt werden – der Text verlässt Ihr Gerät nie.