Детектор кодировки
Угадайте исходную кодировку искаженного текста и восстановите ее.
Детектор кодировки
Вставьте текст, в котором буквы с диакритическими знаками превратились в строки, например «PrĂliš» или «GrĂ¶ĂŸe», и этот инструмент угадает, что пошло не так. Обычной причиной является открытие, сохранение или передача файла UTF-8 через что-то, что предполагает однобайтовую кодовую страницу — Windows-1250 или ISO-8859-2 для текста из Центральной Европы, Windows-1252 для текста из Западной Европы. Каждый символ с акцентом изначально состоял из двух или трех байтов UTF-8; читая по одному байту под неправильной кодовой страницей, они становятся именно таким двойным мусором.
Детектор работает, пробуя перевернуть каждую кодовую страницу-кандидат и проверяя, является ли результат правильно сформированным UTF-8 — структурный тест, который правильно закодированный текст практически никогда не проходит случайно, поэтому автоматическое обнаружение может применить исправление с реальной уверенностью, а не подбрасыванием монеты. Когда он находит совпадение, он показывает предполагаемую исходную кодировку, предполагаемую неправильно прочитанную кодировку и восстановленный текст, а также количество символов, удаленных исправлением (mojibake всегда длиннее текста, из которого он получен, поскольку раньше каждого сломанного символа было несколько).
Автоматическое обнаружение только предполагает проверяемое направление — UTF-8 отображается на неправильной кодовой странице. Более редкий обратный случай, файл Windows-1250 или ISO-8859-2, читаемый как Latin-1, не имеет эквивалентной структурной проверки, поэтому он предлагается в качестве ручного варианта в раскрывающемся списке, когда вы уже подозреваете, что именно это произошло, а не догадываетесь молча. Это эвристический инструмент, а не гарантия: текст, смешанный с несколькими языками или содержащий символы за пределами диапазона целевой кодовой страницы, может оказаться невосстанавливаемым, и он прямо говорит об этом вместо того, чтобы возвращать уверенный неправильный ответ.
Все работает локально в вашем браузере с использованием тех же таблиц кодировки, которые браузеры используют для отображения веб-страниц — ничего, что вы вставляете, никуда не загружается, что здесь важнее, чем большинство инструментов, поскольку искаженный текст часто происходит из реальных записей клиентов, экспортированных баз данных или заявок в службу поддержки.