Ir para o conteúdo
Totalmente local

Detector de conjunto de caracteres

Adivinhe a codificação original por trás do texto ilegível e recupere-a.

Entrada

Detector de conjunto de caracteres

Cole o texto onde as letras acentuadas se transformaram em strings como "PrĂliš" ou "GrĂ¶ĂŸe" e esta ferramenta adivinha o que deu errado. A causa comum é um arquivo UTF-8 aberto, salvo ou canalizado através de algo que assume uma página de código de byte único – Windows-1250 ou ISO-8859-2 para texto da Europa Central, Windows-1252 para texto da Europa Ocidental. Cada caractere acentuado tinha originalmente dois ou três bytes UTF-8; ler um byte de cada vez na página de código errada, eles se tornam exatamente esse tipo de lixo duplo.

O detector funciona tentando a reversão para cada página de código candidata e verificando se o resultado é UTF-8 bem formado – um teste estrutural que o texto codificado corretamente essencialmente nunca passa por acidente, e é por isso que a detecção automática pode aplicar uma correção com confiança real, em vez de um cara ou coroa. Quando encontra uma correspondência, ele mostra a codificação original adivinhada, a codificação lida incorretamente e o texto recuperado, além de quantos caracteres a correção removeu (mojibake é sempre maior que o texto de onde veio, já que cada caractere quebrado costumava ser vários).

A detecção automática apenas adivinha a direção verificável – UTF-8 mostrado na página de código errada. O caso reverso mais raro, um arquivo Windows-1250 ou ISO-8859-2 lido como Latin-1, não tem verificação estrutural equivalente, por isso é oferecido como uma opção manual no menu suspenso para quando você já suspeita que foi isso que aconteceu, em vez de adivinhar silenciosamente. Esta é uma ferramenta heurística, não uma garantia: o texto que mistura vários idiomas ou contém símbolos fora do intervalo da página de código de destino pode não ser recuperável e diz isso claramente, em vez de retornar uma resposta errada e confiável.

Tudo é executado localmente no seu navegador, usando as mesmas tabelas de codificação que os navegadores usam para renderizar páginas da web – nada que você cola é carregado em qualquer lugar, o que é mais importante aqui do que a maioria das ferramentas, já que o texto ilegível geralmente vem de registros reais de clientes, bancos de dados exportados ou tickets de suporte.

FAQ

Como ele sabe qual codificação foi usada?
Ele recodifica o texto ilegível em cada página de código candidata e verifica se os bytes resultantes formam UTF-8 válido. O texto codificado corretamente nunca passa nessa verificação por acaso, portanto, uma correspondência é um sinal confiável do que aconteceu – não uma certeza, mas próximo.
Por que a detecção automática não oferece a correção de “ler como Latin-1”?
Essa direção não tem uma maneira equivalente de se verificar — muitos valores de bytes são letras válidas em mais de uma página de código, portanto, pode produzir texto de aparência plausível, mas errado. Escolha-o manualmente no menu suspenso quando você já sabe qual é a situação.
Ele pode corrigir texto com emoji ou idiomas mistos?
Somente se todos os caracteres do texto pertencerem à página de códigos candidata. Um único emoji ou caractere fora desse intervalo significa que a linha inteira não pode ser revertida e a ferramenta a deixa inalterada em vez de adivinhar.
É garantido que isso está correto?
Não – é uma heurística, não um conversor certificado. É muito confiável no reconhecimento de mojibake UTF-8-as-legacy-codepage genuíno e dirá claramente quando não conseguir encontrar uma solução segura, em vez de retornar uma resposta errada e confiante.
Meu texto é carregado em algum lugar?
Não. A detecção e a recuperação são executadas inteiramente no seu navegador, usando as mesmas tabelas de codificação já fornecidas para a renderização de páginas da Web — o texto nunca sai do seu dispositivo.