Saltar al contenido

detector de caracteres

Adivina la codificación original detrás del texto confuso y recupérala.

Entrada

detector de caracteres

Pegue texto donde las letras acentuadas se hayan convertido en cadenas como "PrĂliš" o "GrĂ¶ĂŸe" y esta herramienta adivinará qué salió mal. La causa habitual es un archivo UTF-8 abierto, guardado o canalizado a través de algo que asumía una página de códigos de un solo byte: Windows-1250 o ISO-8859-2 para texto de Europa Central, Windows-1252 para texto de Europa Occidental. Cada carácter acentuado tenía originalmente dos o tres bytes UTF-8; leen un byte a la vez en la página de códigos incorrecta, se convierten exactamente en este tipo de basura doble.

El detector funciona intentando revertir cada página de códigos candidata y verificando si el resultado es UTF-8 bien formado: una prueba estructural que codifica correctamente el texto esencialmente nunca pasa por accidente, razón por la cual la detección automática puede aplicar una solución con confianza real en lugar de tirar una moneda al aire. Cuando encuentra una coincidencia, muestra la codificación original adivinada, la codificación mal interpretada y el texto recuperado, además de cuántos caracteres eliminó la corrección (mojibake siempre es más largo que el texto del que proviene, ya que cada carácter roto solía ser varios).

La detección automática solo adivina la dirección verificable: UTF-8 mostrado con la página de códigos incorrecta. El caso inverso, más raro, un archivo Windows-1250 o ISO-8859-2 leído como Latin-1, no tiene verificación estructural equivalente, así que se ofrece como opción manual en el menú desplegable para cuando ya sospecha eso, en vez de adivinarlo en silencio. Esta es una herramienta heurística, no una garantía: texto que mezcla varios idiomas o símbolos fuera de la página de códigos destino puede no ser recuperable, y lo indica en vez de devolver una respuesta incorrecta con seguridad.

Todo se ejecuta localmente en su navegador utilizando las mismas tablas de codificación que usan los navegadores para representar páginas web; nada de lo que pega se carga en ninguna parte, lo que aquí importa más que la mayoría de las herramientas, ya que el texto confuso a menudo proviene de registros de clientes reales, bases de datos exportadas o tickets de soporte.

Preguntas frecuentes

¿Cómo sabe qué codificación se utilizó?
Vuelve a codificar el texto confuso debajo de cada página de códigos candidato y verifica si los bytes resultantes forman UTF-8 válido. Básicamente, el texto correctamente codificado nunca pasa esa verificación por casualidad, por lo que una coincidencia es una señal confiable de lo que sucedió; no es una certeza, pero sí cercana.
¿Por qué la detección automática no ofrece corregir "leer como Latin-1"?
Esa dirección no tiene una forma equivalente de verificarse a sí misma: muchos valores de bytes son letras válidas en más de una página de códigos, por lo que puede producir un texto de apariencia plausible pero incorrecto. Elígelo manualmente del menú desplegable cuando ya sepas cuál es la situación.
¿Puede arreglar texto con emoji o idiomas mixtos?
Solo si cada carácter del texto pertenece a la página de códigos candidata. Un solo emoji o un carácter fuera de ese rango significa que no se puede revertir toda la línea y la herramienta la deja sin cambios en lugar de adivinar.
¿Se garantiza que esto sea correcto?
No, es una heurística, no un conversor certificado. Es muy confiable para reconocer mojibake de página de códigos UTF-8-como-heredado genuino y dirá claramente cuando no puede encontrar una solución segura, en lugar de devolver una respuesta incorrecta y segura.
¿Mi texto está subido a alguna parte?
No. Tanto la detección como la recuperación se ejecutan completamente en su navegador utilizando las mismas tablas de codificación que ya incluye para representar páginas web: el texto nunca sale de su dispositivo.