Saltar al contenido
TextArray
Totalmente local

Generador de errores tipográficos

Agregue errores tipográficos de teclado realistas sobre texto limpio: velocidad ajustable, QWERTY o QWERTZ.

Entrada
Salida

Generador de errores tipográficos

El software que maneja la entrada humana eventualmente se encuentra con la escritura humana, y la escritura humana es complicada. Esta herramienta crea ese desorden a pedido: pega texto limpio, establece una tasa de error y regresa con los cuatro errores que cometen los dedos reales. Una tecla vecina presionada en lugar de la derecha (tge para the), dos letras transpuestas (teh), una letra duplicada (thee) o eliminada (th). Las sustituciones siguen un mapa de adyacencia de teclado real (QWERTY o QWERTZ), por lo que t se convierte en r, y, f o g, nunca en una x distante, que es exactamente la distribución de errores para la que están ajustados los algoritmos de coincidencia difusa.

Cada tipo de error tipográfico tiene su propio interruptor, por lo que puede producir datos de transposición pura para probar una implementación Damerau-Levenshtein, o cadenas de solo sustitución de longitud sin cambios. La tasa va desde un sutil 1% de letras hasta un 20% apenas legible, y el recuento informa cuántos errores tipográficos realmente se produjeron. Las mayúsculas y minúsculas se conservan mediante sustituciones, y todo lo que no sea una letra simple (dígitos, puntuación, caracteres acentuados, emoji) pasa intacto.

Usos típicos: accesorios de prueba para correctores ortográficos y funciones de "quiso decir", conjuntos de evaluación de búsqueda difusa, aumento de datos de entrenamiento para modelos de PNL, demostración de por qué falla la deduplicación de coincidencia exacta en nombres ingresados por humanos o verificación de que la validación de su formulario tolera entradas realistas. La aleatoriedad proviene de la fuente criptográfica del navegador y cada ejecución es diferente por diseño.

Todo se ejecuta localmente en su navegador: su texto nunca sale de su dispositivo.

Preguntas frecuentes

¿Qué tipos de errores tipográficos se simulan?
Los cuatro clásicos de la investigación de errores tipográficos: sustitución por una clave físicamente adyacente, transposición de dos letras vecinas, duplicación y omisión. Cada uno tiene su propio interruptor, por lo que puede aislar una clase de error para datos de prueba específicos.
¿Por qué es importante la distribución del teclado?
Las sustituciones reemplazan una letra con un vecino físico, y QWERTY y QWERTZ no están de acuerdo sobre dónde viven y y z. Elija el diseño en el que realmente escriben sus usuarios y los errores tipográficos falsos coincidirán con los reales que mostrarán sus registros.
¿Por qué se dejan solas las letras acentuadas?
El mapa de adyacencia cubre las 26 claves base, donde el modelo vecino es significativo. Los caracteres acentuados se escriben mediante teclas inactivas o presionando prolongadamente, y sus errores tipográficos en el mundo real son diferentes: sustituirlos por vecinos de clave base produciría datos poco realistas.
¿El número de errores tipográficos es exacto?
No: cada letra tiene de forma independiente una probabilidad de error tipográfico, por lo que el recuento fluctúa alrededor del valor esperado, de una ejecución a otra. Esa aleatoriedad es deliberada: errores uniformes y espaciados uniformemente son exactamente lo que no parece una escritura real.
¿Mi texto está subido a alguna parte?
No. Los errores tipográficos se generan completamente en su navegador y su texto nunca sale de su dispositivo.