Ir para o conteúdo
TextArray
Totalmente local

Gerador de erros de digitação

Polvilhe erros de digitação realistas do teclado sobre texto limpo – taxa ajustável, QWERTY ou QWERTZ.

Entrada
Saída

Gerador de erros de digitação

O software que lida com a entrada humana eventualmente encontra a digitação humana – e a digitação humana é confusa. Essa ferramenta fabrica essa bagunça sob demanda: cole texto limpo, defina uma taxa de erro e ele volta com os quatro erros que dedos reais cometem. Uma tecla vizinha pressionada em vez da direita (tge para the), duas letras transpostas (teh), uma letra duplicada (ti) ou descartada (th). As substituições seguem um mapa real de adjacência do teclado - QWERTY ou QWERTZ - então a t se torna r, y, f ou g, nunca um x distante, que é exatamente a distribuição de erros para a qual os algoritmos de correspondência difusa são ajustados.

Cada tipo de erro de digitação tem sua própria alternância, para que você possa produzir dados de transposição puros para testar uma implementação de Damerau-Levenshtein ou strings somente de substituição de comprimento inalterado. A taxa varia de um sutil 1% de letras a 20% pouco legíveis, e a contagem informa quantos erros de digitação realmente ocorreram. As maiúsculas e minúsculas são preservadas por meio de substituições, e tudo o que não é uma letra simples – dígitos, pontuação, caracteres acentuados, emoji – passa intacto.

Usos típicos: acessórios de teste para verificadores ortográficos e recursos "você quis dizer", conjuntos de avaliação de pesquisa difusa, aumento de dados de treinamento para modelos de PNL, demonstração de por que a desduplicação de correspondência exata falha em nomes inseridos por humanos ou verificação de que a validação do formulário tolera entradas realistas. A aleatoriedade vem da fonte criptográfica do navegador e cada execução é diferente por design.

Tudo é executado localmente no seu navegador – seu texto nunca sai do seu dispositivo.

FAQ

Quais tipos de erros de digitação são simulados?
Os quatro clássicos da pesquisa de erros de digitação: substituição por uma chave fisicamente adjacente, transposição de duas letras vizinhas, duplicação e omissão. Cada um tem sua própria alternância, para que você possa isolar uma classe de erro para dados de teste direcionados.
Por que o layout do teclado é importante?
As substituições substituem uma letra por um vizinho físico, e QWERTY e QWERTZ discordam sobre onde y e z moram. Escolha o layout que seus usuários realmente digitam e os erros de digitação falsos corresponderão aos erros reais que seus registros mostrarão.
Por que as letras acentuadas são deixadas de lado?
O mapa de adjacência cobre as 26 chaves básicas, onde o modelo vizinho é significativo. Caracteres acentuados são digitados por meio de teclas mortas ou pressionamento longo, e seus erros de digitação no mundo real são de tipos diferentes - substituí-los por vizinhos de chave base produziria dados irrealistas.
O número de erros de digitação é exato?
Não - cada letra independentemente tem uma chance de erro de digitação, então a contagem flutua em torno do valor esperado, execução após execução. Essa aleatoriedade é deliberada: erros uniformes e espaçados são exatamente o que a digitação real não parece.
Meu texto é carregado em algum lugar?
Não. Os erros de digitação são gerados inteiramente no seu navegador e seu texto nunca sai do seu dispositivo.