Перейти к содержанию
TextArray
100% локально

Генератор опечаток

Добавьте реалистичные опечатки на клавиатуре поверх чистого текста — регулируемая скорость, QWERTY или QWERTZ.

Входные данные
Выходные данные

Генератор опечаток

Программное обеспечение, которое обрабатывает вводимые человеком данные, в конечном итоге сталкивается с человеческим вводом текста, а ввод текста человеком — это беспорядочно. Этот инструмент производит эту ерунду по требованию: вставляет чистый текст, устанавливает частоту ошибок, и он возвращается с четырьмя ошибками, которые допускают настоящие пальцы. Соседняя клавиша нажата вместо правой (tge для the), две буквы переставлены (teh), буква удвоена (thee) или опущена (th). Замены следуют реальной карте соседства клавиатуры — QWERTY или QWERTZ — так что t становится r, y, f или g, а не отдаленным x, что и является именно тем, на что настроены алгоритмы нечеткого сопоставления распределения ошибок.

Каждый тип опечатки имеет свой собственный переключатель, поэтому вы можете создавать чистые данные транспонирования для тестирования реализации Дамерау-Левенштейна или строки неизмененной длины, предназначенные только для замены. Показатель варьируется от незначительного 1% букв до едва читаемых 20%, и подсчет показывает, сколько на самом деле было допущено опечаток. Регистр сохраняется за счет замен, и все, что не является простой буквой — цифры, знаки препинания, символы с диакритическими знаками, смайлики — остается нетронутым.

Типичное использование: тестовые приспособления для средств проверки орфографии и функций «вы имели в виду», нечеткие наборы оценок поиска, увеличение обучающих данных для моделей NLP, демонстрация того, почему дедупликация с точным совпадением не работает для имен, введенных человеком, или проверка того, что проверка вашей формы допускает реалистичный ввод. Случайность исходит из криптоисточника браузера, и каждый запуск отличается по дизайну.

Все работает локально в вашем браузере — ваш текст никогда не покидает ваше устройство.

FAQ

Какие виды опечаток моделируются?
Четыре классических метода исследования опечаток: замена физически соседней клавишей, перестановка двух соседних букв, удвоение и пропуск. Каждый из них имеет свой собственный переключатель, поэтому вы можете изолировать один класс ошибок для целевых тестовых данных.
Почему раскладка клавиатуры имеет значение?
Замены заменяют букву физическим соседом, а QWERTY и QWERTZ расходятся во мнениях относительно того, где расположены y и z. Выберите макет, который на самом деле печатают ваши пользователи, и поддельные опечатки будут соответствовать реальным, которые будут отображаться в ваших журналах.
Почему буквы с ударением остаются в покое?
Карта смежности охватывает 26 базовых ключей, где модель соседства имеет смысл. Символы с акцентом вводятся с помощью неработающих клавиш или длительного нажатия, а их реальные опечатки различны по своей сути — замена их соседями по базовой клавише приведет к получению нереалистичных данных.
Точное количество опечаток?
Нет — каждая буква независимо имеет вероятность опечатки, равную размеру ставки, поэтому счет колеблется вокруг ожидаемого значения, от начала до конца. Эта случайность является преднамеренной: однородные, равномерно расположенные ошибки — это именно то, на что не похож настоящий набор текста.
Мой текст где-нибудь загружен?
Нет. Опечатки генерируются исключительно в вашем браузере, и ваш текст никогда не покидает ваше устройство.