Перейти до вмісту
TextArray
100% локально

Генератор друкарських помилок

Посипте чистий текст реалістичними помилками клавіатури — регульована швидкість, QWERTY або QWERTZ.

Введення
Вихід

Генератор друкарських помилок

Програмне забезпечення, яке обробляє людський ввід, зрештою зустрічається з людським набором тексту — а людський набір є безладним. Цей інструмент створює цей безлад на вимогу: вставте чистий текст, установіть частоту помилок, і він повернеться з чотирма помилками, які роблять справжні пальці. Натискання сусідньої клавіші замість правої (tge для the), дві літери переставлені (teh), літера подвоєна (thee) або опущена (th). Підстановки відповідають фактичній карті суміжності клавіатури — QWERTY або QWERTZ — тому t стає r, y, f або g, ніколи не віддаленим x, що є саме тим алгоритмом розподілу помилок, на який налаштовані алгоритми нечіткої відповідності.

Кожен тип друкарських помилок має власний перемикач, тому ви можете створювати чисті дані транспонування для тестування реалізації Дамерау-Левенштейна або рядки лише заміни незмінної довжини. Показник коливається від ледь помітного 1% літер до ледь читабельних 20%, і підрахунок повідомляє про те, скільки фактично допущено друкарських помилок. Регістр зберігається завдяки замінам, і все, що не є простою літерою — цифри, розділові знаки, наголоси, емодзі — проходить недоторканим.

Типове використання: тестові інструменти для перевірки орфографії та функції «чи ви мали на увазі», набори оцінки нечіткого пошуку, навчання доповнення даних для моделей NLP, демонстрація того, чому дедуплікація точного збігу не вдається для імен, введених людиною, або перевірка того, що перевірка форми допускає реалістичні введення. Випадковість походить від джерела шифрування браузера, і кожен запуск відрізняється за дизайном.

Усе працює локально у вашому браузері — ваш текст ніколи не покидає ваш пристрій.

FAQ

Які види друкарських помилок імітуються?
Чотири класики дослідження помилок друку: заміна фізично суміжною клавішею, перестановка двох сусідніх літер, подвоєння та пропуск. Кожен має власний перемикач, тому ви можете виділити один клас помилок для цільових тестових даних.
Чому розкладка клавіатури має значення?
Підстановки замінюють букву фізичним сусідом, а QWERTY і QWERTZ не погоджуються щодо того, де знаходяться y і z. Виберіть розкладку, яку ваші користувачі насправді вводять, і фальшиві помилки збігатимуться зі справжніми, які відображатимуться у ваших журналах.
Чому наголошені букви залишені окремо?
Карта суміжності охоплює 26 базових ключів, де модель сусідів має значення. Символи з діакритичними знаками вводяться за допомогою мертвих клавіш або тривалого натискання, і їхні реальні помилки друку відрізняються за своїм типом — заміна їх сусідніми базовими клавішами дасть нереалістичні дані.
Чи точна кількість друкарських помилок?
Ні — кожна літера окремо має ймовірність друкарської помилки, тому підрахунок коливається навколо очікуваного значення. Ця випадковість є навмисною: рівномірні, рівномірно розподілені помилки – це саме те, на що не виглядає справжній набір.
Мій текст десь завантажено?
Ні. Помилки генеруються повністю у вашому браузері, і ваш текст ніколи не залишає ваш пристрій.