Расстояние Левенштейна
Измерьте расстояние редактирования между двумя строками плюс процент сходства.
Расстояние Левенштейна
Расстояние Левенштейна — это наименьшее количество односимвольных правок — вставок, удалений и замен — необходимых для превращения одной строки в другую. Вставьте строку с каждой стороны, и этот инструмент сообщит об этом расстоянии вместе с нормализованным коэффициентом сходства, рассчитанным как (самая длинная длина минус расстояние), разделенная на самую длинную длину: 100 % означает, что две строки идентичны, а процент падает по мере их расхождения.
Расстояние редактирования — это показатель, лежащий в основе проверок орфографии, нечеткого поиска, дедупликации и сравнения последовательностей ДНК. Он отвечает на вопрос «насколько далеко друг от друга находятся эти два значения» так, как не может простая проверка на равенство — «котенок» и «сидеть» отличаются на 3 правки, что намного ближе, чем два несвязанных слова. Сравнение названий продуктов, SKU, заголовков или коротких пользовательских данных для выявления почти дубликатов — это именно то, для чего он создан.
Три варианта настройки сравнения. При игнорировании регистра «Привет» и «Привет» рассматриваются как равные. Перед сравнением обрежьте пробелы в начале и конце пробелов с каждой стороны. Сравнение по позволяет переключаться с символов на слова: режим слов измеряет, сколько целых слов должно измениться, что является подходящей единицей для сравнения предложений, а не токенов. Очень длинные входные данные обрабатываются безопасно — поскольку вычисления растут вместе с произведением двух длин, очень большие пары возвращают короткое уведомление вместо того, чтобы замораживать вкладку.
Все работает локально в вашем браузере. Эти две строки никогда не загружаются, поэтому сравнение конфиденциальных имен, ключей или неопубликованного текста является полностью конфиденциальным.