Перейти к содержанию
100% локально

Расстояние Левенштейна

Измерьте расстояние редактирования между двумя строками плюс процент сходства.

Входные данные
Сравните с
Выходные данные

Расстояние Левенштейна

Расстояние Левенштейна — это наименьшее количество односимвольных правок — вставок, удалений и замен — необходимых для превращения одной строки в другую. Вставьте строку с каждой стороны, и этот инструмент сообщит об этом расстоянии вместе с нормализованным коэффициентом сходства, рассчитанным как (самая длинная длина минус расстояние), разделенная на самую длинную длину: 100 % означает, что две строки идентичны, а процент падает по мере их расхождения.

Расстояние редактирования — это показатель, лежащий в основе проверок орфографии, нечеткого поиска, дедупликации и сравнения последовательностей ДНК. Он отвечает на вопрос «насколько далеко друг от друга находятся эти два значения» так, как не может простая проверка на равенство — «котенок» и «сидеть» отличаются на 3 правки, что намного ближе, чем два несвязанных слова. Сравнение названий продуктов, SKU, заголовков или коротких пользовательских данных для выявления почти дубликатов — это именно то, для чего он создан.

Три варианта настройки сравнения. При игнорировании регистра «Привет» и «Привет» рассматриваются как равные. Перед сравнением обрежьте пробелы в начале и конце пробелов с каждой стороны. Сравнение по позволяет переключаться с символов на слова: режим слов измеряет, сколько целых слов должно измениться, что является подходящей единицей для сравнения предложений, а не токенов. Очень длинные входные данные обрабатываются безопасно — поскольку вычисления растут вместе с произведением двух длин, очень большие пары возвращают короткое уведомление вместо того, чтобы замораживать вкладку.

Все работает локально в вашем браузере. Эти две строки никогда не загружаются, поэтому сравнение конфиденциальных имен, ключей или неопубликованного текста является полностью конфиденциальным.

FAQ

Что такое расстояние Левенштейна?
Это минимальное количество односимвольных изменений — вставок, удалений или замен — необходимых для изменения первой строки во вторую. Превращение «котенка» в «сидящего» требует 3 правок, поэтому расстояние равно 3.
Как рассчитывается процент сходства?
Это длина более длинной строки за вычетом расстояния редактирования, деленная на эту длину и показанная в процентах. Идентичные строки оцениваются в 100%; две совершенно разные строки одинаковой длины получают 0%.
В чем разница между сравнением по символам и по словам?
Символьный режим учитывает односимвольные изменения, что подходит для коротких строк и обнаружения опечаток. В режиме Word каждое целое слово рассматривается как единое целое, поэтому он измеряет, сколько слов изменилось — лучше подходит для сравнения предложений или фраз.
Есть ли ограничение на размер ввода?
Вычисление растет вместе с произведением обеих длин, поэтому очень большие пары заморозят вкладку. Когда этот предел достигнут, инструмент отображает короткое уведомление с просьбой сократить входные данные, а не пытаться вычислить.
Мой текст где-нибудь загружен?
Нет. Сравнение выполняется полностью в вашем браузере без каких-либо сетевых запросов, поэтому обе строки остаются на вашем устройстве.