Сходство текста
Измерьте, насколько похожи два текста — процент сходства, расстояние Левенштейна и перекрытие слов.
Сходство текста
Вставьте два текста и получите отчет о сходстве на двух уровнях. На уровне символов вы видите расстояние Левенштейна — количество односимвольных вставок, удалений и замен, необходимых для превращения одного текста в другой, — и полученный из него процент сходства: 100 % означает идентичность, 0 % означает отсутствие общего. На уровне слов в отчете показано сходство двух наборов слов по Жаккару, а также количество уникальных слов, общих для текстов, и сколько из них встречаются только в одном из них.
Два уровня отвечают на разные вопросы. Сходство символов справедливо для почти дубликатов: две версии абзаца, исправленный перевод по сравнению с оригиналом, скопипастированные и слегка отредактированные описания продуктов. Перекрытие слов уместно, когда порядок и формулировка различаются, но словарный запас должен совпадать — проверка того, охватывают ли две статьи одну и ту же тему или насколько на самом деле изменилось переписывание.
«Игнорировать регистр» включен по умолчанию, поэтому «Привет» и «Привет» не считаются разницей; включите «Игнорировать знаки препинания», чтобы сравнивать только слова. Для очень длинных текстов существует предел безопасности: метрики символов вычисляются для первых 5000 символов каждого текста (в отчете так говорится, когда это происходит), поскольку вычисление расстояния редактирования увеличивается с произведением обеих длин. В метриках Word всегда используются полные тексты.
Оба текста полностью сравниваются в вашем браузере — ничего не загружается, поэтому контракты, рукописи и неопубликованные копии здесь в безопасности.