Схожість тексту
Виміряйте, наскільки схожі два тексти — відсоток подібності, відстань Левенштейна та накладання слів.
Схожість тексту
Вставте два тексти та отримайте звіт про схожість на двох рівнях. На рівні символів ви бачите відстань Левенштейна — кількість вставок, видалень і замін поодиноких символів, необхідних для перетворення одного тексту в інший — і отриманий з цього відсоток подібності: 100 % означає ідентичність, 0 % означає нічого спільного. На рівні слів звіт показує подібність двох наборів слів за Жаккардом, а також кількість унікальних слів, які є в текстах, а також скільки з них з’являється лише в одному з них.
Два рівні відповідають на різні запитання. Подібність символів підходить для майже дублікатів: дві версії абзацу, виправлений переклад порівняно з оригіналом, описи продуктів, які були скопійовані та незначно відредаговані. Накладення слів є правильним, коли порядок і формулювання відрізняються, але словниковий запас має збігатися — перевіряючи, чи охоплюють дві статті ту саму тему або наскільки змінилося переписування.
«Ігнорувати регістр» увімкнено за замовчуванням, тому «Привіт» і «привіт» не враховуються як різниця; увімкніть «Ігнорувати знаки пунктуації», щоб порівнювати слова окремо. Для дуже довгих текстів існує обмеження безпеки: показники символів обчислюються для перших 5000 символів кожного тексту (у звіті так зазначено, коли це трапляється), оскільки обчислення відстані редагування зростає разом із добутком обох довжин. Метрики Word завжди використовують повні тексти.
Обидва тексти повністю порівнюються у вашому браузері — нічого не завантажується, тому контракти, рукописи та неопубліковані копії знаходяться тут у безпеці.