Sličnost teksta
Izmjerite koliko su dva teksta slična — postotak sličnosti, Levenshteinova udaljenost i preklapanje riječi.
Sličnost teksta
Zalijepite dva teksta i dobit ćete izvješće o sličnosti na dvije razine. Na razini znakova vidite Levenshteinovu udaljenost — broj umetanja jednog znaka, brisanja i zamjena potrebnih da se jedan tekst pretvori u drugi — i postotak sličnosti izveden iz toga: 100 % znači identično, 0 % ne znači ništa zajedničko. Na razini riječi izvješće pokazuje Jaccardovu sličnost dva skupa riječi, plus koliko jedinstvenih riječi dijele tekstovi i koliko ih se pojavljuje samo u jednom od njih.
The two levels answer different questions. Sličnost znakova ispravna je za gotovo duplikate: dvije verzije odlomka, ispravljeni prijevod u odnosu na izvornik, opisi proizvoda koji su kopirani i lagano uređeni. Preklapanje riječi je ispravno kada se redoslijed i fraza razlikuju, ali vokabular bi se trebao podudarati - provjera pokrivaju li dva članka isto područje ili koliko se prepravljanje zapravo promijenilo.
"Zanemari velika i mala slova" je uključeno prema zadanim postavkama tako da se "Hello" i "hello" ne računaju kao razlika; uključite "Zanemari interpunkciju" za usporedbu samo riječi. Za vrlo duge tekstove postoji sigurnosno ograničenje: metrika znakova izračunava se na prvih 5000 znakova svakog teksta (izvješće tako kaže kada se to dogodi), jer izračun udaljenosti za uređivanje raste s umnoškom obje duljine. Word metrics always use the full texts.
Oba se teksta u potpunosti uspoređuju u vašem pregledniku — ništa se ne učitava, tako da su ugovori, rukopisi i neobjavljeni primjerci ovdje sigurni.