Preskoči na sadržaj
TextArray
100% lokalno

Sličnost teksta

Izmjerite koliko su dva teksta slična — postotak sličnosti, Levenshteinova udaljenost i preklapanje riječi.

Unos
Drugi tekst
Rezultat

Sličnost teksta

Zalijepite dva teksta i dobit ćete izvješće o sličnosti na dvije razine. Na razini znakova vidite Levenshteinovu udaljenost — broj umetanja jednog znaka, brisanja i zamjena potrebnih da se jedan tekst pretvori u drugi — i postotak sličnosti izveden iz toga: 100 % znači identično, 0 % ne znači ništa zajedničko. Na razini riječi izvješće pokazuje Jaccardovu sličnost dva skupa riječi, plus koliko jedinstvenih riječi dijele tekstovi i koliko ih se pojavljuje samo u jednom od njih.

The two levels answer different questions. Sličnost znakova ispravna je za gotovo duplikate: dvije verzije odlomka, ispravljeni prijevod u odnosu na izvornik, opisi proizvoda koji su kopirani i lagano uređeni. Preklapanje riječi je ispravno kada se redoslijed i fraza razlikuju, ali vokabular bi se trebao podudarati - provjera pokrivaju li dva članka isto područje ili koliko se prepravljanje zapravo promijenilo.

"Zanemari velika i mala slova" je uključeno prema zadanim postavkama tako da se "Hello" i "hello" ne računaju kao razlika; uključite "Zanemari interpunkciju" za usporedbu samo riječi. Za vrlo duge tekstove postoji sigurnosno ograničenje: metrika znakova izračunava se na prvih 5000 znakova svakog teksta (izvješće tako kaže kada se to dogodi), jer izračun udaljenosti za uređivanje raste s umnoškom obje duljine. Word metrics always use the full texts.

Oba se teksta u potpunosti uspoređuju u vašem pregledniku — ništa se ne učitava, tako da su ugovori, rukopisi i neobjavljeni primjerci ovdje sigurni.

FAQ

Kako se izračunava postotak sličnosti?
To je 1 minus Levenshteinova udaljenost podijeljena s duljinom duljeg teksta, prikazano kao postotak. Identični tekstovi rezultat 100 %; tekstovi bez zajedničkih znakova ocjena 0 %.
Što je Levenshteinova udaljenost?
Najmanji broj izmjena jednog znaka — umetanja, brisanja ili zamjena — potrebnih da se prvi tekst pretvori u drugi. "mačić" do "sjedi" zahtijeva 3 izmjene.
Što Jaccardova riječ preklapanje znači?
Jedinstvene riječi koje dijele oba teksta podijeljene svim jedinstvenim riječima u njima. Zanemaruje red riječi i ponavljanje, pa mjeri zajednički vokabular, a ne zajedničko fraziranje.
Postoji li ograničenje duljine?
Mjerni podaci o znakovima koriste prvih 5000 znakova svakog teksta — osim toga izračun udaljenosti za uređivanje zamrznuo bi karticu, a izvješće bilježi skraćivanje. Word metrika uvijek koristi pune tekstove.
Je li moj tekst negdje uploadan?
Ne. Oba se teksta u potpunosti uspoređuju u vašem pregledniku i nikada ne napuštaju vaš uređaj.