Podobnost besedila
Izmerite, kako podobni sta si dve besedili — odstotek podobnosti, Levenshteinova razdalja in prekrivanje besed.
Podobnost besedila
Prilepite dve besedili in dobite poročilo o podobnosti na dveh ravneh. Na ravni znakov vidite Levenshteinovo razdaljo - število vstavljanj, izbrisov in zamenjav enega znaka, potrebnih za pretvorbo enega besedila v drugega - in iz tega izpeljani odstotek podobnosti: 100 % pomeni enako, 0 % ne pomeni nič skupnega. Na besedni ravni poročilo prikazuje Jaccardovo podobnost obeh besednih nizov ter koliko edinstvenih besed si delita besedila in koliko se jih pojavi samo v enem od njih.
Dve ravni odgovarjata na različna vprašanja. Podobnost znakov je prava za skoraj dvojnike: dve različici odstavka, popravljen prevod glede na izvirnik, opisi izdelkov, ki so bili kopirani in rahlo urejeni. Prekrivanje besed je prav, kadar se vrstni red in besedna zveza razlikujeta, vendar se mora besedišče ujemati – preverjanje, ali dva člena pokrivata isto podlago ali koliko se je prepis dejansko spremenil.
»Prezri velike in male črke« je privzeto vklopljeno, tako da »Hello« in »hello« ne štejeta kot razlika; vklopite "Prezri ločila", če želite primerjati samo besede. Za zelo dolga besedila obstaja varnostna omejitev: meritve znakov se izračunajo za prvih 5000 znakov vsakega besedila (v poročilu tako piše, ko se to zgodi), ker izračun razdalje urejanja raste z zmnožkom obeh dolžin. Wordove metrike vedno uporabljajo polna besedila.
Obe besedili se v celoti primerjata v vašem brskalniku - nič se ne naloži, zato so pogodbe, rokopisi in neobjavljeni izvodi tukaj varni.