Asemănarea textului
Măsurați cât de similare sunt două texte - procentul de similitudine, distanța Levenshtein și suprapunerea cuvintelor.
Asemănarea textului
Lipiți două texte și obțineți un raport de similitudine pe două niveluri. La nivel de caractere vedeți distanța Levenshtein — numărul de inserări, ștergeri și înlocuiri de un singur caracter necesare pentru a transforma un text în altul — și un procent de similitudine derivat din acesta: 100 % înseamnă identic, 0 % nu înseamnă nimic în comun. La nivel de cuvânt raportul arată asemănarea Jaccard a celor două seturi de cuvinte, plus câte cuvinte unice împărtășesc textele și câte apar doar într-unul dintre ele.
Cele două niveluri răspund la întrebări diferite. Asemănarea caracterelor este potrivită pentru aproape duplicate: două versiuni ale unui paragraf, o traducere corectată față de originalul, descrieri ale produselor care au fost copiate-lipite și ușor editate. Suprapunerea cuvintelor este corectă atunci când ordinea și formularea diferă, dar vocabularul ar trebui să se potrivească - verificând dacă două articole acoperă același domeniu sau cât de mult s-a schimbat de fapt o rescrie.
„Ignorați majuscule” este activat în mod implicit, astfel încât „Bună ziua” și „bună ziua” să nu conteze ca diferență; activați „Ignorați semnele de punctuație” pentru a compara numai cuvintele. Pentru textele foarte lungi există o limită de siguranță: valorile de caractere sunt calculate pe primele 5.000 de caractere ale fiecărui text (raportul spune așa când se întâmplă), deoarece calculul distanței de editare crește odată cu produsul ambelor lungimi. Valorile Word folosesc întotdeauna textele complete.
Ambele texte sunt comparate în întregime în browserul dvs. - nimic nu este încărcat, astfel încât contractele, manuscrisele și copiile nepublicate sunt în siguranță aici.