Levenshtein távolság
Mérje meg a két karakterlánc közötti szerkesztési távolságot, valamint a hasonlósági százalékot.
Levenshtein távolság
A Levenshtein távolság az egykarakteres szerkesztések – beillesztések, törlések és helyettesítések – legkisebb száma, amely ahhoz szükséges, hogy az egyik karakterláncot a másikba alakítsa. Illesszen be egy karakterláncot mindkét oldalra, és ez az eszköz jelzi ezt a távolságot, valamint a normalizált hasonlósági arányt, amelyet úgy számítanak ki, hogy (leghosszabb hossz mínusz távolság) osztva a leghosszabb hosszúsággal: a 100% azt jelenti, hogy a két karakterlánc azonos, és a százalékos arány csökken, ha eltérnek.
A szerkesztési távolság a helyesírás-ellenőrző, a fuzzy keresés, a deduplikáció és a DNS-szekvenciák összehasonlítása mögötti mérőszám. Azt válaszolja, hogy "milyen távol van ez a két érték egymástól", oly módon, ahogy egy egyszerű egyenlőség-ellenőrzés nem tud – a "cica" és az "ül" 3 szerkesztéssel különbözik, ami sokkal közelebb áll két független szónál. A terméknevek, cikkszámok, címsorok vagy rövid felhasználói bevitelek összehasonlítása a majdnem ismétlődésekhez pontosan erre készült.
Három lehetőség hangolja az összehasonlítást. A kis- és nagybetűk figyelmen kívül hagyása a „Hello” és a „hello” szavakat egyenlőként kezeli. Az összehasonlítás előtt vágja le mindkét oldalról a kezdő és a záró szóközcsíkokat. Az Összehasonlítás segítségével karakterekről szavakra válthat: a szómód azt méri, hogy hány egész szót kell megváltoztatnia, ami a megfelelő egység a mondatok összehasonlításához, nem pedig a jelzőkhöz. A nagyon hosszú bevitelek biztonságosan kezelhetők – mivel a számítás a két hossz szorzatával nő, a rendkívül nagy párok rövid értesítést adnak vissza, ahelyett, hogy lefagyasztják a fület.
Minden helyileg fut a böngészőben. A két karakterlánc soha nem kerül feltöltésre, így a bizalmas nevek, kulcsok vagy nem publikált szövegek összehasonlítása teljesen privát.