Preskoči na vsebino
100% lokalno

Mehko ujemanje seznamov

Uskladi postavke iz dveh seznamov čeprav se razlikujejo po tipki, presledku ali naglasom.

Vhod
Seznam B
70

Mehko ujemanje seznamov

Prilepite dva seznama in to orodje ujema postavke, ki so podobne, tudi ko niso napisane enako. Rešuje vsakodnevno zmešnjavo, s katero se natančno ujemanje ne more soočiti: seznam strank, kjer je potrebno "Janez Novak" uskladiti z "J. Novak", izvoz, kjer je "Kava Latte" potrebno uskladiti z "kava latte", ali dva stolpca, kjer ima en vnos vejico, drugemu pa manjka. Vsak par ima oceno podobnosti, zato vidite natančno, kako blizu je ujemanja, namesto da bi morali ugibati.

Dve možnosti nadzorujeta, kako stroga je primerjava. Prag podobnosti nastavi najmanjšo oceno, od 0 do 100, ki jo mora par doseči, da se šteje za ujemanje. Metrika izbira, kako se ta ocena izračuna: Levenshteinova razdalja šteje urejanja, potrebna, da en vnos spremenite v drugega, kar je primerno za kratke nize, kot so imena in kode, medtem ko podobnost znakov-trigramov primerja prekrivajuče se tri-znakove in se bolje sooči s preurejenimi ali delno prepisanimi besedili. Ignoriraj naglase, ignoriraj velikost črk in ignoriraj ločila odstranijo hrup oblikovanja, ki ne bi smel vplivati na ujemanje, normalizacija vrstnega reda besed pa omogoči, da se "Novak, Janez" ujema z "Janez Novak" z primerjavo besed kot niza namesto zaporedja.

Nazačetku se vsaka postavka ujema največ enkrat, z edino najboljšo protistransko - to izključite, da se postavka ujema z vsem nad pragom, kar je koristno pri preverjanju skoraj-podvojenih namesto povezovanja čistih seznamov. Neujemate postavke so navedene ločeno, kadar je ta možnost vključena, zato nič ne izgine tiho. Izberite preproste pare za hitro branje ali CSV s točkami za preglednico.

Vse poteka lokalno v vašem brskalniku: nobeden seznam se ne pošlje nikamor, kar je pomembno, ko so podatki seznam strank ali kontaktov. Kopirajte rezultat, ga preuzmite kot .txt datoteko ali ga nemudoma pošljite v drugo orodje, da nadaljujete z delom.

FAQ

Kaj se šteje za ujemanje?
Kateri koli par postavk — ena iz vsakega seznama — čigava ocena podobnosti je na ali nad pragom, ki ste ga nastavili. Znižajte prag, da ujamete bolj ohlapna ujemanja, ali ga povečajte, da sprejmete le skoraj enake postavke.
Kakšna je razlika med dvema metrikama?
Levenshteinova razdalja šteje posameznike spremembe znakov in dobro deluje za kratke nize, kot so imena ali kode. Podobnost znakov-trigramov primerja prekrivajočih se tri-znakove in se bolje sooči z urejenimi ali težko prepisanimi besedili.
Ali se lahko ena postavka ujema več kot enkrat?
Samo če izključite "Vsaka postavka se ujema največ enkrat". Kadar je vključeno, je vsaka postavka seznanjena s samo eno najboljšo ustreznico na drugi strani; kadar je izključeno, se postavka lahko pojavi v vsakem paru, ki preseže prag.
Kako velik seznam lahko primerjam?
Orodje opozori in se ustavi namesto da bi zamrznil zavihek, če bi bila dva seznama skupaj potrebna nerealna količina primerjav. Za tipične sezname imen, e-poštnih naslovov ali kratkih postavk je več tisoč postavk na vsaki strani v redu.
Ali so moji podatki naloženi nekje?
Ne. Oba seznama se primerjata povsem v vašem brskalniku in nikoli ne zapustita vaše naprave.