Sări la conținut
Complet local

Potrivire fuzzy de liste

Potriviți elemente din două liste, chiar dacă diferă din cauza greșelilor de ortografie, spații sau accente.

Intrare
Lista B
70

Potrivire fuzzy de liste

Lipiți două liste și acest instrument potrivește elementele similare, chiar dacă nu sunt scrise identic. Rezolvă mizeria cotidiană pe care potrivirea exactă nu o poate face: o listă de clienți unde "Jonathan Smith" trebuie să se alinieze cu "Jon Smith", o exportare unde "café Latte" ar trebui să se potrivească cu "cafe latte", sau două coloane unde o intrare are o virgulă în plus pe care cealaltă nu o are. Fiecare pereche primește un scor de similaritate, pentru a vedea exact cât de apropiată este potrivirea în loc să ghiciți.

Două opțiuni controlează cât de tolerantă este comparația. Pragul de similaritate stabilește scorul minim, de la 0 la 100, pe care o pereche trebuie să îl aibă pentru a fi considerată potrivire. Metrica alege modul în care se calculează scorul: distanța Levenshtein numără editările necesare pentru a transforma un element în altul, ceea ce funcționează bine pentru stringuri scurte precum nume și coduri, în timp ce similaritatea pe trigramă compară fragmente de trei caractere suprapuse și se descurcă mai bine cu text reordonat sau parțial rescris. Ignorarea diacriticelor, ignorarea majuscule/minuscule și ignorarea punctuației elimină zgomotul de formatare care nu ar trebui să afecteze o potrivire, iar normalizarea ordinii cuvintelor permite ca "Smith, Jonathan" să se potrivească cu "Jonathan Smith" prin compararea cuvintelor ca set în loc de secvență.

Implicit, fiecare element se potrivește cel mult o dată cu omologul său unic — dezactivați aceasta pentru a permite unui element să se potrivească cu totul deasupra pragului, util la auditarea aproape-duplicatelor în loc de legarea listelor curate. Elementele nepotrivite sunt listate separat atunci când aceasta opțiune este activată, deci nimic nu dispare în tăcere. Alegeți perechi simple pentru o lectură rapidă, sau CSV cu scor pentru o foaie de calcul.

Totul rulează local în browserul tău: nicio listă nu este încărcată nicăieri, ceea ce contează atunci când datele sunt o listă de clienți sau contacte. Copiază rezultatul, descarcă ca fișier .txt sau trimite direct în alt instrument pentru a continua lucrul.

FAQ

Ce se consideră potrivire?
Orice pereche de elemente — câte una din fiecare listă — al căror scor de similaritate se află la sau deasupra pragului pe care îl setați. Scăzuți pragul pentru a detecta potriviri mai libere, sau ridicați-l pentru a accepta doar elemente aproape identice.
Care este diferența dintre cele două metrici?
Distanța Levenshtein numără editările de caractere unice și funcționează bine pentru stringuri scurte precum nume sau coduri. Similaritatea pe trigramă compară fragmente de trei caractere suprapuse și este mai tolerantă cu textul reordonat sau rescris semnificativ.
Un element se poate potrivi mai mult de o dată?
Doar dacă dezactivezi "Potrivește fiecare element cel mult o dată". Cu aceasta activată, fiecare element este împerecheat cu cea mai bună potrivire unică pe cealaltă parte; cu aceasta dezactivată, un element poate apărea în fiecare pereche care depășește pragul.
Cât de mare poate fi o listă pe care o pot compara?
Instrumentul avertizează și se oprește în loc să blocheze fila dacă cele două liste împreună ar necesita un număr irrațional de comparații. Pentru listele tipice de nume, e-mailuri sau intrări scurte, mii de elemente pe fiecare parte funcționează bine.
Datele mele sunt încărcate undeva?
Nu. Ambele liste sunt comparate în întregime în browserul tău și nu lasă niciodată dispozitivul.