Przejdź do treści
100% lokalnie

Niedokładne dopasowanie list

Dopasuj elementy z dwóch list, nawet jeśli różnią się typami, spacjami lub znakami diakrytycznymi.

Wejście
Lista B
70

Niedokładne dopasowanie list

Wklej dwie listy, a to narzędzie dopasuje elementy, które są podobne, nawet jeśli są napisane inaczej. Rozwiąże bałagan, który niedokładne dopasowanie nie potrafi obsługiwać: lista klientów, gdzie "Jonathan Smith" powinna pasować do "Jon Smith", eksport, gdzie "café Latte" powinno pasować do "cafe latte", lub dwie kolumny, gdzie jeden rekord ma przecinek, a drugi go nie ma. Każda para jest oceniana na podstawie podobieństwa, więc widzisz dokładnie, jak blisko jest dopasowanie.

Dwie opcje kontrolują, jak tolerancyjne jest porównanie. Próg podobieństwa ustawia minimalny wynik od 0 do 100, który para musi osiągnąć, aby liczyć się jako dopasowanie. Metryka określa, jak obliczany jest wynik: odległość Levenshteina liczy edycje potrzebne do przekształcenia jednego elementu w drugi, co dobrze sprawdza się dla krótkich łańcuchów, takich jak nazwy i kody, podczas gdy podobieństwo триграмов porównuje zachodzące na siebie trzyznakowe fragmenty i lepiej radzi sobie z przeorganizowanym lub częściowo przepisanym tekstem. Ignorowanie znaków diakrytycznych, ignorowanie wielkości liter i ignorowanie interpunkcji usuwają szum formatowania, który nie powinien liczyć się w stosunku do dopasowania, a normalizowanie kolejności słów pozwala "Smith, Jonathan" pasować do "Jonathan Smith" przez porównywanie słów jako zbioru zamiast sekwencji.

Domyślnie każdy element jest dopasowywany co najwyżej raz do jego jedynego najlepszego odpowiednika — wyłącz to, aby element mógł pasować do wszystkiego powyżej progu, co jest przydatne podczas audytu bliskich duplikatów zamiast łączenia czystych list. Niedopasowane elementy są wyświetlane osobno, gdy ta opcja jest włączona, dlatego nic nie znika bez wiadomości. Wybierz proste pary do szybkiego przeglądu lub CSV ze skoringiem do arkusza kalkulacyjnego.

Wszystko działa lokalnie w twojej przeglądarce: żadna lista nie jest przesyłana nigdzie, co ma znaczenie, gdy dane to lista klientów lub kontaktów. Skopiuj wynik, pobierz go jako plik .txt lub wyślij bezpośrednio do innego narzędzia, aby kontynuować pracę.

Częste pytania

Co liczy się za dopasowanie?
Każda para elementów – po jednym z każdej listy – której wynik podobieństwa osiąga lub przekracza ustawiony próg. Obniż próg, aby uchwycić luźniejsze dopasowania, lub podnieś go, aby zaakceptować tylko niemal identyczne elementy.
Jaka jest różnica między dwiema metrykami?
Odległość Levenshteina liczy edycje jednoznakowe i dobrze sprawdza się w przypadku krótkich łańcuchów, takich jak nazwy lub kody. Podobieństwo триграмов porównuje zachodzące na siebie trzyznakowe fragmenty i jest bardziej wyrozumiałe dla przeorganizowanego lub znacznie przepisanego tekstu.
Czy jeden element może dopasować więcej niż raz?
Tylko jeśli wyłączysz opcję "Dopasuj każdy element co najwyżej raz". Gdy jest włączona, każdy element jest dopasowywany do swojego jedynego najlepszego odpowiednika po drugiej stronie; gdy jest wyłączona, element może pojawić się w każdej parze, która przekracza próg.
Jakie duże listy mogę porównać?
Narzędzie ostrzega i zatrzymuje się, aby aby nie zawiesiło karty, jeśli dwie listy razem wymagałyby nierozsądnej ilości porównań. W przypadku typowych list nazw, adresów e-mail lub krótkich wpisów tysiące elementów po każdej stronie to brak problemu.
Czy moje dane są przesyłane gdziekolwiek?
Nie. Obie listy są porównywane całkowicie w twojej przeglądarce i nigdy nie opuszczają twojego urządzenia.