Fuzzy shoda seznamů
Spáruj položky ze dvou seznamů i když se liší překlepy, mezerami nebo diakritikou.
Fuzzy shoda seznamů
Vložte dva seznamy a tento nástroj spáruje položky, které si jsou podobné, i když jsou napsány jinak. Zvládne nepořádek, který nedokáže přesná shoda: seznam zákazníků, kde se "Jonathan Smith" má shodovat s "Jon Smith", export, kde se "café Latte" má shodovat s "cafe latte", nebo dva sloupce, kde jeden záznam má čárku a druhý ne. Každý pár je ohodnocen podle podobnosti, takže vidíte přesně, jak blízko je shoda.
Dvě možnosti řídí, jak tolerantní je porovnání. Práh podobnosti nastavuje minimální skóre od 0 do 100, které musí pár dosáhnout, aby se počítal jako shoda. Metrika určuje, jak se skóre vypočítá: Levenshteinova vzdálenost počítá úpravy potřebné k přeměně jedné položky na druhou, což se hodí pro krátké řetězce jako jména a kódy, zatímco podobnost tří znaků porovnává překrývající se tříznakové fragmenty a lépe si poradí s přeuspořádaným nebo částečně přepsaným textem. Ignorovat diakritiku, ignorovat velikost písmen a ignorovat interpunkci odstraňují formátovací šum, který by neměl počítat proti shodě, a normalizovat pořadí slov umožní "Smith, Jonathan" shodovat se s "Jonathan Smith" porovnáním slov jako množiny místo posloupnosti.
Ve výchozím nastavení se každá položka spáruje nejvýše jednou se svým jediným nejlepším protějškem — vypněte to, aby se položka mohla shodovat s vším nad prahem, což je užitečné při auditu blízkých duplikátů místo propojení čistých seznamů. Nespárované položky jsou uvedeny odděleně, když je tato možnost zapnutá, takže nic nezmizí bez povšimnutí. Vyberte si jednoduché páry pro rychlý náhled, nebo CSV se skórem pro tabulku.
Všechno běží lokálně ve vašem prohlížeči: ani jeden seznam se neodešle nikam, což je důležité, když jde o údaje o zákaznících nebo kontaktech. Zkopírujte výsledek, stáhněte si jej jako soubor .txt nebo jej pošlete přímo do jiného nástroje a pokračujte v práci.