Přeskočit na obsah
100% lokálně

Fuzzy shoda seznamů

Spáruj položky ze dvou seznamů i když se liší překlepy, mezerami nebo diakritikou.

Vstup
Seznam B
70

Fuzzy shoda seznamů

Vložte dva seznamy a tento nástroj spáruje položky, které si jsou podobné, i když jsou napsány jinak. Zvládne nepořádek, který nedokáže přesná shoda: seznam zákazníků, kde se "Jonathan Smith" má shodovat s "Jon Smith", export, kde se "café Latte" má shodovat s "cafe latte", nebo dva sloupce, kde jeden záznam má čárku a druhý ne. Každý pár je ohodnocen podle podobnosti, takže vidíte přesně, jak blízko je shoda.

Dvě možnosti řídí, jak tolerantní je porovnání. Práh podobnosti nastavuje minimální skóre od 0 do 100, které musí pár dosáhnout, aby se počítal jako shoda. Metrika určuje, jak se skóre vypočítá: Levenshteinova vzdálenost počítá úpravy potřebné k přeměně jedné položky na druhou, což se hodí pro krátké řetězce jako jména a kódy, zatímco podobnost tří znaků porovnává překrývající se tříznakové fragmenty a lépe si poradí s přeuspořádaným nebo částečně přepsaným textem. Ignorovat diakritiku, ignorovat velikost písmen a ignorovat interpunkci odstraňují formátovací šum, který by neměl počítat proti shodě, a normalizovat pořadí slov umožní "Smith, Jonathan" shodovat se s "Jonathan Smith" porovnáním slov jako množiny místo posloupnosti.

Ve výchozím nastavení se každá položka spáruje nejvýše jednou se svým jediným nejlepším protějškem — vypněte to, aby se položka mohla shodovat s vším nad prahem, což je užitečné při auditu blízkých duplikátů místo propojení čistých seznamů. Nespárované položky jsou uvedeny odděleně, když je tato možnost zapnutá, takže nic nezmizí bez povšimnutí. Vyberte si jednoduché páry pro rychlý náhled, nebo CSV se skórem pro tabulku.

Všechno běží lokálně ve vašem prohlížeči: ani jeden seznam se neodešle nikam, což je důležité, když jde o údaje o zákaznících nebo kontaktech. Zkopírujte výsledek, stáhněte si jej jako soubor .txt nebo jej pošlete přímo do jiného nástroje a pokračujte v práci.

Časté dotazy

Co se počítá jako shoda?
Libovolný pár položek – jeden z každého seznamu – jehož skóre podobnosti dosahuje nebo překračuje váš nastavený práh. Snižte práh, abyste zachytili volnější shody, nebo jej zvyšte, aby se akceptovaly pouze téměř identické položky.
Jaký je rozdíl mezi dvěma metrikami?
Levenshteinova vzdálenost počítá jednoznakové úpravy a funguje dobře pro krátké řetězce jako jména nebo kódy. Podobnost tří znaků porovnává překrývající se tříznakové fragmenty a je více odpouštivá vůči přeuspořádanému nebo značně přepsanému textu.
Může se jedna položka shodovat více než jednou?
Pouze pokud vypnete možnost "Spáruj každou položku nejvíce jednou". Když je zapnutá, každá položka se spáruje se svým jediným nejlepším protějškem na druhé straně; když je vypnutá, položka se může objevit v každém páru, který překročí práh.
Jaké velké seznamy mohu porovnat?
Nástroj upozorní a zastaví se, aby aby nezmrazil kartu, pokud by dva seznamy dohromady vyžadovaly nevhodné množství porovnání. Pro typické seznamy jmen, e-mailů nebo krátkých položek jsou tisíce položek na každé straně v pořádku.
Jsou moje údaje nahrány někam?
Ne. Oba seznamy se porovnávají zcela ve vašem prohlížeči a nikdy neopustí vaše zařízení.