Hoppa till innehåll
100% lokalt

Fuzzy listmatchning

Koppla ihop poster från två listor även när de skiljer sig åt genom stavfel, mellanslag eller accenter.

Inmatning
Lista B
70
Utmatning

Fuzzy listmatchning

Klistra in två listor och detta verktyg kopplar ihop posterna, även om de inte är identiska. Det löser det vardagliga problem som exakt matchning inte kan: en kundlista där "Jonathan Smith" behöver matcha "Jon Smith", en export där "café Latte" ska matcha "cafe latte", eller två kolumner där en post har ett kommatecken som den andra saknar. Varje par får ett likhetspoäng, så du ser exakt hur nära en matchning är.

Två alternativ styr hur förlåtande jämförelsen är. Likhetsestränsen sätter minsta poäng, från 0 till 100, som ett par måste uppnå. Måttenheterna avgör hur det poänget beräknas: Levenshtein-avstånd räknar ändringar som behövs för att förvandla en post till den andra – bra för korta strängar som namn och koder. Teckentrigram-likhet jämför överlappande tresiffriga fragment och hanterar omordnad eller delvis omskriven text bättre. Alternativen "Ignorera diakritiska tecken", "Ignorera skiftläge" och "Ignorera skiljetecken" tar bort formateringsbrus som inte bör räknas mot en matchning. "Normalisera ordning" låter "Smith, Jonathan" matcha "Jonathan Smith" genom att jämföra ord som en uppsättning istället för i ordning.

Som standard matchas varje post högst en gång till sin bästa motsvarighet på andra sidan – stäng av det för att låta en post matcha allt över tröskeln, användbart när man granskar nästan-dubbletter. Omatchade poster visas separat när det alternativet är på. Välj "Par" för en snabb läsning eller "CSV med poäng" för ett kalkylblad.

Allt körs lokalt i din webbläsare: ingen av listorna laddas upp någonstans, vilket är viktigt när data är en kundlista. Kopiera resultatet, ladda ned det som en .txt-fil eller skicka det direkt till ett annat verktyg för vidare arbete.

FAQ

Vad räknas som en matchning?
Vilket som helst par av poster – en från varje lista – vars likhetsscore är på eller över den tröskel du anger. Sänk tröskeln för att fånga svagare matchningar, eller höj den för att bara acceptera nästan identiska poster.
Vad är skillnaden mellan de två måtten?
Levenshtein-avstånd räknar ändringar av enskilda tecken och fungerar bra för korta strängar som namn eller koder. Teckentrigram-likhet jämför överlappande tresiffriga fragment och är mer förlåtande för omordnad eller kraftigt omskriven text.
Kan en post matchas mer än en gång?
Bara om du stänger av "Matcha varje post högst en gång". Med det på är varje post ihopkopplad med sin enda bästa match på andra sidan; med det av kan en post visas i varje par som klarar tröskeln.
Hur stora listor kan jag jämföra?
Verktyget varnar och stannar istället för att frysa fliken om de två listorna tillsammans skulle kräva ett orimligt antal jämförelser. För vanliga listor med namn, e-postadresser eller korta poster är tusentals poster på varje sida bra.
Laddas mina data upp någonstans?
Nej. Båda listorna jämförs helt i din webbläsare och lämnar aldrig din enhet.