Ir para o conteúdo
Totalmente local

Correspondência difusa de listas

Emparelhe itens de duas listas, mesmo quando diferem por erros ortográficos, espaçamento ou acentos.

Entrada
Lista B
70

Correspondência difusa de listas

Cole duas listas e esta ferramenta emparelha os itens semelhantes, mesmo quando não são escritos de forma idêntica. Resolve a confusão do dia a dia que a correspondência exata não consegue: uma lista de clientes onde "Jonathan Smith" precisa ser alinhado com "Jon Smith", uma exportação onde "café Latte" deveria corresponder a "cafe latte", ou duas colunas onde uma entrada tem uma vírgula extra que a outra não tem. Cada par recebe uma pontuação de similaridade, para você ver exatamente como é próxima a correspondência em vez de apenas adivinhar.

Duas opções controlam o quão tolerante é a comparação. O limiar de similaridade estabelece a pontuação mínima, de 0 a 100, que um par precisa para contar como correspondência. A métrica escolhe como essa pontuação é calculada: a distância de Levenshtein conta as edições necessárias para transformar um item no outro, o que funciona bem para strings curtos como nomes e códigos, enquanto a similaridade de trigramas compara fragmentos de três letras sobrepostos e lida melhor com texto reordenado ou parcialmente reescrito. Ignorar diacríticos, ignorar maiúsculas/minúsculas e ignorar pontuação removem o ruído de formatação que não deveria afetar uma correspondência, e normalizar ordem de palavras permite que "Smith, Jonathan" corresponda a "Jonathan Smith" comparando palavras como um conjunto em vez de em sequência.

Por padrão, cada item corresponde no máximo uma vez ao seu contrapartida única — desative isso para permitir que um item corresponda a tudo acima do limiar, útil ao auditar quase-duplicatas em vez de vincular listas limpas. Itens sem correspondência são listados separadamente quando essa opção está ativada, portanto nada desaparece silenciosamente. Escolha pares simples para uma leitura rápida, ou CSV com pontuação para uma planilha.

Tudo é executado localmente no seu navegador: nenhuma das listas é enviada para lugar algum, o que importa quando os dados são uma lista de clientes ou contatos. Copie o resultado, baixe como arquivo .txt ou envie diretamente para outra ferramenta para continuar trabalhando.

FAQ

O que conta como uma correspondência?
Qualquer par de itens — um de cada lista — cuja pontuação de similaridade esteja no limiar que você definiu ou acima dele. Abaixe o limiar para detectar correspondências mais soltas, ou aumente-o para aceitar apenas itens quase idênticos.
Qual é a diferença entre as duas métricas?
A distância de Levenshtein conta edições de caracteres únicos e funciona bem para strings curtos como nomes ou códigos. A similaridade de trigramas compara fragmentos de três caracteres sobrepostos e é mais tolerante com texto reordenado ou bastante reescrito.
Um item pode corresponder mais de uma vez?
Apenas se você desativar "Corresponder cada item no máximo uma vez". Com isso ativado, cada item é emparelhado com sua única melhor correspondência no outro lado; com isso desativado, um item pode aparecer em cada par que atender ao limiar.
Qual é o tamanho máximo de uma lista que posso comparar?
A ferramenta avisa e para em vez de congelar a aba se as duas listas juntas exigissem um número irracional de comparações. Para listas típicas de nomes, emails ou entradas curtas, milhares de itens em cada lado funcionam bem.
Os meus dados são enviados para algum lugar?
Não. Ambas as listas são comparadas inteiramente no seu navegador e nunca saem do seu dispositivo.