Correspondência de Lista Difusa

Conciliando uma exportação de CRM com uma planilha de clientes de fatura, ou combinando nomes de fornecedores de dois ERPs diferentes, quase sempre quebra em pequenas diferenças, “Acme Corp.” vs “ACME Corporation” vs “acme corp”. Cole ambas as listas, defina um limite de similaridade e a ferramenta sugere o melhor candidato na lista B para cada entrada na lista A, sinalizando os que estão abaixo do limite para revisão manual.

Como combinar duas listas desordenadas

  1. 1

    Cole a lista A

    Uma entrada por linha, nomes de clientes, códigos de produtos, endereços.

  2. 2

    Cole a lista B

    O pool de candidatos. Diferenças em maiúsculas, espaçamento e erros de digitação são aceitáveis.

  3. 3

    Defina um limite

    Porcentagem de similaridade acima da qual uma correspondência é aceita (70% é um padrão sensato).

  4. 4

    Leia o relatório

    Cada item A é emparelhado com o melhor candidato B e uma pontuação de confiança. Itens abaixo do limite são marcados para revisão.

Como a similaridade é medida

A ferramenta usa similar_text do PHP (uma pontuação de subsequência comum mais longa) e relata o resultado como uma porcentagem. Quanto maior, melhor; uma correspondência exata é 100%.

Limite Comportamento
≥ 95% Quase idêntico, apenas diferenças em maiúsculas ou espaços
80–94% Erros de digitação, pontuação faltando, sufixos truncados
60–79% Mudanças na ordem das palavras, abreviações vs formas completas
< 60% Provavelmente não é uma correspondência real, revisar manualmente

Dicas

  • Normalize primeiro se você conhece o ruído comum: minúsculas, remover pontuação, colapsar espaços em branco. Você obterá pontuações mais precisas.
  • Remova sufixos de empresa (“Inc”, “Ltd”, “GmbH”) se aparecerem de forma inconsistente em uma lista, mas não na outra.
  • Divida endereços longos, combinar “rua + cidade” separadamente é melhor do que combinar uma linha concatenada.
  • Cuidado com um-para-muitos. A ferramenta escolhe a melhor correspondência B por entrada A; não impede que o mesmo B corresponda a várias linhas A.

Quando usar um algoritmo mais rigoroso

Para grandes trabalhos de deduplicação, a distância de Levenshtein ou Jaro–Winkler superam similar_text, especialmente em nomes onde a posição dos caracteres importa. Se a correspondência difusa influencia a cobrança ou fusões, verifique 20 pares aleatórios antes de confiar na saída em grande escala.

Perguntas frequentes

70% captura a maioria das correspondências legítimas enquanto sinaliza erros reais. Aperte para 85% se a lista B estiver limpa e você não puder se dar ao luxo de falsos positivos; afrouxe para 55% se ambas as listas estiverem desordenadas e você planeja revisar tudo manualmente.

Sim, mas normalize primeiro, remova espaços, traços e prefixos de código de país, coloque os e-mails em minúsculas. A correspondência difusa em valores brutos relatará pontuações baixas para entradas estruturalmente idênticas.

Internamente, a ferramenta coloca ambos os lados em minúsculas antes de comparar, então “Apple” e “apple” têm pontuação de 100%.

Sim, a correspondência é executada no lado do servidor, então suas duas listas são enviadas à ferramenta para serem comparadas. Elas são processadas em memória durante essa única solicitação e não são armazenadas nem registradas depois.

Ferramentas relacionadas

Ferramenta disponível em outros idiomas