Deduplicador de CSV

Duplicatas se infiltram nas exportações de CSV de maneiras irritantes: entregas de webhook repetidas, dois relatórios concatenados manualmente ou uma junção que espalhou linhas que você não esperava. Este deduplicador hash cada linha de dados e mantém apenas a primeira ocorrência, de modo que a saída preserva sua ordem original de linhas enquanto descarta silenciosamente as cópias. A linha de cabeçalho é opcional, ative o botão se seu arquivo começar diretamente com dados.

Como funciona a deduplicação

  1. 1

    Cole o CSV

    Inclua ou exclua a linha de cabeçalho; use a caixa de seleção para informar à ferramenta qual é.

  2. 2

    Cada linha é hashada

    As linhas são analisadas em arrays e um MD5 de sua representação JSON é usado como a chave de unicidade.

  3. 3

    Primeiro visto vence

    A primeira linha com um hash dado é mantida. Linhas posteriores com o mesmo conteúdo são ignoradas silenciosamente.

  4. 4

    Cabeçalho preservado

    Se o modo de cabeçalho estiver ativado, a linha 1 é sempre passada sem ser deduplicada em relação aos dados.

O que conta como duplicata

O deduplicador usa igualdade de linha completa. Duas linhas são duplicatas quando cada célula corresponde, posição por posição, após a análise padrão de CSV.

Coisas que ainda contam como diferentes

Linha A Linha B Tratado como
Alice,30,Paris Alice, 30, Paris Diferente (espaços extras)
Bob,25 Bob,25, Diferente (célula vazia final)
"Jane Smith",42 Jane Smith,42 Igual (citação é a nível de analisador)
TRUE,1 true,1 Diferente (sensível a maiúsculas)

Quando uma deduplicação a nível de coluna seria mais apropriada

A correspondência de linha completa é estrita, o que geralmente é o que você deseja, mas às vezes você realmente quer “uma linha por e-mail, independentemente de outras colunas”. Nesse caso, primeiro use o Extrator de Colunas CSV para reduzir o arquivo apenas à coluna chave, dedup essa, e use o resultado como uma consulta. Ou recorra ao SQL: SELECT DISTINCT ON (email) * FROM users ORDER BY email, created_at DESC; no PostgreSQL, ou um GROUP BY com agregados MIN() em outro lugar.

Dicas práticas

  • Normalize antes de deduplicar. Remova espaços em branco e padronize a capitalização nas colunas chave primeiro, caso contrário, ALICE@EXAMPLE.COM e alice@example.com sobreviverão.
  • Classifique, depois dedup, para resultados auditáveis. Se você precisa saber qual cópia foi mantida, classifique o CSV pelo seu critério de desempate preferido (timestamp mais recente, menor ID) antes de executar o deduplicador.
  • Verifique a contagem de linhas. Use o Contador de Linhas CSV no original e na saída para confirmar quantas duplicatas foram removidas.

Perguntas frequentes

Não, ele hash linhas completas analisadas. Para unicidade de coluna única, reduza o CSV para essa coluna primeiro usando o Extrator de Colunas e depois execute o deduplicador.

A primeira ocorrência no arquivo. Classifique o CSV antes se você quiser que uma cópia específica (o registro mais recente, o menor ID, etc.) vença.

Sim. As linhas são analisadas com regras padrão de CSV, então "Jane, Smith" permanece uma única célula e é comparada como tal.

O CSV é enviado ao nosso servidor para calcular a deduplicação. Ele não é armazenado nem compartilhado e não é adicionado ao link da página.

Ferramentas relacionadas

Ferramenta disponível em outros idiomas