Removedor de linhas duplicadas

Uma exportação CSV com linhas repetidas, um arquivo de log com entradas duplicadas, uma lista de palavras-chave montada a partir de três fontes sobrepostas: sempre que seu texto contém linhas idênticas, este removedor as une e mantém a primeira ocorrência na posição original. Duas opções de correspondência, com ou sem diferenciar maiúsculas e minúsculas, corte opcional de espaços e uma contagem de quantas linhas foram removidas.

Como remover linhas duplicadas

  1. 1

    Cole o texto

    Cole uma lista, um log, uma coluna CSV ou qualquer texto em que cada entrada ocupe a própria linha.

  2. 2

    Escolha as opções de correspondência

    "Diferenciar maiúsculas e minúsculas" mantém `Apple` e `apple` como linhas separadas; desativando, elas são unidas. "Cortar espaços" remove os espaços no início e no fim antes da comparação.

  3. 3

    Remova duplicados

    Clique no botão. A primeira ocorrência de cada linha é mantida e as repetições seguintes são removidas.

  4. 4

    Confira e copie

    As estatísticas mostram linhas originais, linhas únicas e duplicados removidos. Copie o texto limpo quando estiver correto.

Como funciona a correspondência

Opção Comportamento
Diferenciar maiúsculas e minúsculas (padrão) Apple e apple são mantidas como linhas separadas
Não diferenciar maiúsculas e minúsculas Apple e apple contam como a mesma linha
Cortar espaços (padrão) hello” e “hello ” são tratadas como a mesma linha

A primeira ocorrência de cada linha é mantida, então a ordem original do texto permanece intacta.

Casos de uso comuns

  • Limpeza de CSV. Cole uma única coluna (nomes, e-mails, SKUs) e remova repetições antes de religá-la às demais colunas.
  • Listas de URLs. Consolide listas de URLs coletadas em que a mesma página aparece muitas vezes.
  • Pesquisa de palavras-chave. Mesclar exportações de palavras-chave de várias ferramentas inevitavelmente produz duplicados.
  • Listas de e-mail. Antes de importar para um CRM, remova duplicados exatos para evitar erros de “já existe”.
  • Triagem de arquivos de log. Remova linhas de aviso repetidas para ver os problemas únicos.

O que a ferramenta não faz

  • Sem deduplicação por coluna. Um CSV com email,name em que o e-mail se repete mas o nome difere mantém as duas linhas, porque as linhas completas são diferentes. Para deduplicar por uma coluna, extraia-a primeiro, remova os duplicados dela e use-a como chave para filtrar o arquivo original.
  • Sem proteção de cabeçalho. Cada linha é tratada como dados, então uma linha de cabeçalho repetida é removida como qualquer outra.
  • Sem correspondência aproximada. Linhas que diferem por um erro de digitação, espaços internos ou pontuação não são unidas.

Dicas

  • Normalize antes de comparar. Passe para minúsculas e remova a pontuação ao redor para que “Apple, “, “ apple “ e “Apple” contem como uma entrada.
  • Guarde uma cópia do texto original antes de limpezas grandes.
  • Confira as estatísticas. Se você esperava 10 por cento de duplicados e 80 por cento foram removidos, algo está errado com a entrada.

Perguntas frequentes

A primeira. A ordem do texto original é preservada, então cada linha única permanece na posição original.

Não automaticamente. Cada linha, incluindo o cabeçalho, é comparada como qualquer outra. Se uma linha posterior for igual ao cabeçalho, ela é removida. Guarde o cabeçalho separadamente se precisar dele.

Este removedor é focado na correspondência exata por velocidade. Para correspondência aproximada (erros de digitação, maiúsculas diferentes, pontuação extra), use uma ferramenta de deduplicação dedicada com um limite de similaridade.

Sim. O texto é enviado ao nosso servidor para que a ferramenta possa processá-lo, e o resultado aparece na página. O texto não é armazenado depois.

Ferramentas relacionadas

Ferramenta disponível em outros idiomas