Extrair Números de Telefone do Texto

Cole qualquer texto que misture prosa, assinaturas ou HTML raspado, e extraia todos os números de telefone que ele contém. O extrator reconhece formatos norte-americanos (xxx) xxx-xxxx, formas europeias separadas por espaços, compactas internacionais +CC..., e os estilos soltos que as pessoas digitam em e-mails (555.123.4567, +44 20 7946 0958). A saída é retornada na forma em que foi encontrada, para que você possa normalizar mais tarde contra uma biblioteca como libphonenumber.

Como extrair números de telefone

  1. 1

    Cole a fonte

    Insira o texto: páginas de contato, assinaturas de e-mail, exportações CSV, registros de chat.

  2. 2

    Execute a varredura

    A regex percorre o texto em busca de sequências de dígitos com pelo menos 7 dígitos mais separadores reconhecíveis ou códigos de país.

  3. 3

    Revise as correspondências

    Os resultados mostram um candidato por linha, com duplicatas removidas automaticamente. Revise a lista para identificar falsos positivos (números de pedido, datas) e corrija o texto de origem se algo tiver passado.

  4. 4

    Copie ou exporte

    Pegue a lista limpa como texto simples, um número por linha, pronta para seu CRM ou discador.

Formatos de números de telefone que reconhece

Os números de telefone são confusos porque cada país tem sua própria convenção e as pessoas ignoram as regras de qualquer maneira. O extrator visa os formatos práticos que você vê em texto real.

Formatos aceitos (exemplo)

Formato Exemplo Notas
E.164 +14155552671 Padrão ouro; use isso para armazenamento.
Internacional espaçado +44 20 7946 0958 Linha fixa do Reino Unido com grupos separados por espaços.
Norte-Americano NANP (415) 555-2671 Parênteses ao redor do código de área.
Norte-Americano pontuado 415.555.2671 Comum em assinaturas de e-mail.
Local europeu 020 7946 0958 Prefixo de tronco com zero à frente.
Mexicano 10 dígitos 55 1234 5678 Sem código de país.

Falsos positivos a observar

  • Números de pedido e rastreamento. Um número de rastreamento da FedEx de 13 dígitos pode parecer um número de telefone se escrito com espaços. Inspecione o contexto circundante.
  • Datas. 2024 09 15 pode corresponder a um padrão de 7+ dígitos dependendo do modo regex. Filtre datas primeiro se sua fonte for rica em datas.
  • Números de cartão de crédito. Grupos de 16 dígitos na forma 4xxx xxxx xxxx xxxx podem corresponder. Mascare os dados PCI antes da extração.

Dica: normalize antes de armazenar

Entradas diferentes para o mesmo número real são a raiz da dor de deduplicação do CRM. Uma rápida passagem com uma biblioteca que entende as regras do país (libphonenumber, phonenumbers em Python, laravel-phone em PHP) converterá tudo para E.164, o único formato que você deve manter em um banco de dados.

Perguntas frequentes

O extrator retorna a correspondência bruta; a inferência do país requer um pacote de dados de códigos de discagem e regras de comprimento. Se você só se importa com o prefixo +CC, essa parte é mantida literalmente na saída.

O extrator retorna apenas o número principal; uma extensão em linha como 555-2671 ext. 123 não faz parte da correspondência. Para armazenamento estrito em E.164, separe tudo o que vier depois de ext, x ou # em um campo próprio.

Sim, números gratuitos dos EUA (800, 888, 877, 866, 855, 844, 833) correspondem ao padrão normal do NANP. Números gratuitos locais do Reino Unido 0800 e formas semelhantes também aparecem porque se parecem com linhas fixas regulares.

Nenhuma cópia da sua entrada é mantida uma vez que a resposta de extração é enviada; o processamento acontece na memória dentro da solicitação.

Ferramentas relacionadas

Ferramenta disponível em outros idiomas