OCR para PDF

Escolha um PDF digitalizado

Apenas PDF · 20 MB · 40 páginas

ou solte um PDF aqui

Use esta ferramenta quando um PDF tiver imagens de páginas digitalizadas, e não texto selecionável. Ela renderiza as páginas e executa o reconhecimento óptico de caracteres (OCR) no navegador, depois mostra o texto simples reconhecido para você revisar, copiar ou salvar em um arquivo .txt. O PDF original permanece no seu dispositivo. A ferramenta não cria um PDF pesquisável nem preserva o layout das páginas, e o resultado do OCR pode conter erros.

Como extrair texto de um PDF digitalizado

  1. 1

    Escolha o idioma do documento

    Selecione o idioma principal do texto impresso. Essa escolha determina qual modelo de OCR o navegador usará.

  2. 2

    Abra o PDF

    Escolha um PDF de até 20 MB e 40 páginas. O arquivo original permanece no navegador e não é enviado ao nosso servidor.

  3. 3

    Aguarde o reconhecimento

    O navegador renderiza cada página e faz a leitura com o modelo de OCR selecionado. Talvez seja preciso baixar os arquivos do modelo antes de começar.

  4. 4

    Confira o resultado

    Compare nomes, números e trechos importantes com as páginas originais. O OCR é um recurso auxiliar, não uma transcrição confiável para uso crítico.

  5. 5

    Copie ou baixe o texto

    Copiar e baixar o TXT localmente mantêm o resultado no navegador. Somente a criação opcional de uma página de download envia o arquivo de texto derivado para um link protegido.

O que esta ferramenta produz

O resultado é texto simples, com um marcador antes do conteúdo reconhecido em cada página. A ferramenta não:

  • adiciona uma camada de texto invisível ao PDF
  • recria colunas, tabelas, formulários ou a tipografia original
  • preserva o layout visual da página
  • traduz o documento
  • verifica se o texto reconhecido está correto

Se você precisa manter as páginas digitalizadas e adicionar texto pesquisável por trás delas, use um aplicativo específico para PDF pesquisável ou um programa de OCR para computador.

Documentos que funcionam melhor

O OCR foi feito para texto impresso. Uma digitalização reta, nítida e com bom contraste é mais fácil de reconhecer do que uma foto borrada, um fax desbotado ou uma página danificada. Fontes decorativas, escrita à mão, notação matemática, colunas muito próximas e tabelas complexas podem gerar texto ruim ou fora de ordem.

A ferramenta aceita PDFs de até 20 MB e 40 páginas. O reconhecimento acontece página por página e pode consumir bastante memória, especialmente em páginas grandes ou de alta resolução. Se o navegador ficar sem memória, divida o PDF em arquivos menores e processe-os separadamente.

Idiomas de OCR disponíveis

Você pode escolher inglês, espanhol, francês, alemão, italiano, português, holandês, russo, japonês, chinês simplificado, coreano ou árabe.

Escolha o idioma principal do documento antes de abrir o arquivo. Uma página que mistura idiomas ou sistemas de escrita pode precisar de processamentos separados e, mesmo assim, caracteres parecidos podem ser confundidos.

Revise o texto reconhecido

Sempre compare o resultado com o PDF original antes de usá-lo. Preste atenção especial a:

  • nomes, endereços e números de identificação
  • datas, valores, separadores decimais e sinais de menos
  • instruções jurídicas, médicas, financeiras ou de segurança
  • quebras de página e ordem de leitura em documentos com várias colunas

Não trate o resultado do OCR como uma cópia oficial de um documento importante.

Tratamento dos arquivos e downloads

O PDF original é lido localmente no navegador. Ele não é incluído na URL do funil nem enviado ao nosso servidor. O navegador pode baixar do provedor configurado as bibliotecas de renderização de PDF e OCR, além do modelo do idioma escolhido.

Copiar mantém o texto reconhecido no navegador e o grava na área de transferência. Baixar TXT localmente cria e salva o arquivo .txt sem enviá-lo. Somente se você escolher Criar uma página de download o TXT derivado será enviado para gerar um link protegido, onde poderá ser mantido por até 7 dias. O download local continua disponível se esse envio opcional falhar.

Perguntas frequentes

Não. O PDF original permanece no navegador enquanto as páginas são renderizadas e reconhecidas. O navegador pode baixar as bibliotecas necessárias e o modelo de idioma selecionado. O download local também não envia o texto; somente a página de download opcional envia o TXT derivado.

Não. O resultado é texto simples agrupado por página. A ferramenta não modifica o PDF original, não adiciona uma camada de texto invisível nem preserva o layout.

Você deve compará-lo com as páginas originais. O OCR pode confundir caracteres, omitir texto e mudar a ordem de leitura. Confira todos os detalhes antes de usar o resultado em atividades jurídicas, médicas, financeiras, de segurança ou em qualquer outro trabalho crítico.

A ferramenta foi criada para texto impresso. Escrita à mão, equações e fontes decorativas podem ter resultados pouco confiáveis. Os caracteres de uma tabela podem ser reconhecidos, mas a estrutura de linhas e colunas não é preservada no texto simples.

Inglês, espanhol, francês, alemão, italiano, português, holandês, russo, japonês, chinês simplificado, coreano e árabe. Selecione o idioma principal antes de abrir o PDF.

O PDF pode ter até 20 MB e 40 páginas. Páginas grandes ou muito detalhadas ainda podem ultrapassar a memória disponível no navegador; nesse caso, divida o documento em arquivos menores.

Baixar TXT localmente cria o arquivo .txt e o salva diretamente no dispositivo, sem enviá-lo. Se você criar uma página de download, somente esse TXT derivado será enviado para um link protegido e poderá ser mantido por até 7 dias.

Ferramentas relacionadas