Criador de PDF pesquisável

Escolha um PDF digitalizado

Apenas PDF · 10 MB

Apenas PDF, até 10 MB e 10 páginas

Um PDF escaneado, na verdade, é só uma pilha de imagens dentro de um contêiner PDF, então você não consegue destacar, copiar nem pesquisar o texto. Esta ferramenta aplica reconhecimento óptico de caracteres (OCR) em cada página no seu navegador e incorpora o resultado como uma camada de texto invisível alinhada à página original. A aparência da página é preservada, enquanto o Ctrl+F e a seleção de texto podem usar as palavras reconhecidas. O reconhecimento pode cometer erros, e o resultado não é um PDF acessível com marcação. Por isso, confira os trechos importantes com o escaneamento.

Como aplicar OCR em um PDF escaneado

  1. 1

    Envie o escaneamento

    Arraste um PDF escaneado (contratos, notas fiscais, relatórios arquivados). Texto impresso funciona melhor; letra à mão, não.

  2. 2

    Escolha o idioma

    Escolha o idioma do documento (inglês, espanhol, francês, alemão, italiano, português ou holandês) para o motor de OCR carregar o modelo de caracteres certo.

  3. 3

    Rode o reconhecimento

    Cada página é renderizada em alta resolução no seu navegador e enviada ao motor de OCR. Documentos longos podem levar alguns minutos.

  4. 4

    Camada de texto incorporada

    As palavras reconhecidas são colocadas como uma camada invisível alinhada à página original, então cada página fica inalterada.

  5. 5

    Baixe o novo PDF

    Receba um PDF que mantém os escaneamentos originais e agora é pesquisável em qualquer leitor moderno.

Quando o OCR funciona bem (e quando não)

A qualidade do OCR depende do escaneamento. Sempre compare nomes, números e formulações jurídicas importantes com a página original.

Entrada O que esperar
Escaneamento limpo de texto impresso Muitas vezes dá bons resultados; revise o texto importante.
Foto de uma página impressa O resultado depende de foco, iluminação e ângulo da página.
Livro antigo ou impressão de máquina de escrever desbotada Revise com cuidado o texto reconhecido.
Letra à mão ou cursiva Não é compatível de forma confiável.
Recibos ou impressão térmica Revise com cuidado números e caracteres apagados.
Forte transparência do verso Os resultados podem estar incompletos ou imprecisos.

PDF pesquisável e PDF só de imagem

  • PDF só de imagem: bitmaps puros, sem texto. O que o seu escâner produz por padrão.
  • PDF pesquisável: bitmaps mais uma camada de texto invisível (o que esta ferramenta gera). Aparência idêntica, o Ctrl+F funciona.
  • PDF/A: um subconjunto de PDF para arquivamento que incorpora as próprias fontes e proíbe recursos externos, muitas vezes exigido por tribunais e arquivos. Esta ferramenta gera um PDF pesquisável comum, não um PDF/A certificado; converta e valide com uma ferramenta de PDF/A dedicada se o seu fluxo exigir.

Dicas para melhores resultados

  • Comece com cerca de 300 DPI. Muitas vezes é um bom equilíbrio entre detalhes legíveis e tempo de processamento. Uma resolução maior usa mais tempo e memória.
  • Endireite antes do OCR. A maioria dos escâneres oferece giro automático; mesmo uma pequena inclinação pode reduzir a qualidade do reconhecimento.
  • Um idioma por rodada. O motor reconhece um só idioma por vez, então escolha o predominante. Para um documento bilíngue, rode uma vez para cada idioma e fique com o melhor resultado.
  • Guarde sempre o original. O OCR introduz pequenos erros; a camada invisível é uma conveniência, não uma prova.

Perguntas frequentes

O conteúdo original da página é preservado. O texto reconhecido é adicionado como uma camada invisível alinhada a ele, então a aparência da página deve permanecer inalterada. Revise o resultado se a fidelidade visual exata for importante.

Sete idiomas em alfabeto latino: inglês, espanhol, francês, alemão, italiano, português e holandês. Escolha o que corresponde ao seu documento. Alfabetos como o cirílico, o árabe e o CJK (chinês, japonês, coreano) não estão disponíveis nesta ferramenta.

Não de forma confiável. Esta ferramenta é destinada a texto impresso. O reconhecimento de escrita à mão é outra tecnologia, então revise ou transcreva separadamente o material manuscrito.

Não. O resultado é um PDF pesquisável comum: as imagens originais das páginas mais uma camada de texto OCR invisível. Não é um arquivo PDF/A certificado para arquivamento. Se o seu fluxo exige PDF/A, converta e valide o resultado com uma ferramenta de PDF/A dedicada.

O OCR roda inteiramente no seu navegador, então o PDF de origem não é enviado a um servidor para o reconhecimento. Um download local comum permanece no seu dispositivo. Somente se você escolher Criar uma página de download o PDF pesquisável final será enviado ao nosso servidor. O PDF de origem permanece local, e o resultado enviado é mantido por até 7 dias.

Ferramentas relacionadas