OCR para PDF
Esta sessão de OCR não está mais disponível
Escolha um PDF digitalizado
Apenas PDF · 20 MB · 40 páginas
ou solte um PDF aqui
Use esta ferramenta quando um PDF tiver imagens de páginas digitalizadas, e não texto selecionável. Ela renderiza as páginas e executa o reconhecimento óptico de caracteres (OCR) no navegador, depois mostra o texto simples reconhecido para você revisar, copiar ou salvar em um arquivo .txt. O PDF original permanece no seu dispositivo. A ferramenta não cria um PDF pesquisável nem preserva o layout das páginas, e o resultado do OCR pode conter erros.
Como extrair texto de um PDF digitalizado
-
1
Escolha o idioma do documento
Selecione o idioma principal do texto impresso. Essa escolha determina qual modelo de OCR o navegador usará.
-
2
Abra o PDF
Escolha um PDF de até 20 MB e 40 páginas. O arquivo original permanece no navegador e não é enviado ao nosso servidor.
-
3
Aguarde o reconhecimento
O navegador renderiza cada página e faz a leitura com o modelo de OCR selecionado. Talvez seja preciso baixar os arquivos do modelo antes de começar.
-
4
Confira o resultado
Compare nomes, números e trechos importantes com as páginas originais. O OCR é um recurso auxiliar, não uma transcrição confiável para uso crítico.
-
5
Copie ou baixe o texto
Copiar e baixar o TXT localmente mantêm o resultado no navegador. Somente a criação opcional de uma página de download envia o arquivo de texto derivado para um link protegido.
O que esta ferramenta produz
O resultado é texto simples, com um marcador antes do conteúdo reconhecido em cada página. A ferramenta não:
- adiciona uma camada de texto invisível ao PDF
- recria colunas, tabelas, formulários ou a tipografia original
- preserva o layout visual da página
- traduz o documento
- verifica se o texto reconhecido está correto
Se você precisa manter as páginas digitalizadas e adicionar texto pesquisável por trás delas, use um aplicativo específico para PDF pesquisável ou um programa de OCR para computador.
Documentos que funcionam melhor
O OCR foi feito para texto impresso. Uma digitalização reta, nítida e com bom contraste é mais fácil de reconhecer do que uma foto borrada, um fax desbotado ou uma página danificada. Fontes decorativas, escrita à mão, notação matemática, colunas muito próximas e tabelas complexas podem gerar texto ruim ou fora de ordem.
A ferramenta aceita PDFs de até 20 MB e 40 páginas. O reconhecimento acontece página por página e pode consumir bastante memória, especialmente em páginas grandes ou de alta resolução. Se o navegador ficar sem memória, divida o PDF em arquivos menores e processe-os separadamente.
Idiomas de OCR disponíveis
Você pode escolher inglês, espanhol, francês, alemão, italiano, português, holandês, russo, japonês, chinês simplificado, coreano ou árabe.
Escolha o idioma principal do documento antes de abrir o arquivo. Uma página que mistura idiomas ou sistemas de escrita pode precisar de processamentos separados e, mesmo assim, caracteres parecidos podem ser confundidos.
Revise o texto reconhecido
Sempre compare o resultado com o PDF original antes de usá-lo. Preste atenção especial a:
- nomes, endereços e números de identificação
- datas, valores, separadores decimais e sinais de menos
- instruções jurídicas, médicas, financeiras ou de segurança
- quebras de página e ordem de leitura em documentos com várias colunas
Não trate o resultado do OCR como uma cópia oficial de um documento importante.
Tratamento dos arquivos e downloads
O PDF original é lido localmente no navegador. Ele não é incluído na URL do funil nem enviado ao nosso servidor. O navegador pode baixar do provedor configurado as bibliotecas de renderização de PDF e OCR, além do modelo do idioma escolhido.
Copiar mantém o texto reconhecido no navegador e o grava na área de transferência. Baixar TXT localmente cria e salva o arquivo .txt sem enviá-lo. Somente se você escolher Criar uma página de download o TXT derivado será enviado para gerar um link protegido, onde poderá ser mantido por até 7 dias. O download local continua disponível se esse envio opcional falhar.
Perguntas frequentes
Não. O PDF original permanece no navegador enquanto as páginas são renderizadas e reconhecidas. O navegador pode baixar as bibliotecas necessárias e o modelo de idioma selecionado. O download local também não envia o texto; somente a página de download opcional envia o TXT derivado.
Não. O resultado é texto simples agrupado por página. A ferramenta não modifica o PDF original, não adiciona uma camada de texto invisível nem preserva o layout.
Você deve compará-lo com as páginas originais. O OCR pode confundir caracteres, omitir texto e mudar a ordem de leitura. Confira todos os detalhes antes de usar o resultado em atividades jurídicas, médicas, financeiras, de segurança ou em qualquer outro trabalho crítico.
A ferramenta foi criada para texto impresso. Escrita à mão, equações e fontes decorativas podem ter resultados pouco confiáveis. Os caracteres de uma tabela podem ser reconhecidos, mas a estrutura de linhas e colunas não é preservada no texto simples.
Inglês, espanhol, francês, alemão, italiano, português, holandês, russo, japonês, chinês simplificado, coreano e árabe. Selecione o idioma principal antes de abrir o PDF.
O PDF pode ter até 20 MB e 40 páginas. Páginas grandes ou muito detalhadas ainda podem ultrapassar a memória disponível no navegador; nesse caso, divida o documento em arquivos menores.
Baixar TXT localmente cria o arquivo .txt e o salva diretamente no dispositivo, sem enviá-lo. Se você criar uma página de download, somente esse TXT derivado será enviado para um link protegido e poderá ser mantido por até 7 dias.
Ferramentas relacionadas
Conversor de Excel para PDF
Converta arquivos XLSX, XLS ou CSV em um PDF A4 horizontal no navegador. Cada planilha vira uma página de tabela pronta para baixar.
Conversor de PNG para PDF
Junte capturas, digitalizações ou exportações PNG em um só PDF. Escolha páginas A4 ou Carta, orientação e margens antes de baixar.
Adicionar páginas em branco ao PDF
Adicione de 1 a 50 páginas em branco a um PDF existente. Escolha A4, Letter, Legal, A3 ou A5, retrato ou paisagem, e insira no início, no fim, antes ou depois de um número de página.
Conversor de PDF para Excel
Detecte tabelas regulares em um PDF com texto e baixe arquivos XLSX, CSV ou TSV locais. Revise cada tabela antes de exportar. Limite: 20 MiB e 150 páginas.
Compactar PDF
Comprima arquivos PDF no navegador recriando as páginas como PDFs menores baseados em JPEG.
Mesclar PDF e imagens
Combine PDFs e imagens JPG ou PNG em um único PDF, ordene os arquivos enviados e baixe o documento pelo navegador.