Tabela PDF para CSV

Tabela PDF para CSV

Escolha um PDF com texto

Converta tabelas simples e textuais de um PDF em arquivos CSV ou TSV sem enviar o documento a um servidor. O navegador agrupa fragmentos de texto pela posição visível e procura colunas recorrentes. Revise cada tabela detectada: este é um detector conservador que faz uma estimativa, não uma garantia de linhas e colunas perfeitas em layouts complexos.

Como extrair uma tabela PDF em CSV

  1. 1

    Escolha um PDF com texto

    Selecione um PDF de até 20 MiB e 150 páginas. Uma digitalização composta apenas por imagens precisa passar por OCR primeiro.

  2. 2

    Detecte as tabelas no navegador

    O detector usa as coordenadas visíveis do texto, inclusive a rotação e a CropBox, e procura posições repetidas de linhas e colunas.

  3. 3

    Revise e escolha o formato

    Selecione as tabelas desejadas e confira as linhas. Escolha vírgula, ponto e vírgula ou tabulação, além do marcador UTF-8 e da proteção contra fórmulas.

  4. 4

    Baixe as tabelas escolhidas

    Cada tabela selecionada gera localmente seu próprio arquivo CSV ou TSV. Tabelas não são unidas entre páginas.

O que o detector consegue inferir

Um PDF normalmente armazena uma tabela como fragmentos de texto em coordenadas, não como uma grade real de células. A ferramenta agrupa fragmentos na mesma linha visível, une trechos próximos e conserva posições de coluna repetidas em várias linhas. Tabelas de texto regulares oferecem os melhores resultados. Células mescladas ou quebradas e layouts decorativos podem exigir correção manual.

A rotação da página e uma CropBox deslocada são normalizadas. Em linhas predominantemente escritas da direita para a esquerda, a ordem das colunas segue a direção da camada de texto do PDF. Várias tabelas regulares em uma página podem ser detectadas separadamente, mas uma tabela que continua na página seguinte não é unida.

Layout do PDF Resultado provável O que conferir
Exportação limpa com colunas regulares Em geral, o melhor caso Cabeçalhos, decimais e células vazias
Valor ausente em uma linha regular Célula vazia na coluna inferida Se a coluna correta ficou vazia
Célula mesclada ou com quebra O texto pode deslocar ou se dividir Compare a prévia com o PDF
Várias tabelas regulares em uma página Podem ser detectadas como tabelas numeradas separadas Um arquivo por tabela selecionada
Página digitalizada como imagem Nenhuma tabela Faça OCR primeiro

Além de 20 MiB e 150 páginas, há limites de segurança para fragmentos de texto e caracteres. Um PDF muito fragmentado pode parar antes.

CSV, TSV e segurança da planilha

Escolha vírgula ou ponto e vírgula para CSV, ou tabulação para TSV. Os registros terminam em CRLF. Um campo que contenha o separador ativo, aspas, retorno de carro ou quebra de linha é envolvido por aspas duplas, e aspas internas são duplicadas. Essas são as regras comuns do RFC 4180, adaptadas ao separador escolhido.

A proteção contra fórmulas vem ativada. Se uma célula começar, após espaços, com =, +, - ou @, inclusive variantes de largura cheia compatíveis, a ferramenta acrescenta um apóstrofo. Isso altera o valor, mas ajuda a planilha a tratá-lo como texto. Desativar a proteção preserva o texto bruto, porém conteúdo semelhante a fórmula em um PDF não confiável pode ser perigoso. A orientação da OWASP sobre CSV Injection explica por que nenhuma mitigação é universal.

O marcador UTF-8 opcional ajuda alguns aplicativos a reconhecer texto não latino. Confira o arquivo antes de usá-lo em contabilidade, relatórios ou importações automáticas.

Estado privado das etapas

O PDF, as tabelas detectadas e as escolhas permanecem neste navegador. Eles ficam em armazenamento local limitado por até 30 minutos para preservar as três etapas. Os downloads são criados localmente e esta ferramenta não envia nada. Recomeçar remove a tarefa atual, e o navegador pode apagar os dados antes.

Perguntas frequentes

Não. A leitura, a detecção e a criação do CSV ou TSV acontecem no navegador. A tarefa fica por até 30 minutos em armazenamento local limitado e cada download é local.

Não sem preparação. Uma digitalização somente de imagens não tem camada de texto com posições. Faça OCR primeiro e use o PDF textual resultante.

Escolha vírgula, ponto e vírgula ou tabulação. Os registros usam CRLF; campos com separador, aspas ou fim de linha são colocados entre aspas, e aspas internas são duplicadas. Tabulação produz .tsv.

Ela adiciona um apóstrofo a células que começam, após espaços, com =, +, - ou @. Vem ativada e altera esses valores. Desative somente se precisar do texto bruto e confiar no PDF.

A detecção usa posições do texto, não células reais. Quebras, mesclagens, espaços incomuns e direções mistas podem deslocar valores. Compare cada prévia com a origem.

Ela pode detectar separadamente várias tabelas regulares em uma página e permite selecioná-las. Cada uma gera um arquivo. Uma tabela que continua na página seguinte não é unida.

Ferramentas relacionadas