Tabela PDF para CSV
Escolha um PDF com texto
Converta tabelas simples e textuais de um PDF em arquivos CSV ou TSV sem enviar o documento a um servidor. O navegador agrupa fragmentos de texto pela posição visível e procura colunas recorrentes. Revise cada tabela detectada: este é um detector conservador que faz uma estimativa, não uma garantia de linhas e colunas perfeitas em layouts complexos.
Como extrair uma tabela PDF em CSV
-
1
Escolha um PDF com texto
Selecione um PDF de até 20 MiB e 150 páginas. Uma digitalização composta apenas por imagens precisa passar por OCR primeiro.
-
2
Detecte as tabelas no navegador
O detector usa as coordenadas visíveis do texto, inclusive a rotação e a CropBox, e procura posições repetidas de linhas e colunas.
-
3
Revise e escolha o formato
Selecione as tabelas desejadas e confira as linhas. Escolha vírgula, ponto e vírgula ou tabulação, além do marcador UTF-8 e da proteção contra fórmulas.
-
4
Baixe as tabelas escolhidas
Cada tabela selecionada gera localmente seu próprio arquivo CSV ou TSV. Tabelas não são unidas entre páginas.
O que o detector consegue inferir
Um PDF normalmente armazena uma tabela como fragmentos de texto em coordenadas, não como uma grade real de células. A ferramenta agrupa fragmentos na mesma linha visível, une trechos próximos e conserva posições de coluna repetidas em várias linhas. Tabelas de texto regulares oferecem os melhores resultados. Células mescladas ou quebradas e layouts decorativos podem exigir correção manual.
A rotação da página e uma CropBox deslocada são normalizadas. Em linhas predominantemente escritas da direita para a esquerda, a ordem das colunas segue a direção da camada de texto do PDF. Várias tabelas regulares em uma página podem ser detectadas separadamente, mas uma tabela que continua na página seguinte não é unida.
| Layout do PDF | Resultado provável | O que conferir |
|---|---|---|
| Exportação limpa com colunas regulares | Em geral, o melhor caso | Cabeçalhos, decimais e células vazias |
| Valor ausente em uma linha regular | Célula vazia na coluna inferida | Se a coluna correta ficou vazia |
| Célula mesclada ou com quebra | O texto pode deslocar ou se dividir | Compare a prévia com o PDF |
| Várias tabelas regulares em uma página | Podem ser detectadas como tabelas numeradas separadas | Um arquivo por tabela selecionada |
| Página digitalizada como imagem | Nenhuma tabela | Faça OCR primeiro |
Além de 20 MiB e 150 páginas, há limites de segurança para fragmentos de texto e caracteres. Um PDF muito fragmentado pode parar antes.
CSV, TSV e segurança da planilha
Escolha vírgula ou ponto e vírgula para CSV, ou tabulação para TSV. Os registros terminam em CRLF. Um campo que contenha o separador ativo, aspas, retorno de carro ou quebra de linha é envolvido por aspas duplas, e aspas internas são duplicadas. Essas são as regras comuns do RFC 4180, adaptadas ao separador escolhido.
A proteção contra fórmulas vem ativada. Se uma célula começar, após espaços, com =, +, - ou @, inclusive variantes de largura cheia compatíveis, a ferramenta acrescenta um apóstrofo. Isso altera o valor, mas ajuda a planilha a tratá-lo como texto. Desativar a proteção preserva o texto bruto, porém conteúdo semelhante a fórmula em um PDF não confiável pode ser perigoso. A orientação da OWASP sobre CSV Injection explica por que nenhuma mitigação é universal.
O marcador UTF-8 opcional ajuda alguns aplicativos a reconhecer texto não latino. Confira o arquivo antes de usá-lo em contabilidade, relatórios ou importações automáticas.
Estado privado das etapas
O PDF, as tabelas detectadas e as escolhas permanecem neste navegador. Eles ficam em armazenamento local limitado por até 30 minutos para preservar as três etapas. Os downloads são criados localmente e esta ferramenta não envia nada. Recomeçar remove a tarefa atual, e o navegador pode apagar os dados antes.
Perguntas frequentes
Não. A leitura, a detecção e a criação do CSV ou TSV acontecem no navegador. A tarefa fica por até 30 minutos em armazenamento local limitado e cada download é local.
Não sem preparação. Uma digitalização somente de imagens não tem camada de texto com posições. Faça OCR primeiro e use o PDF textual resultante.
Escolha vírgula, ponto e vírgula ou tabulação. Os registros usam CRLF; campos com separador, aspas ou fim de linha são colocados entre aspas, e aspas internas são duplicadas. Tabulação produz .tsv.
Ela adiciona um apóstrofo a células que começam, após espaços, com =, +, - ou @. Vem ativada e altera esses valores. Desative somente se precisar do texto bruto e confiar no PDF.
A detecção usa posições do texto, não células reais. Quebras, mesclagens, espaços incomuns e direções mistas podem deslocar valores. Compare cada prévia com a origem.
Ela pode detectar separadamente várias tabelas regulares em uma página e permite selecioná-las. Cada uma gera um arquivo. Uma tabela que continua na página seguinte não é unida.
Ferramentas relacionadas
Conversor de Excel para PDF
Converta arquivos XLSX, XLS ou CSV em um PDF A4 horizontal no navegador. Cada planilha vira uma página de tabela pronta para baixar.
Conversor de PNG para PDF
Junte capturas, digitalizações ou exportações PNG em um só PDF. Escolha páginas A4 ou Carta, orientação e margens antes de baixar.
Adicionar páginas em branco ao PDF
Adicione de 1 a 50 páginas em branco a um PDF existente. Escolha A4, Letter, Legal, A3 ou A5, retrato ou paisagem, e insira no início, no fim, antes ou depois de um número de página.
Conversor de PDF para Excel
Detecte tabelas regulares em um PDF com texto e baixe arquivos XLSX, CSV ou TSV locais. Revise cada tabela antes de exportar. Limite: 20 MiB e 150 páginas.
Compactar PDF
Comprima arquivos PDF no navegador recriando as páginas como PDFs menores baseados em JPEG.
Mesclar PDF e imagens
Combine PDFs e imagens JPG ou PNG em um único PDF, ordene os arquivos enviados e baixe o documento pelo navegador.