Extrair texto

Extrair o texto de um PDF

Obtenha o texto bruto de um documento em um arquivo simples para buscar, colar, comparar ou passar para outro programa.

Extrair o texto de um PDF online

Extrair o texto é o que você quer quando a formatação atrapalha: você precisa das palavras em si, para buscá-las, colá-las em um script, comparar duas versões ou passá-las para algo que só lê texto puro. O PDF Vision lê o documento no servidor com o Poppler — o mesmo mecanismo pdftotext usado em todo o Linux — e devolve o texto de cada página separadamente, além de um bloco único combinado, para baixar em um arquivo .txt. A condição importante é que o PDF precisa realmente conter texto. Um arquivo gerado pelo Word, por um sistema de contabilidade ou por uma exportação da web contém. Um escaneamento não: ele é uma foto de palavras, e nenhum extrator vai encontrar caracteres que nunca foram gravados no arquivo. Quando o resultado volta vazio ou quase vazio, o motivo é esse — e a ferramenta avisa e indica o OCR, que primeiro reconhece as letras na imagem. Arquivos de até 10 MB e 100 páginas, processados nos nossos servidores, por isso é preciso ter uma conta.

Como funciona

  1. Envie o PDF

    Até 10 MB e 100 páginas. O documento deve ter texto selecionável — se você consegue destacar uma palavra em um leitor, a extração funciona.

  2. O texto é lido

    O Poppler lê o documento no servidor e devolve o texto de cada página, separado, além de um bloco único combinado.

  3. Baixe o .txt

    Salve o arquivo de texto puro ou copie direto da página o que você precisa.

Por que usar

Texto puro, não uma nova diagramação

Converter para Word tenta reconstruir o layout e pode reorganizar as coisas. A extração entrega as palavras como elas são, que é o que um script, uma busca ou uma comparação realmente precisam.

Página por página e também inteiro

Cada página vem separada, então você pode citar uma página específica ou processar um documento uma página por vez, em vez de desembaraçar um bloco enorme.

Avisa quando o PDF é escaneado

Um resultado vazio é diagnosticado em vez de virar mistério: um documento sem camada de texto é sinalizado, e você é direcionado ao OCR em vez de tentar a mesma coisa de novo.

Perguntas frequentes

Não saiu nada, ou quase nada. Por quê?
Quase com certeza porque o PDF é escaneado. Uma página escaneada é uma imagem de palavras, não palavras: não há caracteres no arquivo para um extrator encontrar. Rodar o OCR antes reconhece as letras na imagem e cria uma camada de texto; depois disso, a extração funciona normalmente.
O layout é preservado?
Não, e essa é a ideia. Você recebe o texto, não o design — sem colunas, sem bordas de tabela, sem fontes. Se o documento precisa continuar sendo um documento, converta para Word. Se você precisa das palavras para uma busca, um script ou uma comparação, a extração é a ferramenta certa.
Quais são os limites?
Arquivos de até 10 MB e 100 páginas. O texto de cada página vem separado e também combinado, e o download é um arquivo .txt simples.
As tabelas são extraídas como tabelas?
Não. Uma tabela vira o texto que ela contém, na ordem de leitura, sem a grade. Para manter linhas e colunas como células, use o conversor de PDF para Excel, que reconstrói a estrutura da tabela em vez de achatá-la.
Preciso de uma conta?
Sim — a extração roda nos nossos servidores, por isso exige login. Criar uma conta é grátis.