Extrair o texto de um PDF
Obtenha o texto bruto de um documento em um arquivo simples para buscar, colar, comparar ou passar para outro programa.
Extrair o texto de um PDF online
Extrair o texto é o que você quer quando a formatação atrapalha: você precisa das palavras em si, para buscá-las, colá-las em um script, comparar duas versões ou passá-las para algo que só lê texto puro. O PDF Vision lê o documento no servidor com o Poppler — o mesmo mecanismo pdftotext usado em todo o Linux — e devolve o texto de cada página separadamente, além de um bloco único combinado, para baixar em um arquivo .txt. A condição importante é que o PDF precisa realmente conter texto. Um arquivo gerado pelo Word, por um sistema de contabilidade ou por uma exportação da web contém. Um escaneamento não: ele é uma foto de palavras, e nenhum extrator vai encontrar caracteres que nunca foram gravados no arquivo. Quando o resultado volta vazio ou quase vazio, o motivo é esse — e a ferramenta avisa e indica o OCR, que primeiro reconhece as letras na imagem. Arquivos de até 10 MB e 100 páginas, processados nos nossos servidores, por isso é preciso ter uma conta.
Como funciona
Envie o PDF
Até 10 MB e 100 páginas. O documento deve ter texto selecionável — se você consegue destacar uma palavra em um leitor, a extração funciona.
O texto é lido
O Poppler lê o documento no servidor e devolve o texto de cada página, separado, além de um bloco único combinado.
Baixe o .txt
Salve o arquivo de texto puro ou copie direto da página o que você precisa.
Por que usar
Texto puro, não uma nova diagramação
Converter para Word tenta reconstruir o layout e pode reorganizar as coisas. A extração entrega as palavras como elas são, que é o que um script, uma busca ou uma comparação realmente precisam.
Página por página e também inteiro
Cada página vem separada, então você pode citar uma página específica ou processar um documento uma página por vez, em vez de desembaraçar um bloco enorme.
Avisa quando o PDF é escaneado
Um resultado vazio é diagnosticado em vez de virar mistério: um documento sem camada de texto é sinalizado, e você é direcionado ao OCR em vez de tentar a mesma coisa de novo.