Extraer el texto de un PDF
Obtén el texto sin formato de un documento en un archivo simple que puedes buscar, pegar, comparar o pasar a otro programa.
Extraer el texto de un PDF en línea
Extraer el texto es lo que necesitas cuando el formato estorba: quieres las palabras en sí, para buscarlas, pegarlas en un script, comparar dos revisiones o pasárselas a algo que solo lee texto plano. PDF Vision lee el documento en el servidor con Poppler, el mismo motor pdftotext que se usa en todo Linux, y devuelve el texto de cada página por separado además de un bloque combinado, descargable como archivo .txt. La condición importante es que el PDF contenga texto de verdad. Un archivo generado por Word, por un programa de contabilidad o por una exportación web lo contiene. Un escaneo no: es una imagen de palabras, y ningún extractor encontrará caracteres que nunca se escribieron en el archivo. Cuando el resultado sale vacío o casi vacío, ese es el motivo, y la herramienta te lo dice y te remite al OCR, que primero reconoce las letras de la imagen. Archivos de hasta 10 MB y 100 páginas, procesados en nuestros servidores, por lo que se requiere una cuenta.
Cómo funciona
Sube el PDF
Hasta 10 MB y 100 páginas. El documento debe tener texto seleccionable: si puedes resaltar una palabra en un lector, se podrá extraer.
Se lee el texto
Poppler lee el documento en el servidor y devuelve el texto de cada página, por separado, además de un bloque combinado.
Descarga el .txt
Guarda el archivo de texto plano o copia directamente desde la página lo que necesites.
Por qué usarlo
Texto plano, no una nueva maquetación
Convertir a Word intenta reconstruir el diseño y puede reordenar cosas. La extracción te da las palabras tal cual, que es lo que de verdad necesita un script, una búsqueda o una comparación.
Página a página y completo
Cada página se devuelve por separado, así que puedes citar una página concreta o procesar un documento página a página en lugar de desenredar un único bloque largo.
Te avisa cuando el PDF es un escaneo
Un resultado vacío se diagnostica en lugar de quedar como un misterio: un documento sin capa de texto se señala y se te envía al OCR en lugar de volver a intentar lo mismo.