Extraer texto

Extraer el texto de un PDF

Obtén el texto sin formato de un documento en un archivo simple que puedes buscar, pegar, comparar o pasar a otro programa.

Extraer el texto de un PDF en línea

Extraer el texto es lo que necesitas cuando el formato estorba: quieres las palabras en sí, para buscarlas, pegarlas en un script, comparar dos revisiones o pasárselas a algo que solo lee texto plano. PDF Vision lee el documento en el servidor con Poppler, el mismo motor pdftotext que se usa en todo Linux, y devuelve el texto de cada página por separado además de un bloque combinado, descargable como archivo .txt. La condición importante es que el PDF contenga texto de verdad. Un archivo generado por Word, por un programa de contabilidad o por una exportación web lo contiene. Un escaneo no: es una imagen de palabras, y ningún extractor encontrará caracteres que nunca se escribieron en el archivo. Cuando el resultado sale vacío o casi vacío, ese es el motivo, y la herramienta te lo dice y te remite al OCR, que primero reconoce las letras de la imagen. Archivos de hasta 10 MB y 100 páginas, procesados en nuestros servidores, por lo que se requiere una cuenta.

Cómo funciona

  1. Sube el PDF

    Hasta 10 MB y 100 páginas. El documento debe tener texto seleccionable: si puedes resaltar una palabra en un lector, se podrá extraer.

  2. Se lee el texto

    Poppler lee el documento en el servidor y devuelve el texto de cada página, por separado, además de un bloque combinado.

  3. Descarga el .txt

    Guarda el archivo de texto plano o copia directamente desde la página lo que necesites.

Por qué usarlo

Texto plano, no una nueva maquetación

Convertir a Word intenta reconstruir el diseño y puede reordenar cosas. La extracción te da las palabras tal cual, que es lo que de verdad necesita un script, una búsqueda o una comparación.

Página a página y completo

Cada página se devuelve por separado, así que puedes citar una página concreta o procesar un documento página a página en lugar de desenredar un único bloque largo.

Te avisa cuando el PDF es un escaneo

Un resultado vacío se diagnostica en lugar de quedar como un misterio: un documento sin capa de texto se señala y se te envía al OCR en lugar de volver a intentar lo mismo.

Preguntas frecuentes

No ha salido nada, o casi nada. ¿Por qué?
Casi seguro porque el PDF es un escaneo. Una página escaneada es una imagen de palabras, no palabras: en el archivo no hay caracteres que un extractor pueda encontrar. Pasar primero el OCR reconoce las letras de la imagen y genera una capa de texto; después, la extracción funciona con normalidad.
¿Se conserva el diseño?
No, y precisamente de eso se trata. Obtienes el texto, no el diseño: ni columnas, ni bordes de tabla, ni fuentes. Si necesitas que el documento siga siendo un documento, conviértelo a Word. Si necesitas las palabras para una búsqueda, un script o una comparación, la extracción es la herramienta adecuada.
¿Cuáles son los límites?
Archivos de hasta 10 MB y 100 páginas. El texto de cada página se devuelve por separado y también combinado, y la descarga es un simple archivo .txt.
¿Las tablas se extraen como tablas?
No. Una tabla se convierte en el texto que contiene, en orden de lectura, sin la cuadrícula. Para conservar filas y columnas como celdas, usa el conversor de PDF a Excel, que reconstruye la estructura de la tabla en lugar de aplanarla.
¿Necesito una cuenta?
Sí: la extracción se ejecuta en nuestros servidores, así que requiere iniciar sesión. Crear una cuenta es gratis.