Text aus einem PDF extrahieren
Erhalten Sie den reinen Text eines Dokuments als einfache Datei, die Sie durchsuchen, einfügen, vergleichen oder an ein anderes Programm übergeben können.
Text aus einem PDF extrahieren online
Text extrahieren ist das, was Sie brauchen, wenn die Formatierung im Weg ist: Sie brauchen die Wörter selbst, um sie zu durchsuchen, in ein Skript einzufügen, zwei Fassungen zu vergleichen oder sie an etwas zu übergeben, das nur reinen Text liest. PDF Vision liest das Dokument serverseitig mit Poppler — derselben pdftotext-Engine, die unter Linux überall im Einsatz ist — und liefert den Text jeder Seite einzeln sowie als zusammenhängenden Block, herunterladbar als .txt-Datei. Die wichtige Bedingung: Das PDF muss tatsächlich Text enthalten. Eine Datei aus Word, aus einer Buchhaltungssoftware oder aus einem Web-Export tut das. Ein Scan nicht: Er ist ein Bild von Wörtern, und kein Extraktor findet Zeichen, die nie in die Datei geschrieben wurden. Kommt das Ergebnis leer oder fast leer zurück, liegt es daran — das Werkzeug sagt es Ihnen und verweist Sie auf die OCR, die zuerst die Buchstaben im Bild erkennt. Dateien bis 10 MB und 100 Seiten, verarbeitet auf unseren Servern, daher ist ein Konto erforderlich.
So funktioniert es
PDF hochladen
Bis zu 10 MB und 100 Seiten. Das Dokument sollte auswählbaren Text enthalten — wenn Sie in einem Reader ein Wort markieren können, lässt es sich extrahieren.
Der Text wird ausgelesen
Poppler liest das Dokument serverseitig und liefert den Text jeder Seite, getrennt gehalten, plus einen zusammenhängenden Block.
.txt herunterladen
Speichern Sie die reine Textdatei oder kopieren Sie das Benötigte direkt von der Seite.
Warum dieses Werkzeug
Reiner Text statt neuem Layout
Eine Umwandlung in Word versucht, das Design nachzubauen, und kann Dinge verschieben. Die Extraktion liefert die Wörter, wie sie sind — genau das, was ein Skript, eine Suche oder ein Vergleich braucht.
Seitenweise und als Ganzes
Jede Seite wird einzeln geliefert, sodass Sie eine bestimmte Seite zitieren oder ein Dokument Seite für Seite verarbeiten können, statt einen langen Block zu entwirren.
Erkennt, wenn das PDF ein Scan ist
Ein leeres Ergebnis wird erklärt statt als Rätsel stehengelassen: Ein Dokument ohne Textebene wird gemeldet, und Sie werden zur OCR geleitet, statt es noch einmal genauso zu versuchen.