Text extrahieren

Text aus einem PDF extrahieren

Erhalten Sie den reinen Text eines Dokuments als einfache Datei, die Sie durchsuchen, einfügen, vergleichen oder an ein anderes Programm übergeben können.

Text aus einem PDF extrahieren online

Text extrahieren ist das, was Sie brauchen, wenn die Formatierung im Weg ist: Sie brauchen die Wörter selbst, um sie zu durchsuchen, in ein Skript einzufügen, zwei Fassungen zu vergleichen oder sie an etwas zu übergeben, das nur reinen Text liest. PDF Vision liest das Dokument serverseitig mit Poppler — derselben pdftotext-Engine, die unter Linux überall im Einsatz ist — und liefert den Text jeder Seite einzeln sowie als zusammenhängenden Block, herunterladbar als .txt-Datei. Die wichtige Bedingung: Das PDF muss tatsächlich Text enthalten. Eine Datei aus Word, aus einer Buchhaltungssoftware oder aus einem Web-Export tut das. Ein Scan nicht: Er ist ein Bild von Wörtern, und kein Extraktor findet Zeichen, die nie in die Datei geschrieben wurden. Kommt das Ergebnis leer oder fast leer zurück, liegt es daran — das Werkzeug sagt es Ihnen und verweist Sie auf die OCR, die zuerst die Buchstaben im Bild erkennt. Dateien bis 10 MB und 100 Seiten, verarbeitet auf unseren Servern, daher ist ein Konto erforderlich.

So funktioniert es

  1. PDF hochladen

    Bis zu 10 MB und 100 Seiten. Das Dokument sollte auswählbaren Text enthalten — wenn Sie in einem Reader ein Wort markieren können, lässt es sich extrahieren.

  2. Der Text wird ausgelesen

    Poppler liest das Dokument serverseitig und liefert den Text jeder Seite, getrennt gehalten, plus einen zusammenhängenden Block.

  3. .txt herunterladen

    Speichern Sie die reine Textdatei oder kopieren Sie das Benötigte direkt von der Seite.

Warum dieses Werkzeug

Reiner Text statt neuem Layout

Eine Umwandlung in Word versucht, das Design nachzubauen, und kann Dinge verschieben. Die Extraktion liefert die Wörter, wie sie sind — genau das, was ein Skript, eine Suche oder ein Vergleich braucht.

Seitenweise und als Ganzes

Jede Seite wird einzeln geliefert, sodass Sie eine bestimmte Seite zitieren oder ein Dokument Seite für Seite verarbeiten können, statt einen langen Block zu entwirren.

Erkennt, wenn das PDF ein Scan ist

Ein leeres Ergebnis wird erklärt statt als Rätsel stehengelassen: Ein Dokument ohne Textebene wird gemeldet, und Sie werden zur OCR geleitet, statt es noch einmal genauso zu versuchen.

Häufige Fragen

Es kam nichts heraus, oder fast nichts. Warum?
Fast sicher, weil das PDF ein Scan ist. Eine gescannte Seite ist ein Bild von Wörtern, keine Wörter: Die Datei enthält keine Zeichen, die ein Extraktor finden könnte. Wenn Sie zuerst OCR ausführen, werden die Buchstaben im Bild erkannt und eine Textebene erzeugt; danach funktioniert die Extraktion ganz normal.
Bleibt das Layout erhalten?
Nein, und genau darum geht es. Sie erhalten den Text, nicht das Design — keine Spalten, keine Tabellenrahmen, keine Schriften. Soll das Dokument ein Dokument bleiben, wandeln Sie es stattdessen in Word um. Brauchen Sie die Wörter für eine Suche, ein Skript oder einen Vergleich, ist die Extraktion das richtige Werkzeug.
Welche Grenzen gibt es?
Dateien bis 10 MB und 100 Seiten. Der Text jeder Seite wird einzeln und zusammengefasst geliefert, und der Download ist eine einfache .txt-Datei.
Werden Tabellen als Tabellen extrahiert?
Nein. Eine Tabelle wird zu dem Text, den sie enthält, in Lesereihenfolge, ohne das Raster. Um Zeilen und Spalten als Zellen zu erhalten, verwenden Sie den Konverter PDF in Excel, der die Tabellenstruktur rekonstruiert, statt sie abzuflachen.
Brauche ich ein Konto?
Ja — die Extraktion läuft auf unseren Servern, daher ist eine Anmeldung erforderlich. Das Konto ist kostenlos.