PDF in Markdown

PDF in Markdown umwandeln

Erhalten Sie eine Markdown-Datei, in der Überschriften Überschriften und Listen Listen sind — statt einer einzigen flachen Textwand.

PDF in Markdown umwandeln online

Ein PDF enthält keine Struktur. Es enthält Glyphen an Koordinaten: Nichts in der Datei sagt „diese Zeile ist eine Überschrift“ oder „diese drei Zeilen bilden eine Liste“. Deshalb liefert das Extrahieren von Text aus einem PDF eine Wand aus Zeilen, in der sich ein Titel genauso liest wie ein Absatz — gut, um nach einer Zeichenfolge zu suchen, unbrauchbar, um ein Dokument wiederherzustellen. Dieses Werkzeug rekonstruiert die Struktur aus dem, was die Seite tatsächlich zeigt. Eine Zeile, die deutlich größer gesetzt ist als der Fließtext, wird zur Überschrift, und je stärker sie davon abweicht, desto höher ihre Ebene — gemessen an der vorherrschenden Schriftgröße des Dokuments selbst, nicht an einem festen Schwellenwert. So wird ein Text in 9 pt und einer in 14 pt jeweils nach seinen eigenen Maßstäben gelesen. Zeilen mit normalem Zeilenabstand werden wieder zu Absätzen zusammengefügt, denn ein PDF bricht jeden Satz am Zeilenende um. Aufzählungszeichen und nummerierte Punkte werden zu Markdown-Listen. Fettdruck wird an der Schrift selbst erkannt und genau an seiner Stelle markiert, sodass eine Hervorhebung mitten im Satz erhalten bleibt. Heraus kommt eine .md-Datei, die Sie in eine Dokumentation, eine Notiz-App oder eine Retrieval-Pipeline einfügen können — genau das Format, das diese Werkzeuge erwarten.

So funktioniert es

  1. PDF hochladen

    Bis zu 10 MB und 100 Seiten. Das Dokument braucht eine echte Textebene — wenn Sie in einem Reader ein Wort markieren können, lässt es sich umwandeln.

  2. Die Struktur wird wiederhergestellt

    Überschriften aus der relativen Größe, Listen aus ihren Aufzählungszeichen, Absätze wieder zusammengefügt, Fettdruck an Ort und Stelle markiert.

  3. .md kopieren oder herunterladen

    Lesen Sie das Ergebnis am Bildschirm, kopieren Sie es mit einem Klick oder speichern Sie die Markdown-Datei.

Warum dieses Werkzeug

Überschriften bleiben Überschriften

Die Ebenen ergeben sich aus der vorherrschenden Schriftgröße des Dokuments selbst — die Hierarchie bleibt erhalten, statt zu einem flachen Block zusammenzufallen.

Das Format, das KI-Werkzeuge verlangen

Retrieval-Pipelines und Notiz-Apps verarbeiten Markdown weit besser als Rohtext: Die Struktur zeigt ihnen, was wichtig ist und wo ein Abschnitt beginnt.

Es sagt, was es nicht konnte

Eine als Zeilen ausgegebene Tabelle, ein Scan ohne Textebene, ein Dokument über dem Seitenlimit — all das wird gemeldet, statt dass Sie es erst in der Datei entdecken.

Häufige Fragen

Worin unterscheidet sich das vom Extrahieren des Textes?
Beim Extrahieren erhalten Sie die Wörter ohne alles drumherum — jede Zeile sieht gleich aus, ein Titel liest sich wie ein Satz. Hier wird die Struktur wiederhergestellt: Überschriften werden zu # und ##, Aufzählungen zu Listen, Zeilen eines Absatzes werden zusammengefügt und Fettdruck wird markiert. Extrahieren Sie Text, um nach einer Zeichenfolge zu suchen; wandeln Sie in Markdown um, um ein Dokument lesbar zu halten oder es einem Werkzeug zu übergeben, das Markdown liest.
Wie werden Überschriften erkannt?
Anhand ihrer relativen Größe. Das Werkzeug ermittelt die vorherrschende Schriftgröße des Dokuments — die Größe, die die meisten Zeichen verwenden — und behandelt alles, was deutlich darüber liegt, als Überschrift; die Ebene steigt mit dem Abstand. Das ist wichtig: Ein fester Schwellenwert würde in einem Dokument in 16 pt jede Zeile zur Überschrift machen und in einem Dokument in 9 pt keine einzige finden.
Werden Tabellen in Markdown-Tabellen umgewandelt?
Nein, und das ist Absicht. Eine PDF-Tabelle ist nur eine Anordnung von Spalten; das Raster zu rekonstruieren heißt raten, und falsch geraten ergibt eine Tabelle, die richtig aussieht und sich falsch liest. Die Zeilen kommen daher als Textzeilen heraus, und das Werkzeug teilt Ihnen mit, dass es Spalten gefunden hat. Wenn Sie echte Zellen brauchen, stellt der Konverter PDF in Excel sie wieder her.
Was passiert mit einem gescannten PDF?
Ein Scan ist ein Bild: Es gibt keine Textebene, also nichts zu strukturieren. Statt Ihnen eine leere Datei zu liefern, sagt das Werkzeug das und verweist Sie auf die OCR, die eine Textebene hinzufügt. Danach funktioniert die Umwandlung ganz normal.
Bleiben Fett- und Kursivschrift erhalten?
Fettdruck ja, und zwar genau dort markiert, wo er steht — mitten im Satz, wenn er dort steht, nicht über die ganze Zeile. Er wird an der Schrift erkannt, die das Dokument verwendet. Kursivschrift wird in dieser Version nicht markiert.
Brauche ich ein Konto?
Ja — die Umwandlung läuft auf unseren Servern, daher ist eine Anmeldung erforderlich. Das Konto ist kostenlos.