OCR PDF

Gescanntes PDF per OCR erkennen

Machen Sie gescannte oder bildbasierte PDFs mit optischer Zeichenerkennung durchsuchbar und markierbar.

Gescanntes PDF per OCR erkennen online

Ein gescanntes PDF ist ein Stapel Bilder: Sie können es lesen, aber Strg+F findet nichts. PDF Vision führt auf jeder Seite eine optische Zeichenerkennung durch und schreibt die erkannten Wörter als unsichtbare Textebene hinter die Seite, sodass das Dokument gleich aussieht und zugleich durchsuchbar, markierbar und kopierbar wird. Die Erkennung wird auf jeder Seite erzwungen, was sie neu rendert und neu kodiert — verwenden Sie das Werkzeug also für Scans, nicht für PDFs, die bereits guten Text enthalten. Wählen Sie die Hauptsprache des Scans — Englisch, Französisch, Deutsch, Spanisch, Italienisch, Portugiesisch, Russisch, Arabisch, Chinesisch oder Japanisch — und laden Sie dann das durchsuchbare PDF herunter. Die Verarbeitung läuft auf unseren Servern, und OCR ist mit einem kostenlosen Konto gratis.

So funktioniert es

  1. Anmelden und hochladen

    Öffnen Sie Ihr kostenloses PDF-Vision-Konto und wählen Sie das gescannte oder bildbasierte PDF aus, das durchsuchbar werden soll.

  2. Sprache des Scans wählen

    Wählen Sie die Sprache, in der das Dokument gedruckt ist; die Engine überträgt die Zeichen wie geschrieben und übersetzt sie nie.

  3. Durchsuchbares PDF herunterladen

    Lange Scans brauchen einige Minuten, dann wird das fertige PDF mit bereits eingebetteter Textebene heruntergeladen.

Warum dieses Werkzeug

Strg+F funktioniert wieder

Die Seite wird so neu gerendert, wie sie heute aussieht, und die erkannten Wörter werden dahinter geschrieben — Stempel, Unterschriften und Layout bleiben optisch identisch, während Suchen, Kopieren und Markieren wie bei einem digital erstellten PDF funktionieren. Da OCR auf jeder Seite erzwungen wird, verwenden Sie es für Scans, nicht für Dateien, die bereits eine gute Textebene haben.

Zehn Erkennungssprachen

Englisch, Französisch, Deutsch, Spanisch, Italienisch, Portugiesisch, Russisch, Arabisch, vereinfachtes Chinesisch und Japanisch werden abgedeckt, einschließlich nicht-lateinischer Schriften, die eine naive Textextraktion meist als unlesbare Zeichen zurückgibt.

Macht Folgewerkzeuge möglich

Sobald eine Textebene existiert, lässt sich dieselbe Datei in Word oder Excel umwandeln, übersetzen, zusammenfassen oder schwärzen — nichts davon funktioniert mit einer Seite, die nur ein Bild ist.

Häufige Fragen

Was ändert OCR tatsächlich an meinem PDF?
Optisch fast nichts: Stempel, Unterschriften und Layout sehen gleich aus, darunter wird eine unsichtbare Textebene eingefügt. Technisch wird OCR auf jeder Seite erzwungen, jede Seite also neu gerendert und neu kodiert, die Dateigröße ändert sich, und bereits vorhandener auswählbarer Text wird durch OCR-Text ersetzt — der ungenauer sein kann als das Original.
Brauche ich ein Konto für OCR?
Ja. OCR PDF ist kostenlos, erfordert aber ein kostenloses PDF-Vision-Konto. Die Erkennung läuft auf unseren Servern und braucht bei mehrseitigen Scans echte Rechenzeit, daher ist sie an eine angemeldete Sitzung gebunden.
Welche Sprachen werden erkannt?
Englisch, Französisch, Deutsch, Spanisch, Italienisch, Portugiesisch, Russisch, Arabisch, vereinfachtes Chinesisch und Japanisch. Englisch ist mit Französisch gekoppelt, und Französisch, Deutsch und Spanisch sind jeweils mit Englisch gekoppelt, sodass eine zweisprachige Seite in einem Durchgang gelesen wird.
Übersetzt OCR mein Dokument?
Nein. Die Erkennung überträgt die Zeichen genau so, wie sie auf der Seite gedruckt sind. Brauchen Sie den Inhalt zusätzlich in einer anderen Sprache, führen Sie nach Abschluss der OCR PDF übersetzen auf der durchsuchbaren Datei aus.
Wie genau ist die Erkennung?
Die Genauigkeit folgt der Scanqualität. Ein gerader, kontrastreicher Scan mit 300 DPI wird nahezu perfekt gelesen. Faxe, schiefe Seiten, Handschrift, Stempel über Text und starkes Hintergrundrauschen erzeugen Fehler, die Sie korrekturlesen sollten, bevor Sie sich auf den Text verlassen.
Wie lange dauert ein langer Scan?
Die Verarbeitungszeit wächst mit der Seitenzahl, und ein großer Scan kann mehrere Minuten dauern — die Anfrage bricht nach zehn ab. Lassen Sie den Tab geöffnet, bis der Download startet, statt die Seite neu zu laden.