Text aus einem PDF zu holen kann zwei ganz unterschiedliche Aufgaben bedeuten – je nachdem, wie das PDF erstellt wurde. Image to Text App kann beides und entscheidet Seite für Seite, du musst es also nicht vorher wissen.
Digitale PDFs und gescannte PDFs
Ein digitales PDF wurde von Software erstellt: aus Word exportiert, von einer Website gespeichert oder von einem Abrechnungssystem erzeugt. Seine Seiten enthalten echten Text, und meist kannst du Wörter in einem PDF-Viewer markieren. Findet Image to Text App eine solche Seite, übernimmt es den Text direkt, ohne OCR. Das heißt: keine Erkennungsfehler, und es geht schnell.
Ein gescanntes PDF ist eine Sammlung von Bildern von Papierseiten – aus einem Bürogerät, einer Scan-App auf dem Handy oder einem Fax, das in eine Datei umgewandelt wurde. Darin steckt kein Text, nur Bilder, die wie Text aussehen. Image to Text App liest diese Seiten nacheinander per OCR, und der Fortschritt zeigt, wie weit es schon ist.
Viele PDFs sind eine Mischung aus beidem: ein Vertrag mit einer unterschriebenen und eingescannten letzten Seite oder ein Bericht mit ein paar gescannten Anhängen. Weil jede Seite einzeln geprüft wird, kommen die digitalen Seiten exakt durch, und nur die gescannten werden per OCR gelesen.
Ein Haken: Manche digitalen PDFs haben eine fehlerhafte Textebene. Du kannst den Text markieren, aber beim Kopieren bekommst du Zeichensalat oder fehlende Buchstaben, meist wegen der Art, wie die Schriften eingebettet wurden. Da dieser Text so übernommen wird, wie er ist, zeigt auch das Ergebnis dasselbe Problem. Die Lösung: Mach einen Screenshot der Seite und füge ihn hier ein, damit sie als Bild gelesen wird.
Guten Text aus gescannten Seiten holen
Die Qualität des Scans entscheidet den Großteil des Ergebnisses. Wenn du das Papier selbst scannst:
- Scanne mit einer Auflösung, die für Dokumente gedacht ist. 300 dpi sind für Text eine gängige Wahl, und deutlich niedrigere Einstellungen machen kleine Schrift schwer lesbar.
- Wähle Graustufen oder Schwarzweiß für reine Textdokumente. Farbe vergrößert die Datei, ohne der Erkennung zu helfen.
- Leg die Seiten flach und gerade auf. „Automatisch verbessern“ korrigiert eine leichte Schräglage, und eine Seite, die verkehrt herum eingezogen wurde, kannst du drehen.
Alte Fotokopien und Faxe haben oft Sprenkel und verblasste Striche. „Rauschen reduzieren“ hilft gegen die Sprenkel, mehr Kontrast hilft bei blasser Schrift. Jede Seite lässt sich einzeln anpassen und erneut lesen, ohne die übrigen anzurühren.
Mit langen Dokumenten arbeiten
Jede Seite des PDFs erscheint als eigene Seite im Arbeitsbereich. Du kannst Seiten umsortieren, eine erneut lesen, sie entfernen oder einzeln kopieren und herunterladen.
Die Ansicht „Gesamtes Dokument“ fügt alle Seiten der Reihe nach zusammen, mit Suche über jede Seite. Klick auf eine Textzeile, und ihre Stelle im Seitenbild leuchtet auf – der schnellste Weg, eine Zahl oder einen Namen zu prüfen.
Der Dokumentmodus fügt Zeilen zu Absätzen zusammen und behält Überschriften und Listen bei. Außerdem gibt es Optionen, umbrochene Zeilen zu verbinden und Wörter wieder zusammenzufügen, die am Zeilenende per Bindestrich getrennt wurden – davon sind gescannte Bücher und Berichte voll. Kopfzeilen, Fußzeilen und Seitenzahlen tauchen auf jeder Seite auf; mit „Suchen und Ersetzen“ entfernst du sie schnell.
Das Ausgabeformat wählen
- Word (.docx) ist hier voreingestellt, bereit zum Bearbeiten. Mehr zu bearbeitbaren Dokumenten unter Bild in Word.
- Durchsuchbares PDF lässt den Scan genau so aussehen wie vorher und fügt eine unsichtbare, auswählbare Textebene hinzu. Das ist die richtige Wahl fürs Archivieren: Die Datei sieht weiter wie das Original aus, aber du kannst sie in jedem PDF-Reader mit Strg+F durchsuchen.
- TXT, Markdown, HTML und JSON gibt es ebenfalls, als eine kombinierte Datei oder als ZIP mit einzelnen Dateien.
Enthält das PDF eine Tabelle, die du in einer Tabellenkalkulation brauchst, stell diese Seite auf den Tabellenmodus um und sieh dir Bild in Excel an.
Grenzen, die du kennen solltest
Klar gedruckte Scans werden meist sehr genau gelesen. Handschriftliche Randnotizen, ausgefüllte Formulare und Unterschriften sind deutlich schwieriger. Stempel und Wasserzeichen über dem Text verursachen Fehler, und mehrspaltige Layouts müssen dort, wo Spalten aufeinandertreffen, eventuell nachbearbeitet werden. Einfache gedruckte Formeln lassen sich im Mathemodus lesen, alles Komplexere musst du meist von Hand korrigieren.
Mehr zur Scanqualität und dazu, was du erwarten kannst, liest du in Text aus gescannten Dokumenten extrahieren.