PDF in Text umwandeln

Zieh ein PDF hierher und erhalte den Text jeder Seite. Seiten, die bereits Text enthalten, werden so übernommen, wie sie sind, und gescannte Seiten per OCR gelesen – alles auf deinem eigenen Gerät.

Drop images here, or paste with Ctrl V

JPG, PNG, WebP, HEIC, GIF, BMP, TIFF or PDF, up to 25 MB each. Add up to 50 at once.

Read on your device. Your images aren't uploaded. How this works

No image to hand? Try a sample:

So geht’s

  1. Zieh dein PDF auf die Seite oder öffne es mit Strg+O (⌘O auf dem Mac) – alle Seiten werden der Reihe nach hinzugefügt.
  2. Lass Image to Text App die gescannten Seiten nacheinander abarbeiten; der Fortschritt zeigt, welche Seite gerade gelesen wird.
  3. Öffne die Ansicht „Gesamtes Dokument“, um alle Seiten zusammen zu lesen und zu durchsuchen und Wörter zum Prüfen zu korrigieren.
  4. Lade alles als eine Word-Datei oder als durchsuchbares PDF herunter oder als ZIP mit einzelnen Dateien.

Text aus einem PDF zu holen kann zwei ganz unterschiedliche Aufgaben bedeuten – je nachdem, wie das PDF erstellt wurde. Image to Text App kann beides und entscheidet Seite für Seite, du musst es also nicht vorher wissen.

Digitale PDFs und gescannte PDFs

Ein digitales PDF wurde von Software erstellt: aus Word exportiert, von einer Website gespeichert oder von einem Abrechnungssystem erzeugt. Seine Seiten enthalten echten Text, und meist kannst du Wörter in einem PDF-Viewer markieren. Findet Image to Text App eine solche Seite, übernimmt es den Text direkt, ohne OCR. Das heißt: keine Erkennungsfehler, und es geht schnell.

Ein gescanntes PDF ist eine Sammlung von Bildern von Papierseiten – aus einem Bürogerät, einer Scan-App auf dem Handy oder einem Fax, das in eine Datei umgewandelt wurde. Darin steckt kein Text, nur Bilder, die wie Text aussehen. Image to Text App liest diese Seiten nacheinander per OCR, und der Fortschritt zeigt, wie weit es schon ist.

Viele PDFs sind eine Mischung aus beidem: ein Vertrag mit einer unterschriebenen und eingescannten letzten Seite oder ein Bericht mit ein paar gescannten Anhängen. Weil jede Seite einzeln geprüft wird, kommen die digitalen Seiten exakt durch, und nur die gescannten werden per OCR gelesen.

Ein Haken: Manche digitalen PDFs haben eine fehlerhafte Textebene. Du kannst den Text markieren, aber beim Kopieren bekommst du Zeichensalat oder fehlende Buchstaben, meist wegen der Art, wie die Schriften eingebettet wurden. Da dieser Text so übernommen wird, wie er ist, zeigt auch das Ergebnis dasselbe Problem. Die Lösung: Mach einen Screenshot der Seite und füge ihn hier ein, damit sie als Bild gelesen wird.

Guten Text aus gescannten Seiten holen

Die Qualität des Scans entscheidet den Großteil des Ergebnisses. Wenn du das Papier selbst scannst:

  • Scanne mit einer Auflösung, die für Dokumente gedacht ist. 300 dpi sind für Text eine gängige Wahl, und deutlich niedrigere Einstellungen machen kleine Schrift schwer lesbar.
  • Wähle Graustufen oder Schwarzweiß für reine Textdokumente. Farbe vergrößert die Datei, ohne der Erkennung zu helfen.
  • Leg die Seiten flach und gerade auf. „Automatisch verbessern“ korrigiert eine leichte Schräglage, und eine Seite, die verkehrt herum eingezogen wurde, kannst du drehen.

Alte Fotokopien und Faxe haben oft Sprenkel und verblasste Striche. „Rauschen reduzieren“ hilft gegen die Sprenkel, mehr Kontrast hilft bei blasser Schrift. Jede Seite lässt sich einzeln anpassen und erneut lesen, ohne die übrigen anzurühren.

Mit langen Dokumenten arbeiten

Jede Seite des PDFs erscheint als eigene Seite im Arbeitsbereich. Du kannst Seiten umsortieren, eine erneut lesen, sie entfernen oder einzeln kopieren und herunterladen.

Die Ansicht „Gesamtes Dokument“ fügt alle Seiten der Reihe nach zusammen, mit Suche über jede Seite. Klick auf eine Textzeile, und ihre Stelle im Seitenbild leuchtet auf – der schnellste Weg, eine Zahl oder einen Namen zu prüfen.

Der Dokumentmodus fügt Zeilen zu Absätzen zusammen und behält Überschriften und Listen bei. Außerdem gibt es Optionen, umbrochene Zeilen zu verbinden und Wörter wieder zusammenzufügen, die am Zeilenende per Bindestrich getrennt wurden – davon sind gescannte Bücher und Berichte voll. Kopfzeilen, Fußzeilen und Seitenzahlen tauchen auf jeder Seite auf; mit „Suchen und Ersetzen“ entfernst du sie schnell.

Das Ausgabeformat wählen

  • Word (.docx) ist hier voreingestellt, bereit zum Bearbeiten. Mehr zu bearbeitbaren Dokumenten unter Bild in Word.
  • Durchsuchbares PDF lässt den Scan genau so aussehen wie vorher und fügt eine unsichtbare, auswählbare Textebene hinzu. Das ist die richtige Wahl fürs Archivieren: Die Datei sieht weiter wie das Original aus, aber du kannst sie in jedem PDF-Reader mit Strg+F durchsuchen.
  • TXT, Markdown, HTML und JSON gibt es ebenfalls, als eine kombinierte Datei oder als ZIP mit einzelnen Dateien.

Enthält das PDF eine Tabelle, die du in einer Tabellenkalkulation brauchst, stell diese Seite auf den Tabellenmodus um und sieh dir Bild in Excel an.

Grenzen, die du kennen solltest

Klar gedruckte Scans werden meist sehr genau gelesen. Handschriftliche Randnotizen, ausgefüllte Formulare und Unterschriften sind deutlich schwieriger. Stempel und Wasserzeichen über dem Text verursachen Fehler, und mehrspaltige Layouts müssen dort, wo Spalten aufeinandertreffen, eventuell nachbearbeitet werden. Einfache gedruckte Formeln lassen sich im Mathemodus lesen, alles Komplexere musst du meist von Hand korrigieren.

Mehr zur Scanqualität und dazu, was du erwarten kannst, liest du in Text aus gescannten Dokumenten extrahieren.

Häufige Fragen

Funktioniert es mit gescannten PDFs?

Ja. Gescannte Seiten sind Bilder, deshalb wird jede Seite einzeln per OCR gelesen. Seiten, die bereits auswählbaren Text enthalten, werden stattdessen direkt übernommen.

Woran erkenne ich, ob mein PDF gescannt oder digital ist?

Öffne es in einem beliebigen PDF-Viewer und versuche, ein einzelnes Wort zu markieren. Wird es hervorgehoben, enthält die Seite echten Text; kannst du nur einen Rahmen über ein Bild ziehen, ist sie gescannt.

Läuft der Text aus einem digitalen PDF durch die OCR?

Nein. Enthält eine Seite bereits auswählbaren Text, übernimmt Image to Text App diesen Text direkt – Erkennungsfehler spielen dann keine Rolle.

Kann ich ein gescanntes PDF durchsuchbar machen?

Ja. Lade das Ergebnis als durchsuchbares PDF herunter. Es behält das Originalbild jeder Seite und fügt eine unsichtbare Textebene hinzu, sodass du in jedem PDF-Reader Text suchen, markieren und kopieren kannst.

Kann ich aus einem langen PDF ein einziges Word-Dokument machen?

Ja. Die Ansicht „Gesamtes Dokument“ fügt alle Seiten der Reihe nach zusammen und exportiert sie als eine Datei. Alternativ kannst du ein ZIP mit einzelnen Dateien herunterladen.

Wie groß darf ein PDF sein?

Dateien dürfen jeweils bis zu 25 MB groß sein. Ist ein Scan größer, teile ihn mit einem PDF-Tool in Teile auf und füge sie der Reihe nach hinzu.

Wird mein PDF hochgeladen?

Nein. Die Seiten werden in deinem Browser gelesen, auf deinem Gerät. Das ist wichtig bei Verträgen, Kontoauszügen und anderen Dokumenten, die du lieber nirgendwohin schickst.