OCR oder PDF in Word umwandeln
Was ist der Unterschied zwischen OCR und dem Umwandeln eines PDFs in Word?
Speicher deine Lieblings-Tools
Leg ein kostenloses iBuildPDF-Konto an, um deine Lieblings-Tools zu behalten und jederzeit schnell wiederzufinden.
Kostenloses Konto. Die PDF-Tools selbst brauchen nie eins.
Kurze Antwort
OCR schaut sich die Pixel einer gescannten Seite an und rät, welche Zeichen sie darstellen. Ein PDF in Word umzuwandeln nimmt Text, der bereits in der Datei gespeichert ist, und baut daraus ein bearbeitbares Dokument. Ist dein PDF ein Scan, gibt es keinen Text zum Umwandeln, dann hilft nur OCR — und iBuildPDF hat kein OCR-Tool.
Zwei Arten von PDF, die identisch aussehen
Fast jede Verwirrung rund um OCR kommt von einer Tatsache: Ein PDF kann eine Seite auf zwei völlig verschiedene Arten speichern, und auf dem Bildschirm sehen beide gleich aus.
Dieselbe Seite, mit und ohne Text
- Ein digitales PDF. Am Bildschirm nicht vom rechten zu unterscheiden.
- Darunter: Zeichencodes, jeweils mit Schrift und Position. Durchsuchbar, markierbar, umwandelbar.
- Ein gescanntes PDF. Dieselbe Seite, dasselbe Aussehen.
- Darunter: ein Raster aus hellen und dunklen Werten. Keine Buchstaben, keine Wörter, nichts zu suchen.
Die erste Art hat eine Textebene. Die Datei enthält echte Textobjekte — eine Zeichenkette, eine Schrift, eine Größe und Koordinaten, die sagen, wo auf der Seite jedes Stück gezeichnet wird. Die Seite ist ein Satz Anweisungen zum Malen von Buchstaben. Ein Programm kann diese Zeichen exakt wieder auslesen, weil sie nie etwas anderes als Zeichen waren.
Die zweite Art sind Seitenbilder. Das erzeugt ein Scanner, eine Handykamera oder ein Fax: Jede Seite ist ein Foto, verpackt in einem PDF. Irgendwo in der Datei gibt es keinen Text. Was aussieht wie der Buchstabe „e“, ist ein Muster dunkler Pixel, das ein menschliches Auge als „e“ erkennt; für die Software unterscheidet es sich nicht von einem Bild einer Katze.
Der Zwei-Sekunden-Test
Versuch in irgendeinem Betrachter, ein Wort durch Ziehen zu markieren. Werden einzelne Wörter hervorgehoben, hat die Datei eine Textebene. Zeichnet der Cursor stattdessen ein Rechteck — einen Auswahlrahmen, keine Textmarkierung —, gibt es keine Textebene, und du siehst ein Bild.
Zwei Tools hier bestätigen das ohne Raterei. Seitenzahl meldet, ob das Dokument eine Textebene hat. PDF in Text liefert bei einem Scan nichts Brauchbares — meist ein leeres Ergebnis, manchmal eine versprengte Zeile, die die Scan-Software ergänzt hat. Dieses leere Ergebnis ist kein Fehler; es ist die richtige Antwort auf die Frage „welcher Text steckt in dieser Datei?“
Dokumente können gemischt sein. Ein Vertrag, der in einer Textverarbeitung geschrieben, dann unterschrieben und gescannt wurde, kann auf den meisten Seiten eine Textebene haben und auf der gescannten keine. Prüf die Seite, auf die es dir ankommt.
Was OCR macht
OCR steht für optische Zeichenerkennung (optical character recognition). Sie nimmt ein Bild, sucht die Bereiche, die nach Text aussehen, zerlegt sie in Zeilen und dann in einzelne Glyphenformen und vergleicht jede Form mit einem Modell davon, wie Zeichen aussehen. Für jedes Zeichen gibt sie eine beste Vermutung und einen Konfidenzwert aus — wie sicher sie sich ist.
Das Wort Vermutung ist das entscheidende. OCR stellt den Originaltext nicht wieder her, denn der Originaltext steckt nicht in der Datei. Sie erzeugt einen neuen Text, von dem sie glaubt, dass er zum Bild passt — meist sehr gut, gelegentlich falsch, und nichts in der Ausgabe verrät dir, was was ist, solange du dir die Konfidenzwerte nicht ansiehst.
Die Genauigkeit hängt von Dingen ab, die du dir größtenteils selbst ansehen kannst:
- Scanqualität. Auflösung, Kontrast, Schieflage, Schatten von einer Handykamera, Sprenkel von einem billigen Scanner und Text, der ein paar Mal zu oft kopiert wurde.
- Sprache und Schriftart. Einer Engine muss man sagen, welche Sprache sie erwarten soll; das falsche Modell erzeugt selbstbewussten Unsinn. Ungewöhnliche Schriften und Handschrift sind viel schwieriger als schlichter gedruckter Fließtext.
- Layout. Hier geht OCR am häufigsten daneben. Die Lesereihenfolge muss aus der Position erschlossen werden, eine zweispaltige Seite kann also zurückkommen, wobei die Spalten Zeile für Zeile ineinander verschachtelt sind. Tabellen sind schlimmer: Zellgrenzen können Linien sein oder nur Weißraum, und eine Tabelle kommt oft als Zahlenstrom an, bei dem Zeilen und Spalten verschwunden sind.
Die übliche Open-Source-Engine ist Tesseract, die den meisten kostenlosen und selbst gehosteten OCR-Tools zugrunde liegt. Welche Engine du auch nimmst: Behandle die Ausgabe als Entwurf — lies sie Korrektur und schau besonders auf Ziffern und auf Zeichenpaare, die im Druck ähnlich aussehen.
Was eine Umwandlung von PDF in Word macht
Ein Konverter von PDF nach Word macht etwas ganz anderes. Er liest die Textobjekte, die bereits in der Datei stehen, samt ihren Schriften und Koordinaten, und baut daraus ein bearbeitbares Dokument neu auf.
Die Zeichen sind exakt bekannt — sie wurden als Zeichen gespeichert. Erschlossen werden muss die Struktur, denn eine PDF-Seite sagt „zeichne diese Zeichenkette an dieser Position“, nicht „das ist ein Absatz“ oder „das ist die zweite Zelle von Zeile vier“. Ein Konverter leitet also ab:
- Absätze, aus Zeilen, die dieselbe Schrift teilen und in gleichbleibendem Zeilenabstand und Einzug stehen;
- Überschriften und Hervorhebungen, aus größeren oder fetteren Schriften;
- Listen, aus wiederkehrenden Aufzählungszeichen oder Nummern in einem hängenden Einzug;
- Tabellen, aus Linien oder aus Text, der sich über die Seite hinweg in Spalten ausrichtet.
Auch diese Ableitung ist eine Vermutung, aber eine andere als die von OCR. Ein Konverter kann sich darin irren, wo ein Absatz endet; er irrt sich nicht darin, welche Buchstaben darin stehen.
Lass einen Konverter über einen Scan laufen, und er scheitert aus einem simplen Grund: Es gibt nichts umzuwandeln. Er liest keine Pixel, findet also keinen Text und erzeugt entweder ein leeres Dokument oder eine Word-Datei mit einem ganzseitigen Bild pro Seite — genauso wenig bearbeitbar, wie das PDF es war.
Was du brauchst
Der Entscheidungsweg ist kurz:
- Versuch, im PDF ein Wort zu markieren.
- Werden Wörter hervorgehoben, brauchst du eine Umwandlung. Der Text ist da; du willst ihn in einem bearbeitbaren Format.
- Bekommst du einen Auswahlrahmen, brauchst du zuerst OCR. Eine Umwandlung hat nichts, womit sie arbeiten könnte, bevor OCR eine Textebene erzeugt hat.
- Willst du nur die Wörter — zum Zitieren, Suchen oder Einfügen —, reicht PDF in Text; eine Word-Datei brauchst du dafür gar nicht.
| OCR | Umwandlung PDF in Word | |
|---|---|---|
| Eingabe | Ein Scan oder Foto: Seiten ohne Textebene | Ein PDF, das bereits eine Textebene hat |
| Was gelesen wird | Pixel | Textobjekte und ihre Koordinaten |
| Ausgabe | Erkannter Text, jedes Zeichen mit einem Konfidenzwert | Ein bearbeitbares Dokument mit abgeleiteten Absätzen, Formatvorlagen und Tabellen |
| Typischer Fehlerfall | Falsch erkannte Zeichen und verlorene Lesereihenfolge in Tabellen und mehrspaltigen Seiten | Falsche Struktur — verschmolzene Absätze, zerbrochene Tabellen; und totales Versagen bei einem Scan, weil es keinen Text zu lesen gibt |
Wenn du nicht sicher bist, wie eine Datei entstanden ist, verraten es oft die Metadaten des Dokuments. Das Producer-Feld nennt häufig den Scanner oder die Anwendung, die das PDF geschrieben hat — siehe was PDF-Metadaten enthalten.
Was iBuildPDF hier kann und was nicht
Klartext: iBuildPDF kann keine der beiden Hälften dieser Aufgabe für dich erledigen.
Auf dieser Website gibt es kein OCR-Tool. Keines der Tools erkennt Zeichen in einem Bild. PDF in Text extrahiert eine Textebene, die bereits existiert; es kann keine erzeugen. Bei einem gescannten PDF liefert es nichts, und keine Einstellung ändert das.
Der Konverter von PDF nach Word ist nicht verfügbar. Er ist als „bald verfügbar“ gelistet und abgeschaltet, ebenso die Einträge PDF in Excel und PDF in PowerPoint. Plane keine Arbeit um sie herum.
Was du stattdessen tun kannst, in der Reihenfolge, die sich lohnt:
- Frag den Absender nach dem Original. Hat jemand ein Dokument gescannt, das er selbst geschrieben hat, existiert die Quelldatei noch, und sie ist genauer als alles, was OCR oder eine Umwandlung rekonstruieren können.
- Nimm ein dediziertes OCR-Tool. Tesseract ist kostenlos und breit verfügbar; kommerzielle Produkte kommen mit Tabellen und schlechten Scans in der Regel besser zurecht. Wähl eines, bei dem du die Sprache einstellen kannst.
- Verbessere zuerst den Scan. Neu scannen mit höherer DPI-Zahl, plan und gerade aufgelegt, mit gutem Kontrast, bringt für die Genauigkeit mehr als jede Nachbearbeitung.
- Prüf es mit Seitenzahl, bevor du anfängst, damit du weißt, welches Problem du tatsächlich hast.
Tools, um die es in diesem Artikel geht
Quellen
Primärdokumentation zu den Aussagen oben.