OCR und Textextraktion aus PDF
Mach ein gescanntes Dokument durchsuchbar oder hol den Text heraus.
Welches Tool brauchst du?
- Ein PDF, das schon eine Textebene hat, und du willst die Wörter heraus. Text extrahieren liest sie direkt in deinem Browser, ohne jedes Raten.
- Ein Scan oder ein Foto einer Seite. Darin ist kein Text, den man extrahieren könnte. Es braucht zuerst OCR, die die Pixel liest und bestimmt, welche Zeichen sie sind — danach lässt sich das Ergebnis extrahieren, durchsuchen und kopieren.
Wie du erkennst, welche Art du vor dir hast
Öffne die Datei und versuch, eine Textzeile mit der Maus zu markieren. Folgt eine saubere blaue Markierung den Wörtern, gibt es eine Textebene und die Extraktion funktioniert. Passiert nichts, oder markierst du ein Rechteck über die ganze Seite, als wäre sie ein einziges Bild, dann ist es ein Scan.
Das Aussehen sagt dir nichts: Der Scan einer lasergedruckten Seite kann am Bildschirm sauberer wirken als ein echtes digitales Dokument. Nur der Markierungstest ist verlässlich, und er dauert zwei Sekunden.
Ein Dokument kann auch teilweise beides sein — ein digital entstandener Bericht mit einem gescannten Anhang hinten dran ist extrem häufig, und er extrahiert vierzig Seiten lang perfekt und gibt dann nichts mehr zurück.
Der Fehler, den die meisten machen
Dem OCR-Ergebnis trauen, ohne es zu lesen. OCR ist ein sehr gutes Raten, und es bleibt Raten. Die Zeichen, die sie am häufigsten verwechselt, sind die, auf die es am meisten ankommt: 0 und O, 1 und l und I, 5 und S, 8 und B. Eine falsch gelesene Ziffer in einer Referenznummer oder einem Betrag sieht nirgendwo falsch aus — der Satz liest sich weiterhin normal — und übersteht deshalb ein Korrekturlesen, das ein falsch geschriebenes Wort auffangen würde. Prüf Zahlen einzeln gegen das Original.
Lohnt sich zu lesen, bevor du anfängst
Die drei Dinge, von denen sich die meisten bei dieser Art Aufgabe hinterher wünschen, sie hätten sie vorher gewusst.