OCR und Textextraktion aus PDF

Mach ein gescanntes Dokument durchsuchbar oder hol den Text heraus.

Text aus einem PDF extrahierenDie Wörter als reinen Text herausholenEin gescanntes PDF durchsuchbar machenText in einem Scan erkennen

Welches Tool brauchst du?

Wie du erkennst, welche Art du vor dir hast

Öffne die Datei und versuch, eine Textzeile mit der Maus zu markieren. Folgt eine saubere blaue Markierung den Wörtern, gibt es eine Textebene und die Extraktion funktioniert. Passiert nichts, oder markierst du ein Rechteck über die ganze Seite, als wäre sie ein einziges Bild, dann ist es ein Scan.

Das Aussehen sagt dir nichts: Der Scan einer lasergedruckten Seite kann am Bildschirm sauberer wirken als ein echtes digitales Dokument. Nur der Markierungstest ist verlässlich, und er dauert zwei Sekunden.

Ein Dokument kann auch teilweise beides sein — ein digital entstandener Bericht mit einem gescannten Anhang hinten dran ist extrem häufig, und er extrahiert vierzig Seiten lang perfekt und gibt dann nichts mehr zurück.

Der Fehler, den die meisten machen

Dem OCR-Ergebnis trauen, ohne es zu lesen. OCR ist ein sehr gutes Raten, und es bleibt Raten. Die Zeichen, die sie am häufigsten verwechselt, sind die, auf die es am meisten ankommt: 0 und O, 1 und l und I, 5 und S, 8 und B. Eine falsch gelesene Ziffer in einer Referenznummer oder einem Betrag sieht nirgendwo falsch aus — der Satz liest sich weiterhin normal — und übersteht deshalb ein Korrekturlesen, das ein falsch geschriebenes Wort auffangen würde. Prüf Zahlen einzeln gegen das Original.

Lohnt sich zu lesen, bevor du anfängst

Die drei Dinge, von denen sich die meisten bei dieser Art Aufgabe hinterher wünschen, sie hätten sie vorher gewusst.

Alle Artikel in der Wissensdatenbank

Ähnliche Kategorien