Ist dieses PDF gescannt oder ist es Text?
Wie erkenne ich, ob ein PDF gescannt ist?
Speicher deine Lieblings-Tools
Leg ein kostenloses iBuildPDF-Konto an, um deine Lieblings-Tools zu behalten und jederzeit schnell wiederzufinden.
Kostenloses Konto. Die PDF-Tools selbst brauchen nie eins.
Kurze Antwort
Versuch, ein Wort mit dem Cursor zu markieren. Hebt sich der Text hervor, enthält die Datei echten Text. Ziehst du stattdessen einen Auswahlkasten über ein Bild, ist die Seite ein Bild, und die Datei enthält überhaupt keinen Text. Beide sehen am Bildschirm identisch aus und verhalten sich in jedem Tool völlig unterschiedlich.
Der Zwei-Sekunden-Test
Öffne die Datei und versuche, ein Wort durch Ziehen zu markieren.
- Das Wort hebt sich hervor — es gibt eine Textebene. Suche, Kopieren und Umwandlung funktionieren alle.
- Stattdessen zieht sich ein Rechteck über die Seite und markiert nichts — die Seite ist ein einziges Bild. Es gibt keinen Text zu finden.
Eine zweite Probe: Drücke Strg+F (Cmd+F) und suche nach einem Wort, das du klar siehst. Kein Treffer bei einem sichtbar vorhandenen Wort heißt: keine Textebene.
Dieselbe Seite, mit und ohne Text
- Ein digitales PDF. Am Bildschirm nicht vom rechten zu unterscheiden.
- Darunter: Zeichencodes, jeweils mit Schrift und Position. Durchsuchbar, markierbar, umwandelbar.
- Ein gescanntes PDF. Dieselbe Seite, dasselbe Aussehen.
- Darunter: ein Raster aus hellen und dunklen Werten. Keine Buchstaben, keine Wörter, nichts zu suchen.
Beide Seiten oben sind dieselbe Seite, und am Bildschirm sind sie nicht zu unterscheiden. Darunter ist die eine eine Folge von Zeichencodes mit Positionen und einer Schrift; die andere ein Raster aus hellen und dunklen Werten, das für ein menschliches Auge zufällig wie Schrift aussieht. Nichts an der zweiten weiß, dass sie Buchstaben enthält.
Wenn du lieber nicht hinschauen willst: Lass die Datei durch PDF in Text laufen. Eine gescannte Datei kommt leer oder fast leer zurück, und das ist deine Antwort.
Warum das alles Nachgelagerte ändert
Fast jede Beschwerde über PDF-Tools lässt sich auf diese Unterscheidung zurückführen.
- In Word umwandeln, und heraus kommen Fotografien. Kein Fehler, und nichts, was ein besserer Konverter beheben würde: In der Datei war kein Text zum Umwandeln. Der Konverter hat getreu übertragen, was da war — zwei Bilder.
- Die Suche findet nichts, weder in der Datei noch in einem System, das sie indexiert.
- Kopieren und Einfügen liefert dir nichts.
- Komprimierung verhält sich anders. Ein Scan ist Bilddaten und reagiert gut auf Bildkomprimierung, aber gar nicht auf die Tricks, die Text verkleinern — deshalb weigern sich manche Dateien, kleiner zu werden, und Scans meist nicht.
- Schwärzen ist eine andere Aufgabe. Es gibt keinen Text zu entfernen, nur Pixel zu übermalen — aber das Originalbild liegt weiterhin darunter, sofern das Tool die Seite nicht neu aufbaut.
- Screenreader bekommen überhaupt nichts. Für assistive Technik ist ein gescanntes Dokument eine leere Seite.
Was OCR daran ändert
Texterkennung betrachtet das Bild, ermittelt, welche Formen Buchstaben sind, und schreibt eine Textebene unter das Bild. Die Seite sieht weiterhin genau gleich aus — du siehst weiterhin den Scan —, aber jetzt liegt unsichtbar dahinter durchsuchbarer, markierbarer, kopierbarer Text.
Das ist die Operation, die OCR PDF ausführt, und sie muss zuerst kommen. Führe OCR aus, dann wandle um, suche oder extrahiere; die Tools, die am Original nutzlos waren, funktionieren am Ergebnis.
Die richtige Sprache zu wählen zählt mehr, als man erwartet. OCR entscheidet zwischen ähnlichen Formen anhand eines Modells davon, wie Wörter in einer bestimmten Sprache aussehen, also erhöht eine falsche Angabe messbar die Fehlerzahl — und bei Arabisch, Chinesisch oder Griechisch erzeugt die falsche Einstellung Unsinn statt bloßer Fehler.
Was OCR nicht behebt
OCR ist Erkennung, und Erkennung kann falsch liegen. Sie ist sehr gut bei einem sauberen, geraden 300-DPI-Scan von gewöhnlichem gedrucktem Text. Bei allem anderen wird sie schlechter, und sie sagt dir nicht, wann sie rät.
- Handschrift liegt meist außerhalb ihrer Reichweite.
- Scans mit niedriger Auflösung — unter etwa 200 DPI — verlieren die Details, die ähnliche Buchstaben unterscheiden.
- Schiefe, verschattete oder fotografierte Seiten schneiden weit schlechter ab als Flachbett-Scans.
- Tabellen und mehrspaltige Layouts werden womöglich in falscher Reihenfolge gelesen, weil die Lesereihenfolge aus der Position erschlossen werden muss.
- Stempel, Unterschriften und handschriftliche Anmerkungen über gedrucktem Text verwirren die darunterliegenden Buchstabenformen.
Behandle ein OCR-Ergebnis also als durchsuchbare Kopie, nicht als geprüfte Abschrift. Bei allem, wo eine falsche Ziffer zählt — eine Rechnungssumme, eine Dosierung, ein Gesetzeszitat — lies den erkannten Text gegen das Bild, bevor du dich darauf verlässt. OCR oder PDF in Word? behandelt, welches der beiden du eigentlich willst.
Tools, um die es in diesem Artikel geht
Quellen
Primärdokumentation zu den Aussagen oben.