Umwandeln und Extrahieren

Wie man Text und Bilder aus einem PDF herausbekommt

Was ist der beste Weg, Inhalte aus einem PDF herauszubekommen?

Kurze Antwort

Das hängt davon ab, was du danach damit vorhast. Für die Wörter: den Text extrahieren. Für die Seiten als Bilder: sie rendern lassen. Für einen Scan: zuerst den Text erkennen lassen — vorher gibt es nichts zu extrahieren. Für etwas, das du weiterbearbeiten willst: in Word umwandeln. Jeder Weg liefert etwas grundlegend anderes, und danach zu wählen, was du als Nächstes brauchst, erspart dir, das Falsche rückgängig zu machen.

An die Wörter kommen

Text aus einem PDF extrahieren liest die Textebene und gibt dir reinen Text. Keine Formatierung, keine Bilder, kein Layout — nur die Wörter, und das ist genau das Richtige, wenn du zitieren, durchsuchen, übersetzen oder in etwas anderes einfügen willst.

Was dabei zurückkommt, ist davon geprägt, wie das PDF gemacht wurde, und mit zwei Dingen solltest du rechnen:

  • Die Lesereihenfolge ist die Reihenfolge, in der der Text gezeichnet wurde, was bei einer mehrspaltigen Seite die Spalten ineinander verschachteln kann. Das ist eine Eigenschaft der Datei und kein Fehler der Extraktion — siehe was ein PDF barrierefrei macht, wo dieselbe Frage darüber entscheidet, ob ein Screenreader ein Dokument lesen kann.
  • Ein leeres Ergebnis heißt, dass es keinen Text gibt. Nicht, dass die Extraktion fehlgeschlagen ist — sondern dass die Seite ein Bild ist. Das ist der schnellste Weg herauszufinden, ob ein Dokument ein Scan ist.

An Bilder der Seiten kommen

PDF in JPG und PDF in PNG rendern jede Seite so, wie sie erscheint, und geben dir ein Bild pro Seite. Das willst du für ein Miniaturbild, eine Vorschau, eine Folie oder überall dort, wo ein Bild leichter zu platzieren ist als ein PDF.

Wähle das Format danach, was auf der Seite steht: JPG für Scans und Fotografien, PNG für Text, Diagramme und Strichzeichnungen, wo JPG-Artefakte direkt auf den Buchstabenformen landen. JPG oder PNG für ein PDF geht auf das Warum ein.

Sei dir vorher über den Tausch im Klaren: Eine Seite zu rendern zerstört ihren Text. Das Ergebnis sind Pixel — nicht durchsuchbar, nicht markierbar, nicht von einem Screenreader lesbar, meist größer und nicht umkehrbar. Richtig für ein Bild einer Seite; falsch für ein Dokument, das jemand lesen oder weiterverwenden muss.

Eine verwandte Frage, die das nicht beantwortet: Diese Tools rendern ganze Seiten und nicht die einzelnen Fotografien, die darin eingebettet sind. Brauchst du die Originalbilder so, wie sie gespeichert wurden, ist das eine andere Operation, und die Antwort darauf ist meist ein Desktop-Programm.

Die Wahl, und der Fall des Scans

Ist das PDF ein Scan, beginne mit OCR. Eine gescannte Seite enthält keinen Text, also liefert das Extrahieren von Text nichts und die Umwandlung in Word Fotografien. OCR erkennt die Zeichen und fügt eine echte Textebene hinzu; alles andere wird danach möglich. Die Erkennung ist nie perfekt und muss korrekturgelesen werden, und sie holt die Wörter zurück, nicht das Layout.

1234Tx

Vier Wege heraus, und was jeder dir bringt

  1. Reiner Text. Schnell und exakt, und er behält nichts vom Layout.
  2. Bilder der Seiten. Alles bleibt erhalten, nichts ist markierbar.
  3. OCR, für einen Scan. Erkannter Text, mit den Erkennungsfehlern, die das mit sich bringt.
  4. Ein bearbeitbares Dokument. Am nützlichsten und am wenigsten treu, weil die Struktur erschlossen werden muss.

Ansonsten wähle nach dem Ziel:

Textextraktion und Seitenrendering laufen beide in deinem Browser. Umwandlungen in Word und Excel laufen auf unserem Server: Die Datei wird über eine verschlüsselte Verbindung übertragen, nur für die Dauer der Umwandlung vorgehalten und danach gelöscht.

Tools, um die es in diesem Artikel geht

Quellen

Primärdokumentation zu den Aussagen oben.

Zuletzt geprüft: 24. September 2026

Veröffentlicht von iBuildPDF.

Mehr aus der Wissensdatenbank

Wissensdatenbank durchsuchen