Text aus einem PDF extrahieren

Hol alles, was in einem PDF steht, als reinen Text heraus — zum Durchsuchen, Einfügen oder Bearbeiten.

PDF-Datei auswählen

oder einfach hierher ziehen

Zulässige Formate: PDF

Privat: auf deinem Gerät verarbeitetDeine Datei verlässt deinen Browser nie.

Kurz gefasst

Was das Tool macht
Extrahiert die Textebene aus einem PDF und gibt sie als reine Textdatei zurück.
Eingabe
PDF
Ausgabe
TXT
Verarbeitung
In deinem Browser
Werden Dateien hochgeladen?
Nein
Konto nötig?
Nein
Am besten für
Den Wortlaut eines Berichts herausholen, um ihn zu zitieren, zu durchsuchen oder anderswo einzufügen.
Wichtigste Einschränkung
Es liest den Text, der bereits in der Datei steckt. Ein gescanntes PDF, das nur aus Seitenbildern besteht, hat keine Textebene, und dieses Werkzeug kann keine erzeugen – dafür braucht es OCR.

So verwendest du dieses Tool

  1. Lade dein PDF hoch.
  2. Entscheide, ob Seitenumbrüche und Seitenmarkierungen erhalten bleiben.
  3. Sieh dir den extrahierten Text in der Vorschau an.
  4. Lade ihn als .txt-Datei herunter oder kopier ihn.

Warum iBuildPDF

Text von Hand aus einem PDF herauszukopieren, erzeugt zerrissene Zeilenenden, fehlende Leerzeichen und verlorene Absätze. Die Textebene sauber auszulesen, gibt dir etwas, mit dem du tatsächlich arbeiten kannst.

So funktioniert es

Die Textebene jeder Seite wird direkt gelesen, wobei Wort- und Zeilenpositionen genutzt werden, um Abstände und Zeilenumbrüche zu rekonstruieren. Es wird nichts neu getippt und nichts geraten — wenn das Dokument eine Textebene hat, ist das, was darin steht.

Häufige Fragen

Es kam nichts heraus — warum?

Dein PDF ist mit ziemlicher Sicherheit ein Scan: ein Bild einer Seite ganz ohne Textebene. Es gibt nichts zu extrahieren, bevor die Seite durch eine Texterkennung gelaufen ist. Das macht OCR, und das ist ein anderes Tool.

Bleibt das Layout erhalten?

Lesereihenfolge, Absätze und Zeilenumbrüche bleiben erhalten. Spalten, Tabellen und Formatierung nicht — reiner Text kann das nicht ausdrücken. Für das Layout ist „PDF in Word“ die richtige Umwandlung.

Warum kam bei der Textextraktion aus meinem Scan nichts heraus?

Weil darin kein Text zum Extrahieren steckt. Eine gescannte Seite oder ein als PDF gespeichertes Foto ist ein Bild, und die Extraktion liest echte Textobjekte, statt Buchstaben in einem Bild zu erkennen. Ein Bild von Wörtern in tatsächlichen Text zu verwandeln, braucht OCR, eine andere Technik, die diese Website derzeit nicht anbietet. Deine Datei ist nicht kaputt — sie hat schlicht keine Textebene.

Behält der extrahierte Text das ursprüngliche Layout?

Nicht zuverlässig, und das überrascht viele. Ein PDF positioniert Text über Koordinaten, statt Absätze, Spalten oder Tabellen als Strukturen zu speichern, die Extraktion muss die Lesereihenfolge also aus der Position erschließen. Zweispaltige Layouts können ineinandergeraten, und Tabellenzellen können in einer Zeile zusammenlaufen. Die Extraktion ist das richtige Werkzeug, um an die Wörter zu kommen; sie ist das falsche, um das Aussehen der Seite zu erhalten.

Woran erkenne ich, ob mein PDF echten Text hat?

Öffne es in irgendeinem PDF-Betrachter und versuch, ein paar Wörter mit dem Cursor zu markieren. Werden einzelne Buchstaben hervorgehoben und lassen sie sich kopieren, ist der Text echt und die Extraktion funktioniert. Markiert das Ziehen die ganze Seite als einen Block oder wird gar nichts hervorgehoben, ist es ein Bild und du siehst einen Scan — kein Extraktionswerkzeug findet darin Text, solange nicht zuerst OCR gelaufen ist.

Mehr dazu lesen