Text aus einem PDF extrahieren
Hol alles, was in einem PDF steht, als reinen Text heraus — zum Durchsuchen, Einfügen oder Bearbeiten.
Speicher deine Lieblings-Tools
Leg ein kostenloses iBuildPDF-Konto an, um deine Lieblings-Tools zu behalten und jederzeit schnell wiederzufinden.
Kostenloses Konto. Die PDF-Tools selbst brauchen nie eins.
PDF-Datei auswählen
oder einfach hierher ziehen
Zulässige Formate: PDF
Wird verarbeitet…
Kurz gefasst
- Was das Tool macht
- Extrahiert die Textebene aus einem PDF und gibt sie als reine Textdatei zurück.
- Eingabe
- Ausgabe
- TXT
- Verarbeitung
- In deinem Browser
- Werden Dateien hochgeladen?
- Nein
- Konto nötig?
- Nein
- Am besten für
- Den Wortlaut eines Berichts herausholen, um ihn zu zitieren, zu durchsuchen oder anderswo einzufügen.
- Wichtigste Einschränkung
- Es liest den Text, der bereits in der Datei steckt. Ein gescanntes PDF, das nur aus Seitenbildern besteht, hat keine Textebene, und dieses Werkzeug kann keine erzeugen – dafür braucht es OCR.
So verwendest du dieses Tool
- Lade dein PDF hoch.
- Entscheide, ob Seitenumbrüche und Seitenmarkierungen erhalten bleiben.
- Sieh dir den extrahierten Text in der Vorschau an.
- Lade ihn als .txt-Datei herunter oder kopier ihn.
Warum iBuildPDF
Text von Hand aus einem PDF herauszukopieren, erzeugt zerrissene Zeilenenden, fehlende Leerzeichen und verlorene Absätze. Die Textebene sauber auszulesen, gibt dir etwas, mit dem du tatsächlich arbeiten kannst.
So funktioniert es
Die Textebene jeder Seite wird direkt gelesen, wobei Wort- und Zeilenpositionen genutzt werden, um Abstände und Zeilenumbrüche zu rekonstruieren. Es wird nichts neu getippt und nichts geraten — wenn das Dokument eine Textebene hat, ist das, was darin steht.
Häufige Fragen
Es kam nichts heraus — warum?
Dein PDF ist mit ziemlicher Sicherheit ein Scan: ein Bild einer Seite ganz ohne Textebene. Es gibt nichts zu extrahieren, bevor die Seite durch eine Texterkennung gelaufen ist. Das macht OCR, und das ist ein anderes Tool.
Bleibt das Layout erhalten?
Lesereihenfolge, Absätze und Zeilenumbrüche bleiben erhalten. Spalten, Tabellen und Formatierung nicht — reiner Text kann das nicht ausdrücken. Für das Layout ist „PDF in Word“ die richtige Umwandlung.
Warum kam bei der Textextraktion aus meinem Scan nichts heraus?
Weil darin kein Text zum Extrahieren steckt. Eine gescannte Seite oder ein als PDF gespeichertes Foto ist ein Bild, und die Extraktion liest echte Textobjekte, statt Buchstaben in einem Bild zu erkennen. Ein Bild von Wörtern in tatsächlichen Text zu verwandeln, braucht OCR, eine andere Technik, die diese Website derzeit nicht anbietet. Deine Datei ist nicht kaputt — sie hat schlicht keine Textebene.
Behält der extrahierte Text das ursprüngliche Layout?
Nicht zuverlässig, und das überrascht viele. Ein PDF positioniert Text über Koordinaten, statt Absätze, Spalten oder Tabellen als Strukturen zu speichern, die Extraktion muss die Lesereihenfolge also aus der Position erschließen. Zweispaltige Layouts können ineinandergeraten, und Tabellenzellen können in einer Zeile zusammenlaufen. Die Extraktion ist das richtige Werkzeug, um an die Wörter zu kommen; sie ist das falsche, um das Aussehen der Seite zu erhalten.
Woran erkenne ich, ob mein PDF echten Text hat?
Öffne es in irgendeinem PDF-Betrachter und versuch, ein paar Wörter mit dem Cursor zu markieren. Werden einzelne Buchstaben hervorgehoben und lassen sie sich kopieren, ist der Text echt und die Extraktion funktioniert. Markiert das Ziehen die ganze Seite als einen Block oder wird gar nichts hervorgehoben, ist es ein Bild und du siehst einen Scan — kein Extraktionswerkzeug findet darin Text, solange nicht zuerst OCR gelaufen ist.
Mehr dazu lesen
Mach mit deinem PDF weiter
Deine Datei ist fertig. Das sind die Dinge, die man danach meistens macht.