PDF in Excel

Hol Tabellen aus einem PDF heraus und bring sie nach Excel.

PDF-Datei auswählen

oder einfach hierher ziehen

Zulässige Formate: PDF

Sichere Server-Verarbeitung — automatisch gelöschtDieses Werkzeug benötigt eine serverseitige Verarbeitung. Deine Datei wird über eine verschlüsselte Verbindung an den Verarbeitungsserver von iBuildPDF gesendet, nur für die Dauer der Umwandlung vorgehalten und danach automatisch gelöscht.

Kurz gefasst

Was das Tool macht
Findet Tabellen in einem PDF und schreibt sie als echte Zellen in eine Tabellenkalkulation, ein Blatt pro Dokument.
Eingabe
PDF
Ausgabe
XLSX
Verarbeitung
Auf unserem Server
Werden Dateien hochgeladen?
Ja, vorübergehend
Konto nötig?
Nein
Am besten für
Zahlen aus einem Kontoauszug, einer Rechnung oder einem Bericht zurückholen, um sie zu summieren, statt sie von Hand abzutippen.
Wichtigste Einschränkung
Es extrahiert Tabellen, keine Seiten. Ein PDF aus fließendem Text liefert nichts, weil nichts Tabellenförmiges darin steckt — das ist eine richtige Antwort und kein Fehlschlag. Tabellen ohne gezogene Linien sind der schwerste Fall und kommen womöglich mit zusammengefassten Spalten zurück.

So verwendest du dieses Tool

  1. Wähl ein PDF, das eine Tabelle enthält.
  2. Klick auf „Anwenden“, um es über eine verschlüsselte Verbindung zur Extraktion zu schicken.
  3. Warte, während die Seiten nach Tabellenstruktur durchsucht werden.
  4. Lade die .xlsx herunter und prüf, ob die Spalten dort gelandet sind, wo du sie erwartest.

Warum iBuildPDF

Das ist die am wenigsten vorhersagbare Umwandlung auf dieser Seite, und es lohnt sich zu wissen, warum, bevor du es versuchst. PDFs enthalten keine Tabellen. Sie enthalten Text, der auf einer Seite positioniert ist, und eine Tabelle ist etwas, das ein menschliches Auge aus dieser Positionierung erschließt. Die Extraktion muss dasselbe erschließen, und wie gut ihr das gelingt, hängt ganz davon ab, wie das PDF gebaut wurde — eine aus einer Tabellenkalkulation exportierte Tabelle wird fast perfekt extrahiert, eine von Hand mit Tabulatoren gezeichnete womöglich gar nicht erkannt.

So funktioniert es

Jede Seite wird auf Text untersucht, der in ausgerichteten Zeilen und Spalten angeordnet ist. Wo diese Struktur gefunden wird, wird sie als Zellen in die Arbeitsmappe geschrieben; wo nicht, wird nichts geschrieben. Die Datei wird über eine verschlüsselte Verbindung auf unserem Server verarbeitet und danach gelöscht.

Häufige Fragen

Ich habe eine leere Datei bekommen oder eine Fehlermeldung, dass es nichts zu extrahieren gab.

Das heißt, es wurde keine Tabelle erkannt. Meist hat das eine von zwei Ursachen: Das PDF ist ein Scan, es gibt also überhaupt keinen Text, der sich in Spalten ausrichten ließe — lass zuerst OCR darüberlaufen; oder der Inhalt ist Fließtext statt Tabelle, dann ist „Text aus einem PDF extrahieren“ das Tool, das du willst.

Die Spalten sind an den falschen Stellen zusammengefasst oder getrennt.

Das passiert bei Tabellen ohne gezogene Linien und mit ungleichmäßigen Abständen, wo die Grenze zwischen zwei Spalten wirklich mehrdeutig ist. Die Daten sind alle da — die Spalte in Excel zu trennen geht schneller, als die Seite neu zu tippen.

Kommt es mit einer Tabelle zurecht, die über mehrere Seiten läuft?

Jede Seite wird der Reihe nach extrahiert, eine lange Tabelle kommt also als aufeinanderfolgende Blöcke an und nicht als ein durchgehender Bereich. Die wiederholten Kopfzeilen danach zu entfernen ist meist die einzige nötige Nacharbeit.

Kann es aus einem gescannten Kontoauszug extrahieren?

So nicht — ein Scan hat keine Textebene. Schick ihn zuerst durch OCR und extrahier dann. Wie genau das Ergebnis nach OCR ist, hängt davon ab, wie sauber der Scan war; prüf die Zahlen also gegen das Original.

Mehr dazu lesen