Warum eine Tabelle aus einem PDF in Excel falsch ankommt
Warum kommt meine Tabelle als Chaos heraus, wenn ich ein PDF in Excel umwandle?
Speicher deine Lieblings-Tools
Leg ein kostenloses iBuildPDF-Konto an, um deine Lieblings-Tools zu behalten und jederzeit schnell wiederzufinden.
Kostenloses Konto. Die PDF-Tools selbst brauchen nie eins.
Kurze Antwort
Weil die Tabelle nie in der Datei war. Ein PDF hält jedes Textstück an einer Position auf der Seite fest, und die Linien als eigene Zeichenanweisungen, die an nichts hängen. Keine Zeile, keine Spalte und keine Zelle wird gespeichert. Ein Konverter muss aus der Ausrichtung der Werte erschließen, wo die Spalten lagen — eine verbundene Überschrift, ein Wert, der auf zwei Zeilen umbricht, oder eine Tabelle ohne Linien kann die Grenzen jeweils verschieben und die Daten in die falschen Zellen rutschen lassen. Dabei ist nichts beschädigt; die Information, die der Konverter gebraucht hätte, wurde von Anfang an nicht festgehalten.
In der Datei ist keine Tabelle
Das ist der Teil, den man vor allem anderen glauben sollte, denn jede weitere Überraschung folgt daraus.
Dieselbe Seite, wie ein Leser sie sieht und wie die Datei sie hält
- Was du siehst: Zeilen, Spalten und Zellen, wobei Linien die Struktur offensichtlich machen.
- Was die Datei festhält: jeden Wert als eigenes Textstück an seiner eigenen Position auf der Seite. Nichts verbindet die drei Werte einer Zeile miteinander.
- Die Linien sind Zeichenanweisungen, wie jede andere Markierung auf der Seite. Sie hängen nicht am Text, und eine ohne sie gezeichnete Tabelle wird identisch gespeichert.
Wenn ein Textprogramm oder eine Tabellenkalkulation ein PDF exportiert, zeichnet es die Tabelle. Es schreibt INV-1001 an eine Position, 2026-01-04 an eine andere, 1,240.00 an eine dritte, und zeichnet dann ein paar Linien. Die Linien sind Zeichenanweisungen wie alle anderen — dieselbe Maschinerie, die ein Logo oder eine Unterstreichung gezeichnet hat. Nichts in der Datei sagt, dass diese drei Werte zu einer Zeile gehören, oder dass die Linie zwischen zwei von ihnen eine Spaltengrenze ist und kein schmückender Strich.
Das lässt sich leicht prüfen. Nimm eine Seite mit zwei Tabellen darauf, eine mit Linien und eine ohne, und frag ein beliebiges Textextraktions-Tool, was auf der Seite steht. Beide kommen als dasselbe zurück: eine Liste von Werten, einer nach dem anderen, ungefähr in der Reihenfolge, in der sie gezeichnet wurden. Die liniierte und die unliniierte Tabelle sind in der Ausgabe nicht zu unterscheiden, denn die Linien waren nie Teil der Daten.
Ein PDF kann echte Struktur tragen — ein getaggtes PDF hält fest, welche Markierungen eine Tabelle, eine Zeile und eine Zelle sind, vor allem für Screenreader. Das ist optional, die meisten Exporte erzeugen es nicht, und die meisten, die es erzeugen, tun es unvollständig. Was ein PDF barrierefrei macht behandelt, was Tagging ist und warum es in der Praxis so wenig davon gibt.
Wenn ein Konverter dir also eine Arbeitsmappe übergibt, hat er keine Tabelle aus dem Dokument gelesen. Er hat geschaut, wo der Text landete, und daraus einen Schluss gezogen.
Was der Konverter tatsächlich errät
Zwei Dinge, und das zweite ist viel schwerer als das erste.
Woher Spaltengrenzen kommen und was sie verschiebt
- Die Grenzen werden erschlossen, nicht gelesen: Ein Streifen Weißraum, der über die Höhe der Tabelle läuft, wird als Rand einer Spalte genommen.
- Ein Wert, der lang genug ist, über diesen Streifen zu reichen, schließt ihn, und die Grenze, die von ihm abhing, verschiebt sich oder verschwindet.
- Text, der innerhalb seiner Zelle umbrochen ist, sitzt auf einer neuen Grundlinie und wird deshalb als neue Zeile gelesen, mit sonst leeren Zellen.
Zeilen sind meist einfach: Text, der ungefähr auf derselben Grundlinie sitzt, ist eine Zeile. Das funktioniert überwiegend, und deshalb wandelt sich eine einfache Tabelle in der Regel gut um.
Spalten müssen aus den senkrechten Lücken erschlossen werden — den Gassen, die die Seite hinunterlaufen und in denen nie Text erscheint. Finde einen Streifen Weißraum, der vom oberen bis zum unteren Rand der Tabelle frei bleibt, und das ist eine Spaltengrenze. Das ist eine gute Heuristik. Daran scheitert sie:
- Ein Wert, der lang genug ist, die Gasse zu schließen. Eine lange Beschreibung oder eine große Zahl mit Trennzeichen kann über den Streifen reichen, der die Grenze definierte, und jede Zeile darunter wird dann vielleicht mit einer Spalte weniger gelesen.
- Text, der innerhalb einer Zelle umbrochen ist. Die zweite Zeile sitzt auf ihrer eigenen Grundlinie und wird deshalb als eigene Tabellenzeile gelesen — und die Zellen daneben sind leer, und so kommt eine Tabelle mit 40 Zeilen mit 60 Zeilen darin an.
- Verbundene oder übergreifende Überschriften. Ein Titel, der über drei Spalten zentriert ist, passt zu keiner von ihnen und kann die Kopfzeile aus der Ausrichtung mit allem darunter ziehen.
- Rechtsbündige Zahlen neben linksbündigem Text. Die Gasse ist nicht gerade, ihre Kanten sind also unscharf, und die Grenze landet je nach den herangezogenen Zeilen an einer anderen Stelle.
- Eine Tabelle, die auf der nächsten Seite weitergeht. Jede Seite wird aus ihren eigenen Hinweisen rekonstruiert, also wird eine wiederholte Kopfzeile zu einer Datenzeile in der Mitte, und die auf Seite zwei gefundenen Spaltengrenzen müssen nicht zu denen von Seite eins passen.
Nichts davon ist ein Mangel eines bestimmten Konverters. Es ist ein Rekonstruktionsproblem, und Rekonstruktionen sind manchmal falsch.
Was PDF in Excel auf dieser Website tut
PDF in Excel ist ein Tabellen-Extraktor. Das ist kein Detail der Bauweise, das ist, was das Tool ist, und es zu wissen erspart viel Verwirrung:
- Es sucht nach tabellarischer Struktur und schreibt, was es findet, in eine Arbeitsmappe. Es versucht nicht, die Seite nachzubilden.
- Fließtext ist keine Tabelle, also kommt Fließtext nicht heraus. Eine Seite voller Absätze erzeugt nichts, und das ist die richtige Antwort und kein Fehlschlag.
- Es läuft auf dem Verarbeitungsserver dieser Website, nicht in deinem Browser — das ist eine der Aufgaben, die ein Browser wirklich nicht leisten kann. Die Datei wird hochgeladen, umgewandelt und nach dem Auftrag gelöscht; der Hinweis auf der Tool-Seite sagt, was mit ihr passiert.
Zwei verwandte Tools sind oft die bessere Wahl:
- PDF in Word versucht, die Seite wieder aufzubauen — Layout, Überschriften und Tabellen als Word-Tabellen. Wenn du das Dokument willst und nicht die Zahlen, fang dort an. Ein PDF in Word umwandeln, ohne Formatierung zu verlieren behandelt, was dabei erhalten bleibt.
- Text extrahieren läuft in deinem Browser und gibt dir den rohen Text ohne jede Rekonstruktion. Bei einer kleinen Tabelle ist es oft schneller, das in eine Tabellenkalkulation einzufügen und selbst aufzuteilen, als mit einem Konverter zu streiten, und du siehst genau, womit du arbeitest.
Wenn es sagt, es gab nichts zu extrahieren
Diese Meldung heißt, dass der Konverter gelaufen ist, die Seiten gelesen hat und keine tabellarische Struktur gefunden hat. Das ist eine echte Antwort, und es gibt dafür drei übliche Gründe.
Die Seite ist ein Bild. Ein Scan, ein Foto oder ein Screenshot, der in ein Dokument eingefügt wurde, enthält überhaupt keinen Text — nur Pixel, die wie Text aussehen. Es gibt nichts, was ein Extraktor verorten könnte, also gibt es nichts zu finden. Führe zuerst OCR aus, um eine Textebene hinzuzufügen, und wandle dann um. Ist dieses PDF gescannt oder ist es Text? zeigt, wie du das in wenigen Sekunden erkennst, und OCR oder PDF in Word? erklärt, was du brauchst.
Was du da ansiehst, ist keine Tabelle. Eine Liste mit ausgerichteten Zahlen, ein Formular oder ein zweispaltiges Layout kann für einen Menschen wie eine Tabelle aussehen und einem Extraktor keine tabellenartige Struktur bieten. Text extrahieren ist das richtige Tool dafür.
Die Tabelle ist locker gesetzt. Breite, ungleichmäßige Abstände ohne durchgehende Gassen geben der Heuristik nichts, woran sie sich festmachen kann. Nur diese eine Seite umzuwandeln funktioniert manchmal, wo das ganze Dokument nicht funktionierte, weil die Hinweise nicht länger über Seiten gemittelt werden, die sich widersprechen.
Zu einem besseren Ergebnis kommen
- Geh zurück zur Quelle, wenn es sie gibt. Wenn das PDF aus einer Tabellenkalkulation kam, hat diese Datei noch die echten Zeilen und Spalten. Jede Umwandlung ist eine Rekonstruktion; das Original ist keine.
- Wandle die Seiten mit der Tabelle um, nicht das ganze Dokument. Nutze zuerst Seiten extrahieren. Weniger Seiten heißt weniger widersprüchliche Hinweise, und du findest schnell heraus, ob das Problem eine einzige unglückliche Seite ist.
- Prüf das Ergebnis gegen das PDF, bevor du es benutzt. Vergleich die Zeilenzahl und addiere eine Spalte. Stille Fehler — eine verschobene Spalte, eine Zeile, die in die darüber gerutscht ist — sind die, die Schaden anrichten, weil nichts kaputt aussieht.
- Ist das Layout hoffnungslos, extrahier stattdessen den Text. Text extrahieren plus die Funktion „Text in Spalten“ von Excel gibt dir die Kontrolle über die Aufteilung, und bei einer Tabelle unter ein paar Dutzend Zeilen geht es meist schneller.
- Gescannte Seiten brauchen OCR, und OCR einer Tabelle ist doppelt geraten — zuerst, welches Zeichen das ist, dann, wo die Spalten lagen. Prüf Zahlen einzeln; eine 6, die als 8 gelesen wurde, sieht nirgends falsch aus.
- Prüf zuerst die Seitenzahl. Seitenzahl und Dateiinfo meldet auch, ob das Dokument überhaupt eine Textebene hat, was die Scan-Frage klärt, bevor du irgendetwas umwandelst.
Tools, um die es in diesem Artikel geht
Quellen
Primärdokumentation zu den Aussagen oben.