Was eine PDF-Datei wirklich ist
Was ist ein PDF im Kern?
Speicher deine Lieblings-Tools
Leg ein kostenloses iBuildPDF-Konto an, um deine Lieblings-Tools zu behalten und jederzeit schnell wiederzufinden.
Kostenloses Konto. Die PDF-Tools selbst brauchen nie eins.
Kurze Antwort
Ein PDF ist eine Beschreibung fertiger Seiten. Es hält genau fest, wo jedes Zeichen, jede Linie und jedes Bild auf einer Seite fester Größe sitzt, zusammen mit den Schriften, die zum Zeichnen gebraucht werden. Deshalb sieht es überall gleich aus — und deshalb ist es umständlich zu bearbeiten. In einem PDF gibt es keine Absätze, nur Markierungen an Positionen.
Was in der Datei steckt
Ein PDF besteht aus vier Teilen hintereinander, und drei davon lassen sich lesen, wenn du die Datei in einem einfachen Texteditor öffnest.
Die vier Teile einer PDF-Datei
- Header — eine Zeile mit der PDF-Version der Datei.
- Body — die nummerierten Objekte: Seiten, Schriften, Bilder und die Zeichenanweisungen.
- Querverweistabelle — die Byte-Position jedes Objekts, für direkten Zugriff.
- Trailer — wo die Tabelle beginnt und welches Objekt die Wurzel ist. Reader starten hier, am Ende.
Der Header ist eine Zeile, die die Version nennt. Der Body ist eine nummerierte Sammlung von Objekten — Seiten, Schriften, Bilder und die Inhaltsströme, die festlegen, was wo gezeichnet wird. Die Querverweistabelle hält den Byte-Offset jedes dieser Objekte fest. Der Trailer sagt, wo diese Tabelle beginnt und welches Objekt die Wurzel des Dokuments ist.
Die Tabelle ist der Teil, den es sich zu verstehen lohnt, denn sie erklärt das meiste Verhalten eines PDFs. Ein PDF wird nicht wie ein Brief von Anfang bis Ende gelesen, sondern nachgeschlagen. Ein Betrachter öffnet die Datei, springt ans Ende, liest den Trailer, findet die Tabelle und geht von da an direkt zu jedem benötigten Objekt. So zeigt dir ein Reader Seite 400 eines 900-seitigen Berichts, ohne die ersten 399 zu lesen.
Das erklärt auch, warum eine Datei, die beim Transfer ihre letzten paar Kilobyte verloren hat, meist gar nicht mehr öffnet. Die Objekte sind noch da; die Karte zu ihnen nicht. Warum ein PDF sich nicht öffnen lässt behandelt diesen Fall, und PDF reparieren kann die Tabelle manchmal aus dem rekonstruieren, was übrig ist.
Um die eigenen Angaben einer Datei zu sehen, meldet Seitenzahl und Dateiinfo die strukturellen Fakten, und der Metadaten-Editor zeigt die beschreibenden.
Warum es überall gleich aussieht
Jede Position in einem PDF ist absolut. Eine Textzeile ist nicht „der zweite Absatz“; sie ist eine Menge von Zeichen, platziert an festgelegten Koordinaten auf einer Seite fester Größe. Nichts fließt neu, wenn sich das Fenster ändert, weil es nichts zum Neufließen gibt. Die Layout-Entscheidungen wurden einmal getroffen, von dem, was die Datei erzeugt hat, und dann eingefroren.
Schriften sind die andere Hälfte des Versprechens. Ein PDF kann die verwendeten Schriften in sich selbst tragen, sodass ein Reader den Text mit denselben Formen zeichnet, die der Autor sah, statt irgendetwas zu ersetzen, das die Maschine gerade zur Hand hat. Ist eine Schrift nicht eingebettet, zeigt sich die Ersetzung — andere Zeichenbreiten, andere Zeilenumbrüche, gelegentlich ein anderes Alphabet. Das ist fast immer der Grund, warum ein Dokument auf dem Computer einer anderen Person falsch aussieht, und dazu gibt es einen eigenen Artikel.
Diese Festigkeit ist der ganze Wert des Formats. Sie ist auch die ganzen Kosten davon, und beides lässt sich nicht trennen: Ein Dokument, das garantiert überall identisch aussieht, ist ein Dokument, das sich an nichts anpassen kann.
Versionen, und die Frage nach PDF/A
Die Version im Header — 1.4, 1.7, 2.0 — sagt, welche Funktionen die Datei nutzen darf, nicht wie neu oder gut sie ist. Reader sind in der Praxis abwärtskompatibel, also öffnet sich eine 1.4-Datei von 2003 heute problemlos. Fast nie musst du dich darum kümmern, und „als ältere PDF-Version speichern“ ist selten die Lösung für irgendetwas.
Diese Varianten lohnt es sich zu kennen:
- PDF/A ist fürs Archivieren gedacht. Es verlangt, dass jede Schrift eingebettet ist, und verbietet alles, dessen Bedeutung sich verschieben könnte — keine externen Verweise, keine Skripte, keine Verschlüsselung. Eine PDF/A-Datei ist eine Wette darauf, dass sie in dreißig Jahren noch korrekt dargestellt wird.
- PDF/X ist für den kommerziellen Druck gedacht und legt Farbe und Seitengeometrie fest. Siehe ein PDF für den Druck vorbereiten.
- Getaggtes PDF fügt einen Strukturbaum hinzu — Überschriften, Listen, Lesereihenfolge —, wodurch ein Dokument mit einem Screenreader nutzbar wird. Was ein PDF barrierefrei macht geht darauf ein.
Das sind Einschränkungen, die auf demselben Format aufsetzen, keine anderen Formate. Eine PDF/A-Datei ist ein PDF, und jedes gewöhnliche Tool kann sie lesen.
Warum das Bearbeiten eines PDFs umständlich ist
Weil es keinen Text zum Bearbeiten gibt, jedenfalls nicht in dem Sinn, den ein Textverarbeitungsprogramm meint. Änderst du „März“ zu „September“, ist der Ersatz länger und kollidiert mit dem, was danach kommt — und nichts in der Datei weiß, dass diese Zeichen einen Satz bildeten oder dass der Satz zu einem Absatz gehörte, der sich neu umbrechen sollte. Ein PDF-Editor muss diese Struktur durch Schlussfolgern rekonstruieren, und das ist eben nur eine Vermutung, weshalb die Ergebnisse je nach Entstehung der Datei unterschiedlich ausfallen.
Was das in der Praxis bedeutet:
- Kleine Korrekturen — ein Datum, eine Zahl, ein Name — sind das, worin ein PDF-Editor wirklich gut ist.
- Umschreiben macht man besser an der Quelle. Bearbeite das Originaldokument und erzeuge ein frisches PDF; ist das Original verloren, liefert PDF in Word eine bearbeitbare Annäherung, und was dabei erhalten bleibt und was nicht lohnt sich vorher zu lesen.
- Arbeit auf Seitenebene — neu anordnen, löschen, drehen, zusammenfügen — ist einfach und verlustfrei, weil dabei ganze Objekte bewegt werden, statt ihren Inhalt anzufassen. Seiten neu anordnen und löschen erklärt, warum.
Eine Warnung, die mehr zählt als der Rest: Text in einem Editor mit einem schwarzen Rechteck zu überdecken, verbirgt nichts. Der Text steht noch in der Datei, darunter. Ein PDF richtig schwärzen ist eine andere Operation, und PDF schwärzen ist das Tool dafür.
Tools, um die es in diesem Artikel geht
Quellen
Primärdokumentation zu den Aussagen oben.