Dateigröße und Komprimierung

Wie PDF-Kompression wirklich funktioniert

Was passiert eigentlich, wenn ein PDF komprimiert wird?

Kurze Antwort

In fast jedem großen PDF sind die Bytes Fotos. Die Datei zu komprimieren heißt also, diese Bilder zu dekodieren, zu verkleinern und zurückzuschreiben. Text, Vektoren und Struktur sind bereits komprimiert und bleiben unangetastet — außer du wählst den destruktiven Modus, der ganze Seiten in Bilder umwandelt.

Die kurze Antwort

Ein PDF ist kein einzelner komprimierter Klumpen. Es ist eine Sammlung nummerierter Objekte — Seitenbeschreibungen, Schriften, Bilder, Anmerkungen, Metadaten —, zusammengehalten von einer Querverweistabelle, so definiert in ISO 32000-1, und jedes Objekt bringt seinen eigenen Kompressionsfilter mit. Es gibt keinen einzelnen Regler mit der Aufschrift „kleiner“; es gibt mehrere verschiedene Dinge, die ein Tool tun kann, und sie greifen an völlig unterschiedlichen Stellen der Datei an.

Drei davon zählen in der Praxis. Die strukturelle Optimierung räumt den Objektgraphen auf und bringt meist sehr wenig. Die Bild-Neukomprimierung dekodiert die eingebetteten Fotos, reduziert ihre Pixelmaße und kodiert sie neu — daher kommt fast die gesamte reale Einsparung. Die Rasterung wirft die Seitenbeschreibung komplett weg und ersetzt jede Seite durch ein Bild von sich selbst; sie ist der größte Hebel und der einzige destruktive. Herauszufinden, welche der drei deine Datei braucht, ist der größte Teil des Problems.

Wo die Bytes tatsächlich stecken

Ein 40-seitiges Textdokument liegt in der Regel deutlich unter einem Megabyte. Ein 10-seitiger gescannter Vertrag kann das Zwanzigfache haben. Der Unterschied ist nicht die Seitenzahl: Die eine Datei speichert Anweisungen, die andere Fotos.

123

Wo die Bytes wirklich stecken

  1. Bilder. Bei fast jedem großen PDF ist das fast die ganze Datei.
  2. Eingebettete Schriften — ein paar hundert Kilobyte, egal ob das Dokument 5 oder 500 Seiten hat.
  3. Der Text selbst und die Struktur, die ihn zusammenhält. Meist ein Rundungsfehler.

Text lebt in einem Inhaltsstrom: ein kurzes Programm aus Zeichenbefehlen, das angibt, welche Schrift, in welcher Größe, an welchen Koordinaten, mit welchen Zeichen. Dieser Strom wird mit dem Flate-Filter gespeichert — dem DEFLATE-Algorithmus aus RFC 1951, derselben Kompression, die in ZIP und PNG steckt. Sie ist also schon gelaufen. Eine Seite Fließtext kostet ein paar Kilobyte; vierzig davon kosten einen Bruchteil dessen, was ein einziges Foto kostet.

Eine gescannte Seite ist das Gegenteil. Es gibt keinen Text und überhaupt keine Layoutbeschreibung: ein Bildobjekt, meist ein JPEG, über die ganze Seite gezogen, und ein Inhaltsstrom aus drei oder vier Befehlen. Die Datei ist die Bilder.

Deshalb heißt „mein PDF komprimieren“ fast immer „die Bilder neu komprimieren“ — und deshalb schwanken die Ergebnisse zwischen Dateien, die sich ähnlich sehen, so extrem. Ein Bericht voller Produktfotos hat enorm viel Luft. Ein reines Text-PDF hat fast keine: Lass einen Allzweck-Kompressor darüberlaufen, und du gewinnst typischerweise einstellige Prozentwerte, weil das Einzige, was noch zu quetschen wäre, längst gequetscht ist. Wenn du nicht weißt, welche Art Datei du hast: /pdf-page-count nennt dir Seitenzahl, Seitengrößen und ob eine Textebene vorhanden ist.

Verlustfreie und strukturelle Optimierung

Bevor überhaupt ein Bild angefasst wird, kann ein Schreibprogramm die Datei selbst umbauen. Nichts Sichtbares ändert sich, nichts geht verloren. Drei Gewinne sind üblich.

  • Objektströme. ISO 32000-1 erlaubt es, viele kleine Nicht-Strom-Objekte in einen einzigen komprimierten Strom zu packen, statt sie einzeln mit jeweils eigenem Overhead zu schreiben.
  • Verwaiste Objekte entfernen. Ein PDF zu bearbeiten hängt oft etwas an, statt neu zu schreiben. Eine gelöschte Seite, eine ersetzte Schrift, eine frühere Fassung einer Anmerkung — all das kann noch in der Datei liegen, ohne dass etwas darauf verweist. Ein vollständiges Neuschreiben behält nur, worauf das Dokument tatsächlich zeigt.
  • Metadaten entfernen. Dokumenteigenschaften, XMP-Pakete und anwendungsspezifische private Daten lassen sich löschen. Das sind Kilobyte, keine Megabyte, und der eigentliche Nutzen ist Datenschutz, nicht Größe; /remove-pdf-metadata ist das Tool dafür.

Sei realistisch, was dabei herauskommt. Bei einem PDF, das einmal sauber aus einer modernen Anwendung exportiert wurde, bringt strukturelle Optimierung typischerweise einstellige Prozentwerte und manchmal fast nichts, weil der Exporter das bereits erledigt hat. Bei einer Datei, die ein Dutzend Mal in mehreren Programmen geöffnet, bearbeitet und neu gespeichert wurde, können verwaiste Objekte einen erheblichen Teil der Datei ausmachen, und ein Neuschreiben bringt deutlich mehr. Was es nie schafft: aus einem 50-MB-Scan einen 2-MB-Scan zu machen.

Bilder neu komprimieren: zwei unabhängige Hebel

Sobald du akzeptierst, dass die Bilder das Problem sind, gibt es genau zwei Dinge, die du an jedem einzelnen ändern kannst — und sie sind unabhängig voneinander.

Auflösung

Die effektive Auflösung eines Bildes ist keine Eigenschaft des Bildes allein. Sie ist die Pixelbreite geteilt durch die Breite, in der es auf der Seite tatsächlich gezeichnet wird. Ein 2400 Pixel breites Foto über eine 8-Zoll-Seite sind 300 DPI. Dieselbe Datei als Logo in einer ein Zoll großen Ecke sind 2400 DPI, und jedes Pixel jenseits der ersten paar hundert ist unsichtbar — Details, die kein Bildschirm und kein Drucker je zeigen wird.

Die nützliche Frage lautet also nie „wie groß ist dieses Bild“, sondern „wie groß ist es im Verhältnis dazu, wie es verwendet wird“. Beim Heruntersampeln wird das Pixelraster so verkleinert, dass die effektive Auflösung bei etwas Sinnvollem landet. Rund 150 DPI liegen bequem über dem, was ein Bildschirm auflöst, und deutlich unter dem, was Druck braucht; unterhalb von etwa 100 DPI wird Text innerhalb eines gescannten Bildes sichtbar weich.

Qualität

JPEG, spezifiziert in ITU-T T.81, ist von Haus aus verlustbehaftet: Es wandelt Pixelblöcke in Frequenzkoeffizienten um und quantisiert sie, wobei es die Details verwirft, für die das Auge am wenigsten empfindlich ist. Die Qualitätseinstellung bestimmt, wie aggressiv das geschieht. Niedrige Qualität ist kleiner und erzeugt irgendwann Blockartefakte und Säume um scharfe Kanten — und genau dort sitzt gescannter Text, weshalb Scans eine Qualitätsreduktion schlechter vertragen als Fotos.

Was iBuildPDF macht

Der Smart-Modus auf /compress-pdf geht den Objektgraphen des PDFs durch, findet jedes eingebettete Bild-XObject, dekodiert es, sampelt es auf rund 150 DPI herunter — gemessen daran, wie groß es auf der Seite tatsächlich gezeichnet wird —, kodiert es als JPEG mit Qualität 0,80 neu und ersetzt diesen Bildstrom an Ort und Stelle. Der Modus „Stark“ ist derselbe Mechanismus bei rund 96 DPI und Qualität 0,58.

Die Inhaltsströme der Seiten werden nie angerührt. Die Folge ist wichtig: Text bleibt markierbar und durchsuchbar, Vektorgrafiken bleiben bei jedem Zoom scharf, und Links, Lesezeichen, Formularfelder und Anmerkungen bleiben alle erhalten. Nur die Pixel in den Bildobjekten ändern sich. Manche Bilder werden bewusst übersprungen — warum manche PDFs nicht komprimiert werden können erklärt, welche und warum.

Rastern: die destruktive Option

Der letzte Ansatz gibt das Dokumentmodell auf. Jede Seite wird so gerendert, wie ein Betrachter sie sehen würde, als JPEG gespeichert, und es wird ein neues PDF gebaut, das nichts als diese Bilder enthält.

Das funktioniert dort, wo nichts anderes funktioniert, weil es gleichgültig ist, warum das Original groß war. Eine dichte Vektorkarte aus hunderttausend Zeichenoperationen wird zu einem einzigen flachen Foto. Ein Dokument, dessen Bilder alle in Formaten vorliegen, die sich nicht neu komprimieren lassen, wird zu einem Dokument ohne solche Bilder. Die Ausgabegröße hängt nur von den Seitenmaßen und der JPEG-Qualität ab, nicht vom Inhalt des Originals.

Der Preis ist hoch und endgültig:

  • Kein markierbarer Text. Es lässt sich nichts mehr herauskopieren.
  • Keine Suche, in keinem Betrachter, nie.
  • Links, Lesezeichen, Formularfelder und Anmerkungen sind weg.
  • Screenreader haben nichts zu lesen; das Dokument wird unzugänglich.
  • Vektorgrafiken haben jetzt eine feste Auflösung und werden unscharf, wenn man hineinzoomt oder größer druckt.

Der Modus „Maximum“ von iBuildPDF macht genau das, und er ist der einzige destruktive Modus. Die Seite kennzeichnet ihn als destruktiv, bevor du ihn ausführst, damit die Entscheidung bewusst fällt und nicht als spätere Überraschung. Zurück geht es nicht: Der Text ist nicht versteckt, er existiert in der Datei nicht mehr. Und weil iBuildPDF kein OCR macht, kann hier kein Tool die Textebene nachträglich wiederherstellen. Behalte das Original.

Den richtigen Ansatz wählen

AnsatzWas sich ändertText bleibt markierbarTypischer Einsatz
Strukturell / verlustfreiObjektanordnung, verwaiste Objekte, Metadaten. Keine sichtbare Änderung.JaDateien, die oft bearbeitet und neu gespeichert wurden; Aufräumen aus Datenschutzgründen.
Bild-Neukomprimierung (Smart, ca. 150 DPI, q0,80)Eingebettete Fotos werden heruntergesampelt und neu kodiert. Inhaltsströme unangetastet.JaDie Voreinstellung. Berichte, Broschüren, alles mit Fotos darin.
Bild-Neukomprimierung (Stark, ca. 96 DPI, q0,58)Derselbe Mechanismus, aggressiver. Sichtbare Weichzeichnung bei detailreichen Bildern.JaEin hartes Größenlimit, das du sonst nicht einhältst, wenn Lesbarkeit am Bildschirm genügt.
Rasterung (Maximum)Jede Seite wird zu einem flachen Bild. Alles andere wird verworfen.NeinLetzter Ausweg: vektorlastige Dateien, oder wenn nichts anderes auch nur in die Nähe kam.

Eine brauchbare Reihenfolge: Fang mit Smart an und sieh dir das Ergebnis an. Ist es klein genug, hör auf — du hast nichts Wichtiges verloren. Wenn nicht, finde erst heraus, warum die Datei groß ist, bevor du eskalierst, denn der Modus „Stark“ hilft nur, wenn die Datei wegen Fotos groß ist. Für alles andere siehe warum manche PDFs nicht komprimiert werden können; wenn du auf ein festes Limit hinarbeitest, behandelt ein PDF unter 1 MB bringen, was zu tun ist, wenn das Ziel nicht erreichbar ist.

All das läuft in deinem Browser: Die Datei wird über die File API gelesen und lokal von pdf-lib und PDF.js verarbeitet, hochgeladen wird nichts. Die praktische Grenze ist der Arbeitsspeicher deines Geräts, nicht eine feste Dateigröße.

Tools, um die es in diesem Artikel geht

Quellen

Primärdokumentation zu den Aussagen oben.

Zuletzt geprüft: 16. September 2026

Veröffentlicht von iBuildPDF.

Mehr aus der Wissensdatenbank

Wissensdatenbank durchsuchen