Umwandeln und Extrahieren

Eine Webseite als PDF speichern

Warum kommt eine als PDF gespeicherte Webseite so schlecht heraus?

Kurze Antwort

Weil eine Webseite keine Seiten hat. Sie ist eine durchgehende Spalte, die sich dem Fenster anpasst, und ein PDF daraus zu machen heißt, sie an Stellen in feste Blätter zu schneiden, die niemand ausgewählt hat. Überschriften landen am Fuß einer Seite, Tabellen brechen mittendurch, und alles relativ zum Fenster Positionierte landet ungewollt irgendwo.

Zwei Formate mit gegensätzlichen Annahmen

Eine HTML-Seite wird bewusst ohne feste Größe geschrieben. Sie passt sich einem Telefon oder einem breiten Monitor an, sie kann beim Scrollen mehr Inhalt nachladen, und ihr Layout wird in dem Moment berechnet, in dem du hinschaust.

Ein PDF ist in jeder Hinsicht das Gegenteil: feste Seitengröße, feste Positionen, einmal entschieden. Siehe was ein PDF wirklich ist.

Die Umwandlung muss also die Information erfinden, die die Webseite nie hatte — wie breit die Seite ist, und wo jedes Blatt endet. Die üblichen Opfer:

  • Fixierte Kopfzeilen und schwebende Schaltflächen wiederholen sich auf jeder Seite oder liegen über dem Text.
  • Cookie-Banner und Newsletter-Pop-ups werden mit allem anderen zusammen erfasst.
  • Alles, was beim Scrollen nachlädt, kann fehlen, weil es nie geladen wurde.
  • Breite Tabellen werden am rechten Rand abgeschnitten statt umgebrochen.
  • Dunkle Designs drucken dunkel und verbrauchen dabei jede Menge Tinte.

Wo die Schnitte landen

Der Konverter füllt ein Blatt, schneidet und beginnt das nächste. Er weiß nicht, dass die Zeile, durch die er gerade geschnitten hat, eine Überschrift war.

123

Eine durchgehende Seite in Blätter schneiden

  1. Eine Webseite: eine Spalte ohne Seiten darin und ohne natürlichen Haltepunkt.
  2. Wo die Schnitte landen — entschieden davon, was passt, nicht davon, was der Inhalt bedeutet.
  3. Das Ergebnis. Ein Druck-Stylesheet verhindert, dass ein Schnitt mitten in einer Überschrift oder Tabelle landet.

Gut gebaute Websites enthalten ein Druck-Stylesheet — Anweisungen für genau diesen Fall, die dem Browser sagen, die Navigation zu verstecken, keinen Umbruch innerhalb einer Tabellenzeile zu machen und eine Überschrift beim darunterstehenden Text zu behalten. Wandelt sich eine Seite wunderbar um, liegt es daran. Wandelt sie sich schlecht um, hat die Website das Drucken schlicht nie bedacht, und es gibt nichts auf der Seite, das den Schnitt lenkt.

HTML in PDF führt die Umwandlung aus und beachtet ein Druck-Stylesheet, wo eines existiert.

Ein sauberes Ergebnis bekommen

  • Such zuerst nach einer Druck- oder Lese-Ansicht. Viele Artikel haben eine, und sie ist eine Seite, die genau dafür gebaut ist — keine Navigation, keine Seitenleiste, kein Banner.
  • Scroll vor der Umwandlung bis nach unten, damit alles, was träge lädt, geladen ist.
  • Schließ die Banner, bevor du erfasst, sonst werden sie dauerhaft.
  • Nutze Querformat für breite Tabellen. Das ist die eine Einstellung, die sie zuverlässig rettet.
  • Schneid danach zu, statt gegen das Layout anzukämpfen. PDF zuschneiden entfernt einen wiederholten Kopfzeilenrand auf jeder Seite in einem Durchgang, und Seiten entfernen wirft den Kommentarbereich raus.
  • Kombinier verwandte Seiten mit PDF zusammenfügen zu einem Dokument — nützlich für eine Dokumentation, die Seite für Seite gespeichert wurde.

Ist die erfasste Seite wegen randfüllender Fotos riesig, holt PDF komprimieren meist das meiste davon zurück.

Was sich nicht erfassen lässt

Alles hinter einem Login, das ein Konverter nicht erreicht. Ein Tool, das eine URL abruft, sieht die Seite als anonyme Besucherin, also kommt ein persönliches Dashboard oder ein Artikel hinter einer Bezahlschranke als Anmeldebildschirm zurück. Aus dem eigenen Browser zu drucken, wo du angemeldet bist, umgeht das.

Alles Interaktive. Karten, Diagramme, die auf Hovern reagieren, Video, Formulare und alles, was von einem Skript gesteuert wird, wird zu einem stehenden Bild ihres aktuellen Zustands — oder ihres leeren Zustands, falls sie noch nicht fertig gezeichnet hatten.

Seiten, die automatisiertes Abrufen blockieren. Manche Websites verweigern Anfragen, die nicht von einem Browser kommen, und liefern statt ihres Inhalts eine Fehlerseite.

Und ein Punkt, den man deutlich sagen sollte: Eine Seite zu erfassen erzeugt eine Kopie fremder Arbeit. Einen Artikel zum Offline-Lesen zu speichern ist normalerweise unbedenklich; ihn weiterzuverbreiten ist eine andere Sache, und das ist eine Frage der Erlaubnis, nicht der Dateiformate.

Tools, um die es in diesem Artikel geht

Quellen

Primärdokumentation zu den Aussagen oben.

Zuletzt geprüft: 24. September 2026

Veröffentlicht von iBuildPDF.

Mehr aus der Wissensdatenbank

Wissensdatenbank durchsuchen