Datenschutz und Sicherheit

Welche persönlichen Daten in einem PDF verborgen sind

Welche persönlichen Daten stecken versteckt in einem PDF, und wie entferne ich sie?

Kurze Antwort

Ein PDF trägt eine Reihe versteckter Felder — am häufigsten einen Autorennamen aus deinem Betriebssystemkonto, Name und Version der Software, die die Datei erzeugt hat, sowie Zeitstempel für Erstellung und Änderung. Nichts davon hast du eingetippt, nichts davon steht auf der Seite. Lesen kann das jeder, der die Datei öffnet; entfernen lässt es sich mit einem Metadaten-Entferner wie /remove-pdf-metadata.

Die Kurzfassung

Öffne irgendein PDF, das du jemandem geschickt hast, und sieh dir seine Eigenschaften an. Meist steht im Feld „Autor“ ein Name. Den hast du nicht eingetippt. Er stammt vom Kontonamen des Rechners, der die Datei erzeugt hat — auf einem Firmenlaptop oft dein vollständiger bürgerlicher Name oder ein interner Benutzername, auf einem Privatrechner das, wie du dich beim Einrichten genannt hast.

Dieses Feld ist eines von mehreren. Ein PDF ist ein strukturiertes Dokumentformat, und die Spezifikation (ISO 32000-1, die standardisierte Fassung von Adobes PDF 1.7) sieht eigene Plätze für Informationen über das Dokument vor, die nicht Teil dessen sind, was auf der Seite gezeichnet wird. Textverarbeitungen, Scanner, Druckertreiber und Export-Dialoge füllen diese Plätze aus, in aller Regel ohne es dir zu sagen.

Nichts davon ist ein Exploit; das Format arbeitet, wie es entworfen wurde. Wichtig ist es, weil der Entwurf voraussetzt, dass du davon weißt — und die meisten Menschen, die einen Lebenslauf oder eine anonyme Beschwerde verschicken, wissen es nicht.

Was tatsächlich drinsteht

In einem modernen PDF gibt es zwei getrennte Metadaten-Systeme, und eine Datei kann beide mitführen — oft mit unterschiedlichen Werten.

123

Der Teil eines PDFs, den niemand liest

  1. Was auf der Seite steht. Das ist der Teil, den du vor dem Versenden geprüft hast.
  2. Der angehängte Datensatz: Autor, Software, Daten, manchmal ein Dateipfad oder ein Firmenname.
  3. Nichts davon erscheint beim Drucken oder Lesen — genau deshalb reist es unbemerkt mit.

Das Dokument-Informationswörterbuch

Das ist der ältere Mechanismus, definiert in ISO 32000-1. Es ist ein kleiner Satz benannter Felder, die am Dokument hängen:

FeldWas meist drinsteht
TitleOft der ursprüngliche Dateiname, inklusive Entwurfsbezeichnung oder internem Projektkürzel
AuthorFast immer der Betriebssystem-Kontoname dessen, der die Datei erstellt hat
SubjectMeist leer, manchmal eine Beschreibung, die vor Jahren in eine Vorlage getippt wurde
KeywordsMeist leer; wenn gefüllt, verrät es häufig interne Kategorisierungen
CreatorDie Anwendung, in der der Inhalt verfasst wurde — Word, InDesign, LaTeX, ein Scannertreiber
ProducerDie Bibliothek, die das PDF selbst geschrieben hat, normalerweise samt exakter Versionsnummer
CreationDateZeitstempel der Erstellung, inklusive Zeitzonen-Verschiebung
ModDateZeitstempel der letzten Änderung

Zwei verdienen besondere Aufmerksamkeit. Author ist das Feld, das eine Person identifiziert, und es wird automatisch gefüllt. Producer identifiziert Software bis auf die Version genau, verrät einem Leser also, was du einsetzt und damit indirekt, was deine Organisation ausrollt.

Auch die Zeitstempel sind aufschlussreich. Eine Zeitzonen-Verschiebung verortet dich geografisch, und ein ModDate nach dem Zeitpunkt, zu dem ein Dokument angeblich final war, ist genau die Art Detail, die in Streitfällen auffällt.

XMP-Metadaten

Der neuere Mechanismus ist XMP — die Extensible Metadata Platform, standardisiert als ISO 16684-1. Es ist ein XML-Block, der in die Datei eingebettet ist, und er enthält mehr als die acht Felder oben: Rechteangaben, Bearbeitungsverlauf, werkzeugspezifische Einträge und eine Dokumentkennung, die über Speichervorgänge hinweg bestehen bleibt und getrennte Dateien auf einen gemeinsamen Ursprung zurückführen kann.

Weil XMP vom Informationswörterbuch getrennt ist, können die beiden voneinander abweichen. Das eine zu bearbeiten, aktualisiert das andere nicht zwangsläufig — so kommt es, dass eine Datei im Eigenschaften-Dialog einen bereinigten Autor zeigt, während der ursprüngliche Name ein paar tausend Bytes weiter im XMP-Block steht.

Metadaten in eingebetteten Bildern

Ein PDF mit Fotos bettet diese Bilder als Objekte in der Datei ein. Trug ein Bild beim Einfügen EXIF-Daten — Kameramodell, Aufnahmezeitpunkt und bei Handyfotos sehr oft GPS-Koordinaten —, können diese Daten mit ins PDF wandern. Das ist eine dritte, unabhängige Schicht, die von allem unberührt bleibt, was die Metadaten des Dokuments selbst bearbeitet.

So siehst du, was deine Datei mitführt

Am schnellsten geht es mit dem PDF-Metadaten-Editor. Leg eine Datei hinein, er liest das Dokument aus und zeigt die Felder des Informationswörterbuchs mit ihren aktuellen Werten. Die Datei wird in deinem Browser gelesen und nicht hochgeladen, du kannst also ein vertrauliches Dokument prüfen, ohne es jemandem zu übergeben.

Prüfe die Datei, die du verschicken willst, nicht die, mit der du angefangen hast: Jeder Exportschritt schreibt Producer neu, und manche schreiben mehr neu.

Das Seitenzahl-Tool ist ein nützlicher Begleiter für einen schnellen strukturellen Blick — es öffnet das Dokument und nennt die Seitenzahl, was zugleich bestätigt, dass die Datei überhaupt sauber als PDF eingelesen werden kann. Eine Datei, die keine Seitenzahl meldet, ist beschädigt, und sie zu reparieren kommt zuerst.

Außerhalb des Browsers geben pdfinfo (Teil von Poppler) und exiftool beide die Metadaten aus, und exiftool meldet zusätzlich EXIF-Daten in eingebetteten Bildern. Ein PDF ist teilweise Klartext, ein PDF im Texteditor zu öffnen und nach /Producer oder <x:xmpmeta zu suchen, zeigt die Felder deshalb oft direkt.

Metadaten entfernen

Nimm PDF-Metadaten entfernen. Das Tool liest das Dokument mit pdf-lib ein, leert die Felder des Informationswörterbuchs — Title, Author, Subject, Keywords, Creator, Producer sowie Erstellungs- und Änderungsdatum — und schreibt ein neues PDF heraus. Der Seiteninhalt selbst wird nicht neu geschrieben, das Dokument, das du zurückbekommst, sieht also genau aus und liest sich genau wie das, das du hineingegeben hast.

Wenn du Werte lieber ersetzen als leeren willst, kannst du im Metadaten-Editor jedes Feld ausdrücklich setzen. Das hat einen echten Nutzen: Ein Organisationsname im Autorenfeld fällt weniger auf als ein leeres Feld, das in einem Stapel ansonsten normaler Dokumente selbst schon ein Signal ist.

Beide Tools laufen vollständig in deinem Browser. Es wird nichts hochgeladen, und das zählt hier mehr als sonst — der ganze Punkt ist ja, dass die Datei etwas enthält, das du nicht teilen willst; sie zum Entfernen an den Server eines Fremden zu schicken, wäre ein seltsamer Handel. Wie das technisch funktioniert, steht in wie PDF-Tools im Browser arbeiten.

Ein praktischer Hinweis: Mach das als letzten Schritt vor dem Versenden. Alles, was die Datei danach neu schreibt — erneuter Export, Drucken als PDF, Öffnen und Speichern in einer anderen Anwendung —, stempelt wieder einen frischen Producer und neue Zeitstempel hinein.

Was das Entfernen von Metadaten nicht leistet

Das ist der Teil, der Leute in Schwierigkeiten bringt, denn einen geleerten Eigenschaften-Dialog fühlt sich endgültig an — und ist es nicht.

  • Es rührt die sichtbare Seite nicht an. Ein Name im Briefkopf, eine Fußzeile mit Entwurf — J. Okonkwo, eine Kopfzeile mit dem Namen eines Kunden: Das ist Seiteninhalt, keine Metadaten. Es steht weiterhin da, und es ist das Erste, was ein Leser sieht.
  • Es entfernt keine EXIF-Daten in eingebetteten Bildern. Die Metadaten des Dokuments und die eines eingebetteten Fotos sind verschiedene Strukturen. Die ersten zu leeren, lässt die zweiten unangetastet, GPS-Koordinaten inklusive. Enthält ein PDF Handyfotos und spielt der Ort eine Rolle, entferne die EXIF-Daten aus den Bildern, bevor du das PDF baust.
  • Es entfernt keinen Text, der unter einer gezeichneten Form liegt. Ein schwarzes Rechteck über einem Absatz löscht den Absatz nicht — die Textobjekte stehen weiterhin im Inhaltsstrom und kommen per Kopieren und Einfügen direkt wieder heraus. Das ist ein eigenes und weit ernsteres Versagen, behandelt in wie man ein PDF dauerhaft schwärzt, und kein Metadaten-Tool löst es.
  • Es erreicht bereits verschickte Kopien nicht. Das Entfernen von Metadaten erzeugt eine saubere neue Datei. Jede zuvor verteilte Kopie trägt weiterhin alles mit sich, in jedem Postfach und jedem Backup, das sie erreicht hat. Bereinigt wird, bevor eine Datei das Haus verlässt, nicht danach.

Betrachte Metadaten als vier getrennte Schichten: das Informationswörterbuch, XMP, EXIF in eingebetteten Bildern und den sichtbaren Seiteninhalt. Jede braucht ihre eigene Prüfung. Eine zu leeren und anzunehmen, der Rest sei mitgegangen, ist der Fehler, den es zu vermeiden lohnt.

Tools, um die es in diesem Artikel geht

Quellen

Primärdokumentation zu den Aussagen oben.

Zuletzt geprüft: 16. September 2026

Veröffentlicht von iBuildPDF.

Mehr aus der Wissensdatenbank

Wissensdatenbank durchsuchen