Welche persönlichen Daten in einem PDF verborgen sind
Welche persönlichen Daten stecken versteckt in einem PDF, und wie entferne ich sie?
Speicher deine Lieblings-Tools
Leg ein kostenloses iBuildPDF-Konto an, um deine Lieblings-Tools zu behalten und jederzeit schnell wiederzufinden.
Kostenloses Konto. Die PDF-Tools selbst brauchen nie eins.
Kurze Antwort
Ein PDF trägt eine Reihe versteckter Felder — am häufigsten einen Autorennamen aus deinem Betriebssystemkonto, Name und Version der Software, die die Datei erzeugt hat, sowie Zeitstempel für Erstellung und Änderung. Nichts davon hast du eingetippt, nichts davon steht auf der Seite. Lesen kann das jeder, der die Datei öffnet; entfernen lässt es sich mit einem Metadaten-Entferner wie /remove-pdf-metadata.
Die Kurzfassung
Öffne irgendein PDF, das du jemandem geschickt hast, und sieh dir seine Eigenschaften an. Meist steht im Feld „Autor“ ein Name. Den hast du nicht eingetippt. Er stammt vom Kontonamen des Rechners, der die Datei erzeugt hat — auf einem Firmenlaptop oft dein vollständiger bürgerlicher Name oder ein interner Benutzername, auf einem Privatrechner das, wie du dich beim Einrichten genannt hast.
Dieses Feld ist eines von mehreren. Ein PDF ist ein strukturiertes Dokumentformat, und die Spezifikation (ISO 32000-1, die standardisierte Fassung von Adobes PDF 1.7) sieht eigene Plätze für Informationen über das Dokument vor, die nicht Teil dessen sind, was auf der Seite gezeichnet wird. Textverarbeitungen, Scanner, Druckertreiber und Export-Dialoge füllen diese Plätze aus, in aller Regel ohne es dir zu sagen.
Nichts davon ist ein Exploit; das Format arbeitet, wie es entworfen wurde. Wichtig ist es, weil der Entwurf voraussetzt, dass du davon weißt — und die meisten Menschen, die einen Lebenslauf oder eine anonyme Beschwerde verschicken, wissen es nicht.
Was tatsächlich drinsteht
In einem modernen PDF gibt es zwei getrennte Metadaten-Systeme, und eine Datei kann beide mitführen — oft mit unterschiedlichen Werten.
Der Teil eines PDFs, den niemand liest
- Was auf der Seite steht. Das ist der Teil, den du vor dem Versenden geprüft hast.
- Der angehängte Datensatz: Autor, Software, Daten, manchmal ein Dateipfad oder ein Firmenname.
- Nichts davon erscheint beim Drucken oder Lesen — genau deshalb reist es unbemerkt mit.
Das Dokument-Informationswörterbuch
Das ist der ältere Mechanismus, definiert in ISO 32000-1. Es ist ein kleiner Satz benannter Felder, die am Dokument hängen:
| Feld | Was meist drinsteht |
|---|---|
Title | Oft der ursprüngliche Dateiname, inklusive Entwurfsbezeichnung oder internem Projektkürzel |
Author | Fast immer der Betriebssystem-Kontoname dessen, der die Datei erstellt hat |
Subject | Meist leer, manchmal eine Beschreibung, die vor Jahren in eine Vorlage getippt wurde |
Keywords | Meist leer; wenn gefüllt, verrät es häufig interne Kategorisierungen |
Creator | Die Anwendung, in der der Inhalt verfasst wurde — Word, InDesign, LaTeX, ein Scannertreiber |
Producer | Die Bibliothek, die das PDF selbst geschrieben hat, normalerweise samt exakter Versionsnummer |
CreationDate | Zeitstempel der Erstellung, inklusive Zeitzonen-Verschiebung |
ModDate | Zeitstempel der letzten Änderung |
Zwei verdienen besondere Aufmerksamkeit. Author ist das Feld, das eine Person identifiziert, und es wird automatisch gefüllt. Producer identifiziert Software bis auf die Version genau, verrät einem Leser also, was du einsetzt und damit indirekt, was deine Organisation ausrollt.
Auch die Zeitstempel sind aufschlussreich. Eine Zeitzonen-Verschiebung verortet dich geografisch, und ein ModDate nach dem Zeitpunkt, zu dem ein Dokument angeblich final war, ist genau die Art Detail, die in Streitfällen auffällt.
XMP-Metadaten
Der neuere Mechanismus ist XMP — die Extensible Metadata Platform, standardisiert als ISO 16684-1. Es ist ein XML-Block, der in die Datei eingebettet ist, und er enthält mehr als die acht Felder oben: Rechteangaben, Bearbeitungsverlauf, werkzeugspezifische Einträge und eine Dokumentkennung, die über Speichervorgänge hinweg bestehen bleibt und getrennte Dateien auf einen gemeinsamen Ursprung zurückführen kann.
Weil XMP vom Informationswörterbuch getrennt ist, können die beiden voneinander abweichen. Das eine zu bearbeiten, aktualisiert das andere nicht zwangsläufig — so kommt es, dass eine Datei im Eigenschaften-Dialog einen bereinigten Autor zeigt, während der ursprüngliche Name ein paar tausend Bytes weiter im XMP-Block steht.
Metadaten in eingebetteten Bildern
Ein PDF mit Fotos bettet diese Bilder als Objekte in der Datei ein. Trug ein Bild beim Einfügen EXIF-Daten — Kameramodell, Aufnahmezeitpunkt und bei Handyfotos sehr oft GPS-Koordinaten —, können diese Daten mit ins PDF wandern. Das ist eine dritte, unabhängige Schicht, die von allem unberührt bleibt, was die Metadaten des Dokuments selbst bearbeitet.
So siehst du, was deine Datei mitführt
Am schnellsten geht es mit dem PDF-Metadaten-Editor. Leg eine Datei hinein, er liest das Dokument aus und zeigt die Felder des Informationswörterbuchs mit ihren aktuellen Werten. Die Datei wird in deinem Browser gelesen und nicht hochgeladen, du kannst also ein vertrauliches Dokument prüfen, ohne es jemandem zu übergeben.
Prüfe die Datei, die du verschicken willst, nicht die, mit der du angefangen hast: Jeder Exportschritt schreibt Producer neu, und manche schreiben mehr neu.
Das Seitenzahl-Tool ist ein nützlicher Begleiter für einen schnellen strukturellen Blick — es öffnet das Dokument und nennt die Seitenzahl, was zugleich bestätigt, dass die Datei überhaupt sauber als PDF eingelesen werden kann. Eine Datei, die keine Seitenzahl meldet, ist beschädigt, und sie zu reparieren kommt zuerst.
Außerhalb des Browsers geben pdfinfo (Teil von Poppler) und exiftool beide die Metadaten aus, und exiftool meldet zusätzlich EXIF-Daten in eingebetteten Bildern. Ein PDF ist teilweise Klartext, ein PDF im Texteditor zu öffnen und nach /Producer oder <x:xmpmeta zu suchen, zeigt die Felder deshalb oft direkt.
Metadaten entfernen
Nimm PDF-Metadaten entfernen. Das Tool liest das Dokument mit pdf-lib ein, leert die Felder des Informationswörterbuchs — Title, Author, Subject, Keywords, Creator, Producer sowie Erstellungs- und Änderungsdatum — und schreibt ein neues PDF heraus. Der Seiteninhalt selbst wird nicht neu geschrieben, das Dokument, das du zurückbekommst, sieht also genau aus und liest sich genau wie das, das du hineingegeben hast.
Wenn du Werte lieber ersetzen als leeren willst, kannst du im Metadaten-Editor jedes Feld ausdrücklich setzen. Das hat einen echten Nutzen: Ein Organisationsname im Autorenfeld fällt weniger auf als ein leeres Feld, das in einem Stapel ansonsten normaler Dokumente selbst schon ein Signal ist.
Beide Tools laufen vollständig in deinem Browser. Es wird nichts hochgeladen, und das zählt hier mehr als sonst — der ganze Punkt ist ja, dass die Datei etwas enthält, das du nicht teilen willst; sie zum Entfernen an den Server eines Fremden zu schicken, wäre ein seltsamer Handel. Wie das technisch funktioniert, steht in wie PDF-Tools im Browser arbeiten.
Ein praktischer Hinweis: Mach das als letzten Schritt vor dem Versenden. Alles, was die Datei danach neu schreibt — erneuter Export, Drucken als PDF, Öffnen und Speichern in einer anderen Anwendung —, stempelt wieder einen frischen Producer und neue Zeitstempel hinein.
Was das Entfernen von Metadaten nicht leistet
Das ist der Teil, der Leute in Schwierigkeiten bringt, denn einen geleerten Eigenschaften-Dialog fühlt sich endgültig an — und ist es nicht.
- Es rührt die sichtbare Seite nicht an. Ein Name im Briefkopf, eine Fußzeile mit Entwurf — J. Okonkwo, eine Kopfzeile mit dem Namen eines Kunden: Das ist Seiteninhalt, keine Metadaten. Es steht weiterhin da, und es ist das Erste, was ein Leser sieht.
- Es entfernt keine EXIF-Daten in eingebetteten Bildern. Die Metadaten des Dokuments und die eines eingebetteten Fotos sind verschiedene Strukturen. Die ersten zu leeren, lässt die zweiten unangetastet, GPS-Koordinaten inklusive. Enthält ein PDF Handyfotos und spielt der Ort eine Rolle, entferne die EXIF-Daten aus den Bildern, bevor du das PDF baust.
- Es entfernt keinen Text, der unter einer gezeichneten Form liegt. Ein schwarzes Rechteck über einem Absatz löscht den Absatz nicht — die Textobjekte stehen weiterhin im Inhaltsstrom und kommen per Kopieren und Einfügen direkt wieder heraus. Das ist ein eigenes und weit ernsteres Versagen, behandelt in wie man ein PDF dauerhaft schwärzt, und kein Metadaten-Tool löst es.
- Es erreicht bereits verschickte Kopien nicht. Das Entfernen von Metadaten erzeugt eine saubere neue Datei. Jede zuvor verteilte Kopie trägt weiterhin alles mit sich, in jedem Postfach und jedem Backup, das sie erreicht hat. Bereinigt wird, bevor eine Datei das Haus verlässt, nicht danach.
Betrachte Metadaten als vier getrennte Schichten: das Informationswörterbuch, XMP, EXIF in eingebetteten Bildern und den sichtbaren Seiteninhalt. Jede braucht ihre eigene Prüfung. Eine zu leeren und anzunehmen, der Rest sei mitgegangen, ist der Fehler, den es zu vermeiden lohnt.
Tools, um die es in diesem Artikel geht
Quellen
Primärdokumentation zu den Aussagen oben.