Datenschutz und Sicherheit

Ein PDF unwiederbringlich schwärzen

Wie schwärze ich Text in einem PDF so, dass er wirklich nicht wiederherstellbar ist?

Kurze Antwort

Ein schwarzes Rechteck über Text zu zeichnen, entfernt den Text nicht — die Wörter stehen weiterhin darunter in der Datei und kommen per Kopieren und Einfügen direkt wieder heraus. Echtes Schwärzen heißt, den zugrunde liegenden Inhalt zu zerstören; genau das macht /redact-pdf, indem es die markierten Seiten als Bilder neu aufbaut. Und du solltest das Ergebnis immer prüfen, indem du erneut versuchst, den Text zu extrahieren.

Die Kurzfassung

Ein PDF ist eine Liste von Zeichenanweisungen. Ein schwarzes Rechteck über einen Namen zu legen, hängt eine weitere Anweisung an: zeichne ein gefülltes schwarzes Rechteck an diesen Koordinaten. Die Anweisung, die den Namen zeichnet, steht weiterhin in der Datei, weiter oben in derselben Liste. Das Rechteck liegt optisch darüber und tut ihm strukturell nichts.

Markiere den Bereich in einem PDF-Betrachter und drücke Kopieren. Der Name liegt in deiner Zwischenablage; nichts wurde geknackt, der Text wurde einfach aus der Datei gelesen, so wie jeder Betrachter jeden Text liest.

Schwärzen, das standhält, heißt Inhalt entfernen, nicht verbergen. Alles Weitere hier folgt aus dieser Unterscheidung.

Warum schwarze Kästen scheitern

Nach ISO 32000-1, dem Standard, der PDF definiert, stammen die Zeichen auf einer Seite aus einem Inhaltsstrom: einer Folge von Operatoren, die eine Schrift positionieren, eine Farbe setzen und eine Zeichenkette ausgeben. Text wird als Text gespeichert. Genau das macht ein PDF durchsuchbar — und genau deshalb kann ein Betrachter dir die Wörter geben, wenn du sie markierst.

1S E C R E T234

Abdecken ist kein Entfernen

  1. Ein schwarzes Rechteck über dem Text. Sieht fertig aus.
  2. Der Text steht darunter noch in der Datei. Markieren, kopieren oder in irgendeinem Editor öffnen — da ist er.
  3. Richtiges Schwärzen baut die Seite ohne diese Zeichen neu auf.
  4. Jetzt steht nichts mehr unter der Markierung, weil es nichts mehr zu finden gibt.

Eine danach gezeichnete Form ist nur ein weiterer Operator im selben Strom. Die Zeichenreihenfolge entscheidet, was du siehst; sie entscheidet nicht, was existiert. Die Wörter überleben also jeden Weg in die Datei hinein, der nicht darin besteht, sie anzuschauen:

  • Markieren und Kopieren in jedem beliebigen PDF-Betrachter.
  • pdftotext oder jedes andere Extraktionswerkzeug, das Grafik komplett ignoriert und die Textebene zurückgibt.
  • Suche — das Dokument ist über die verborgenen Wörter weiterhin indexierbar, bei Veröffentlichung auch durch Suchmaschinen.
  • Die Datei in einem Editor öffnen und das Rechteck löschen, was das ursprüngliche Erscheinungsbild exakt wiederherstellt.

Dieses Versagensmuster hat zu echten Datenpannen geführt. Es wiederholt sich in Gerichtsakten und Behördenveröffentlichungen: Ein Dokument wird publiziert, Namen oder Zahlen sind von schwarzen Rechtecken verdeckt, und binnen Stunden hat jemand den Text direkt herauskopiert. Die US-amerikanische National Security Agency veröffentlicht genau deshalb eine Anleitung zum Bereinigen von PDF-Dateien, und ihre zentrale Anweisung ist die obige — Inhalt zu verdecken heißt nicht, ihn zu entfernen.

Dasselbe gilt für jede Variante. Gelbe Markerfarbe über schwarzem Text, weißer Text auf weißem Grund, ein farbiger Kasten oder eine Form in einer Anmerkungsebene sind allesamt kosmetische Änderungen an dem, was gezeichnet wird; die Zeichen bleiben im Inhaltsstrom, und ein Textextraktor gibt sie zurück. Weiß auf Weiß ist die schlechteste Variante, weil sie nicht einmal geschwärzt aussieht.

Was tatsächlich funktioniert

Richtiges Schwärzen hat eine Anforderung: Der Inhalt, der die sensiblen Informationen trug, darf nicht mehr in der Datei sein. Dahin führen zwei Wege.

Der erste ist chirurgisch — den Inhaltsstrom einlesen, die Textausgabe-Operatoren im geschwärzten Bereich entfernen und den Strom neu schreiben. Präzise, aber anfällig: Text wird in Fragmenten positioniert, die sich selten mit Wörtern decken. Unsauber ausgeführt, bleiben Teilzeichenketten übrig, und das ist das schlechtestmögliche Ergebnis, weil die Datei dann geschwärzt aussieht und es nicht ist.

Der zweite Weg ist, die Seite so neu aufzubauen, dass die ursprünglichen Textobjekte überhaupt nicht mehr existieren. Genau das macht das Schwärzungs-Tool von iBuildPDF. Du markierst die zu entfernenden Bereiche; für jede markierte Seite rendert das Tool diese Seite mit PDF.js, zeichnet deine Schwärzungsbereiche als volle Füllung in die gerenderten Pixel und schreibt mit pdf-lib eine neue Seite, die aus diesem Bild besteht. Die neu aufgebaute Seite enthält ein Bild und keine Text-Operatoren. Unter den schwarzen Flächen liegt nichts, weil unter überhaupt nichts mehr etwas liegt — die Seite ist jetzt Pixel.

Der Kompromiss ist real, und du solltest ihn einplanen. Auf jeder Seite, die du schwärzt, lässt sich kein Text mehr markieren, nicht nur der geschwärzte Teil. Diese Seiten sind nicht mehr durchsuchbar, nicht kopierbar und für einen Screenreader nicht lesbar, und die Dateigröße steigt meist, weil ein Bild einer Textseite größer ist als der Text es war.

Seiten, die du nicht markierst, bleiben exakt wie sie waren — ein 200-seitiger Bericht mit zwei geschwärzten Seiten behält 198 durchsuchbare. Wo dieser Kompromiss nicht tragbar ist — eine Barrierefreiheitsanforderung oder ein Dokument, das durchgängig durchsuchbar bleiben muss —, schwärze stattdessen an der Quelle: Entferne den Text im Original und exportiere ein frisches PDF. So oder so: Schwärze zuletzt. Ein erneuter Export aus dem Original setzt danach stillschweigend alles wieder ein, was du entfernt hast.

Prüfen, ob es funktioniert hat

Gib nie ein geschwärztes Dokument heraus, das du nicht getestet hast. Der Test dauert zwei Minuten.

  1. Kopieren und Einfügen. Öffne die heruntergeladene Datei, markiere über den geschwärzten Bereich und einen großzügigen Rand darum herum, kopiere und füge das in einen einfachen Texteditor ein. Bei einer korrekt neu aufgebauten Seite bekommst du nichts, weil es keinen Text zum Markieren gibt.
  2. Das ganze Dokument extrahieren. Schick das Ergebnis durch PDF in Text und durchsuche die Ausgabe nach der geschwärzten Zeichenkette. Das ist die wichtigste Prüfung, weil sie die gesamte Datei abdeckt und nicht nur den Bereich, den du zufällig markiert hast — einschließlich einer Seite, auf der derselbe Name auftaucht und die du zu markieren vergessen hast. Suche auch nach Fragmenten: nur dem Nachnamen, den letzten sechs Ziffern einer Kontonummer.
  3. Die Metadaten prüfen. Öffne die Datei im Metadaten-Editor. Sensible Begriffe überleben regelmäßig in den Feldern Title oder Keywords, und der Titel ist sehr oft der ursprüngliche Dateiname — Schmidt-Vergleich-vertraulich.pdf hebelt die Schwärzung auf Seite vier aus, ohne dass irgendjemand die Seite liest.

Alle drei Tools laufen in deinem Browser, eine vertrauliche Datei zu überprüfen heißt also nicht, sie hochzuladen. Wenn eine Suche doch etwas findet, behandle die Datei als ungeschwärzt, statt sie mit einem weiteren Rechteck zu flicken.

Was Schwärzen nicht leisten kann

Vier Grenzen, klar benannt.

  • Es betrifft nur die Kopie, die du herunterlädst. Schwärzen erzeugt eine neue Datei. Das Original auf deiner Festplatte bleibt unverändert, und jede bereits verschickte, abgelegte oder gesicherte Kopie enthält weiterhin alles. Wenn die ungeschwärzte Fassung deinen Einflussbereich verlassen hat, ändert es daran nichts, sie jetzt zu schwärzen.
  • Beim Rastern kommt es auf die Reihenfolge an. Eine Seite als Bild neu aufzubauen, ist nur deshalb sicher, weil der geschwärzte Bereich gefüllt wird, bevor das Bild geschrieben wird — die schwarzen Pixel ersetzen die Pixel, die den Text zeigten. Ein Verfahren, das die Seite zuerst rastert und dann ein schwarzes Rechteck auf das entstandene Bild legt, hat das ursprüngliche Problem in neuer Form nachgebaut: Die Wörter sind als Pixel weiterhin unter dem Kasten und für jeden wiederherstellbar, der ihn entfernt. Bestätige das mit dem Extraktionstest oben, statt anzunehmen, ein Tool habe die Reihenfolge richtig gewählt.
  • Ein Seitenbild kann eine Maschine trotzdem lesen. Rastern verhindert Kopieren und Textextraktion; es macht den übrigen sichtbaren Text nicht unlesbar für optische Zeichenerkennung, eine alltägliche Fähigkeit weit verbreiteter Software. Schwärzen schützt den verdeckten Inhalt, nicht den Rest der Seite. iBuildPDF bietet kein OCR an — ein solches Tool gibt es auf der Website nicht —, hier geht es also darum, was jemand anders mit deiner Ausgabe anstellen kann.
  • Metadaten sind ein eigenes System. Die Felder des Informationswörterbuchs und der XMP-Block liegen außerhalb des Seiteninhalts und bleiben von allem unberührt, was mit den Seiten geschieht. Leere sie mit PDF-Metadaten entfernen, und sieh dir was PDF-Metadaten enthalten an, um zu erfahren, was in diesen Feldern steckt.

Die Gewohnheit, die die meisten Schwärzungsfehler verhindert, ist simpel: Geh davon aus, dass die Datei das, was du entfernt hast, noch enthält, und lass sie das Gegenteil beweisen, indem du den Text extrahierst und darin suchst.

Tools, um die es in diesem Artikel geht

Quellen

Primärdokumentation zu den Aussagen oben.

Zuletzt geprüft: 16. September 2026

Veröffentlicht von iBuildPDF.

Mehr aus der Wissensdatenbank

Wissensdatenbank durchsuchen