Was PDF/A ist und warum ein Archiv normale PDFs ablehnt
Was ist PDF/A, und warum wurde mein PDF abgelehnt?
Speicher deine Lieblings-Tools
Leg ein kostenloses iBuildPDF-Konto an, um deine Lieblings-Tools zu behalten und jederzeit schnell wiederzufinden.
Kostenloses Konto. Die PDF-Tools selbst brauchen nie eins.
Kurze Antwort
PDF/A ist gewöhnliches PDF, dem Möglichkeiten weggenommen wurden. Alles, dessen Bedeutung mit der Zeit driften könnte — eine Schrift, die die Datei nur benennt, eine Farbe, die von dem Bildschirm abhängt, den du zufällig benutzt hast, Verschlüsselung, Skripte, ein Verweis auf eine anderswo gespeicherte Datei —, ist verboten, damit das Dokument sich selbst genügt. Ein Archiv lehnt ein normales PDF nicht ab, weil heute etwas daran falsch wäre, sondern weil es nicht versprechen kann, dass die Datei in dreißig Jahren noch genauso dargestellt wird.
Ein PDF, das von nichts abhängen darf
PDF/A ist in ISO 19005 definiert, einem eigenen Standard neben dem, der PDF selbst definiert. Es fügt keine Funktionen hinzu. Es nimmt Möglichkeiten weg.
PDF/A: eine Datei, die von nichts abhängen darf
- Die Datei. Sie ist ein gewöhnliches PDF — jeder Betrachter öffnet sie, nichts hier ist ein neues Format.
- Alles Nötige steckt darin: die Schriftumrisse, ein Profil, das sagt, was die Farben bedeuten, und Metadaten, die das Dokument beschreiben.
- Nichts darf von außen abhängen. Das ist die ganze Regel; der Rest des Standards ist diese Regel, angewandt auf jeden Teil der Datei.
- Verboten sind deshalb: Verschlüsselung, Skripte, Verweise auf anderswo gespeicherte Inhalte — alles, dessen Bedeutung sich nach dem Schreiben der Datei ändern könnte.
Das Problem, für das es da ist: Ein gewöhnliches PDF ist eine Datei plus ein Satz Annahmen über den Rechner, der sie öffnet — dass die benannte Schrift installiert ist, dass dieser Rotton etwas Messbares bedeutet, dass das verlinkte Bild noch auf dem Server liegt, dass der Betrachter das Skript ausführen kann. Jede Annahme hält, bis sie es nicht mehr tut, und die Datei warnt nicht, wenn eine davon aufhört zu stimmen — sie wird einfach anders dargestellt, und meist merkt niemand, an welchem Tag das anfing.
PDF/A ist dasselbe Format, in dem diese Annahmen verboten sind. Alles, was das Dokument braucht, um sich selbst zu zeichnen, muss in der Datei liegen.
Zwei Folgen, die man klar aussprechen sollte. Erstens: Eine PDF/A-Datei ist ein PDF. Es gibt keinen PDF/A-Betrachter und keine PDF/A-Endung; jedes gewöhnliche Tool öffnet sie, und meistens sieht man es ihr nicht an. Zweitens: Eine Datei wird nicht dadurch zu PDF/A, dass man sie umbenennt oder dass sie es in ihren Metadaten behauptet. Sie erfüllt die Regeln oder sie erfüllt sie nicht, und das Archiv, das deine abgelehnt hat, hat ein Programm, das das prüft.
Was es tatsächlich verbietet
Die Regeln sind lang, aber fast alle sind dieselbe Regel, angewandt auf verschiedene Teile der Datei.
- Jede Schrift muss eingebettet sein — auch die vierzehn, die Betrachter einmal garantiert hatten. Eine Datei, die eine Schrift nur benennt, wettet auf einen Rechner, den sie nie zu sehen bekommt. Das ist der mit Abstand häufigste Grund, warum ein Dokument die Validierung nicht besteht, und warum PDFs auf anderen Computern anders aussehen behandelt, was schiefgeht, wenn es unterbleibt.
- Farbe muss geräteunabhängig sein. Die Datei muss eine Ausgabebedingung (Output Intent) mitführen oder Farbräume verwenden, die definiert und nicht bloß angenommen sind, damit eine Farbe eine messbare Farbe bedeutet und nicht „was dieser Monitor eben daraus macht“.
- Keinerlei Verschlüsselung. Ein Archiv kann keine Datei bewahren, die es nicht öffnen kann, und ein Passwort ist genau die Art Sache, die über Jahrzehnte abhandenkommt. Siehe Was ein PDF-Passwort tatsächlich schützt.
- Keine Skripte, keine Startaktionen, keine eingebetteten Programme. Verhalten, das vom Ausführen von Code abhängt, ist Verhalten, das später niemand garantieren kann.
- Keine externen Verweise. Alles, was auf der Seite gezeichnet wird, muss in der Datei stehen. Eine Seite, die ein Bild oder eine Schrift von einer URL holt, ist eine Seite, die irgendwann leer sein wird.
- XMP-Metadaten sind Pflicht, und sie müssen mit den Dokumentinformationen übereinstimmen statt ihnen zu widersprechen. Was PDF-Metadaten enthalten erklärt die beiden Einträge und warum sie so oft auseinandergehen.
Ein paar Regeln hängen davon ab, welchem Teil des Standards du entsprechen willst. Transparenz und JPEG-2000-Bilder sind in PDF/A-1 verboten und ab PDF/A-2 erlaubt; eingebettete Anhänge sind in PDF/A-1 verboten, in PDF/A-2 auf andere PDF/A-Dateien beschränkt und in PDF/A-3 unbeschränkt — was PDF/A-3 zum üblichen Träger für eine Rechnung mit einer maschinenlesbaren XML-Kopie darin macht.
Eine ehrliche Lücke. Ein Hyperlink auf eine Website ist erlaubt — er ist eine Anmerkung und kein Inhalt, von dem die Seite abhängt — und er verrottet genauso schnell wie jeder andere Link. PDF/A bewahrt die Darstellung des Dokuments. Es bewahrt nicht das Web.
Die Teile und der Buchstabe dahinter
Eine Konformitätsangabe hat zwei Hälften: welcher Teil des Standards und welche Stufe darin. PDF/A-2b heißt Teil 2, Stufe b.
Die Teile folgen dem zugrunde liegenden Format. PDF/A-1 baut auf PDF 1.4 auf und ist am strengsten. PDF/A-2 baut auf ISO 32000-1 auf und lockert die Beschränkungen für Transparenz und JPEG 2000. PDF/A-3 ist PDF/A-2 plus der Möglichkeit, beliebige Dateien einzubetten. PDF/A-4 baut auf PDF 2.0 auf und ordnet das Schema neu — es lässt die Buchstaben a/u/b fallen und ergänzt eine Konformitätsstufe für interaktive technische 3D-Modelle, PDF/A-4e.
Innerhalb der Teile 1 bis 3 sagt die Stufe, wie viel von der Bedeutung des Dokuments erhalten bleibt, und die Stufen bauen aufeinander auf.
Die Konformitätsstufen bauen aufeinander auf
- Stufe b — basic. Die Datei wird künftig so aussehen wie heute. Mehr verspricht sie nicht.
- Stufe u — b, plus jedes Zeichen auf einen Unicode-Wert abgebildet, der Text bleibt also such- und kopierbar.
- Stufe a — u, plus Strukturbaum: Überschriften, Listen, Lesereihenfolge. Die einzige Stufe, die keine Exporteinstellung allein erreicht.
| Stufe | Was sie garantiert | Was sie in der Herstellung kostet |
|---|---|---|
| b — basic | Die Datei wird künftig so aussehen wie heute. | Eine Exporteinstellung. Für fast jedes Dokument erreichbar. |
| u — Unicode | Stufe b, plus: Jedes Zeichen auf der Seite bildet auf einen Unicode-Wert ab, der Text bleibt also durchsuchbar und kopierbar. | Meist ebenfalls eine Exporteinstellung, sofern die erzeugende Anwendung ordentliche Zeichentabellen schreibt. |
| a — accessible | Stufe u, plus einen Strukturbaum: Überschriften, Listen, Tabellen, Lesereihenfolge, Sprache. | Redaktionelle Arbeit. Das ist kein Häkchen. |
PDF/A-1 hat nur die Stufen a und b; die Stufe u kam mit Teil 2 dazu.
Die meisten Einrichtungen, die PDF/A verlangen, wollen PDF/A-1b oder PDF/A-2b, und wenn dir niemand gesagt hat, welches, lohnt genau diese Nachfrage. Stufe a ist eine andere Größenordnung von Arbeit: Ein echter Strukturbaum muss aus einem Dokument kommen, das mit Überschriften und Listen geschrieben wurde statt mit Fettdruck und Tabulatoren, und kein Konverter erfindet ihn verlässlich. Was ein PDF barrierefrei macht geht auf das Warum ein.
Woher eine PDF/A-Datei kommen muss
Von der Quelle. Textverarbeitungen, Layoutprogramme, Druckvorstufen und die meisten Berichtsgeneratoren können PDF/A direkt exportieren, und das ist der einzige Weg, der verlässlich funktioniert, weil die Anwendung die Schriften, die Farbinformationen und die Struktur noch vor sich hat.
Ein bestehendes PDF nach PDF/A zu konvertieren ist eine Reparatur, und es lohnt sich zu wissen, was diese Reparatur umfasst, bevor du dem Ergebnis traust. Ein Konverter muss Ersatz für Schriften finden, die nie eingebettet wurden — also etwas substituieren und hinnehmen, dass der Text sich verschieben kann —, ein Farbprofil zuweisen, das nie gewählt wurde, Verschlüsselung entfernen, die er womöglich nicht entfernen kann, und Interaktivität herausnehmen. Häufig gelingt das. Manchmal verändert es das Dokument, und zwar auf die Art, die niemand nachprüft.
iBuildPDF erzeugt kein PDF/A. Es gibt hier kein Tool, das eine Datei dorthin konvertiert, und ein Browser-Tool, das das behauptete, ohne eine fehlende Schrift auftreiben zu können, würde etwas behaupten, was es nicht kann. Was diese Seite kann: dir sagen, was du in der Hand hältst, bevor du dir etwas suchst, das es kann:
- Seitenzahl und Dateiinfo — die strukturellen Fakten, darunter, ob überhaupt eine Textebene da ist.
- Der Metadaten-Editor — was die erzeugende Anwendung über sich selbst eingetragen hat, meist der schnellste Hinweis darauf, wie die Datei entstanden ist und woran sie deshalb wahrscheinlich scheitern wird.
- PDF in Text — ein grober Test auf die Stufe u. Kommt der extrahierte Text als korrekte, lesbare Zeichen zurück, sind die Zeichentabellen da; kommt Unsinn zurück, fehlen sie, und die Datei kann in ihrem jetzigen Zustand die Stufe u nicht erreichen. Warum kopierter Text unleserlich ankommt erklärt dieses Versagen.
- PDF abflachen — löst Formularfelder und Anmerkungen in die Seite auf, was eine Konvertierung ohnehin tun müsste.
Alle vier laufen in deinem Browser. Keines davon macht eine Datei konform.
Wie du erkennst, ob eine Datei wirklich eine ist
Eine PDF/A-Datei erklärt sich in ihren XMP-Metadaten selbst dazu und hält dort den Teil und die Konformitätsstufe fest. Betrachter zeigen dafür oft eine Leiste am oberen Fensterrand.
Die Erklärung ist eine Behauptung, kein Beweis. Jede Datei kann sie tragen. Eine Datei kann außerdem nach ihrer Erstellung bearbeitet worden sein, ein Dokument, das am Dienstag wirklich konform war, ist es am Freitag vielleicht nicht mehr und verkündet trotzdem weiter, dass es das sei. Wissen kann man es nur, indem man einen Validator laufen lässt, und das Archiv, das deine Datei abgelehnt hat, hat genau das getan.
veraPDF ist der quelloffene Validator, entwickelt mit der PDF Association, und er ist das, was etliche Einrichtungen selbst einsetzen. Wurde deine Datei zurückgewiesen, ist nicht ein weiterer Versuch das Nützliche, sondern der Validierungsbericht, der die verletzte Regel benennt. In der Praxis sind die meisten Ablehnungen eines von drei Dingen:
- Eine Schrift ist nicht eingebettet — oft eine einzige, oft in einer Kopfzeile oder einer Seitenzahl, die sich niemand angesehen hat.
- Es gibt keine Ausgabebedingung, die Farbe ist also undefiniert.
- Die Datei ist verschlüsselt, manchmal mit einem Berechtigungspasswort, von dem der Absender nichts wusste.
Zuletzt die Grenze, die am meisten zählt und am wenigsten gesagt wird: Eine Datei kann die Validierung bestehen und trotzdem ein schlechtes Archivdokument sein. Ein Scan ohne Textebene ist völlig gültiges PDF/A-1b und wird für immer undurchsuchbar bleiben. Die Validierung prüft den Behälter. Ob das, was darin liegt, aufbewahrenswert ist und ob es in zwanzig Jahren jemand wiederfindet, ist eine eigene Frage, die kein Standard für dich beantwortet.
Tools, um die es in diesem Artikel geht
Quellen
Primärdokumentation zu den Aussagen oben.