Les bases du PDF

Le PDF/A, et pourquoi une archive refuse un PDF ordinaire

Qu’est-ce que le PDF/A, et pourquoi mon PDF a-t-il été refusé ?

Réponse courte

Le PDF/A est du PDF ordinaire dont on a retiré des options. Tout ce dont le sens pourrait dériver avec le temps — une police que le fichier se contente de nommer, une couleur définie par l’écran dont vous vous serviez, le chiffrement, les scripts, un lien vers un fichier stocké ailleurs — est interdit, si bien que le document doit se suffire à lui-même. Une archive refuse un PDF normal non pas parce qu’il aurait quelque chose de fautif aujourd’hui, mais parce qu’elle ne peut pas promettre que le fichier s’affichera encore de la même façon dans trente ans.

Un PDF qui n’a le droit de dépendre de rien

Le PDF/A est défini par la norme ISO 19005, distincte de celle qui définit le PDF lui-même. Elle n’ajoute aucune fonctionnalité. Elle retire des options.

1A a B b234

PDF/A : un fichier qui n’a pas le droit de dépendre de quoi que ce soit

  1. Le fichier. C’est un PDF ordinaire — n’importe quel lecteur l’ouvre, et rien ici n’est un nouveau format.
  2. Tout ce dont il a besoin est à l’intérieur : les contours des polices, un profil disant ce que signifient les couleurs, et des métadonnées décrivant le document.
  3. Rien ne peut être attendu de l’extérieur. C’est toute la règle ; le reste de la norme, c’est cette règle appliquée à chaque partie du fichier.
  4. Sont donc interdits : le chiffrement, les scripts, les références à du contenu stocké ailleurs — tout ce dont le sens pourrait changer après l’écriture du fichier.

Le problème qu’elle existe pour résoudre, c’est qu’un PDF ordinaire est un fichier plus un ensemble d’hypothèses sur la machine qui l’ouvre : que la police nommée est installée, que cette nuance de rouge signifie quelque chose de mesurable, que l’image liée est toujours sur le serveur, que le lecteur peut exécuter le script. Chaque hypothèse tient jusqu’à ce qu’elle ne tienne plus, et le fichier n’avertit pas quand l’une d’elles cesse d’être vraie — il s’affiche simplement autrement, et en général personne ne remarque quel jour cela a commencé.

Le PDF/A est le même format avec ces hypothèses proscrites. Tout ce dont le document a besoin pour se dessiner doit se trouver à l’intérieur du fichier.

Deux conséquences méritent d’être dites clairement. D’abord, un fichier PDF/A est un PDF. Il n’existe pas de lecteur PDF/A ni d’extension PDF/A ; tous les outils ordinaires en ouvrent un, et la plupart du temps on ne peut pas le voir à l’œil. Ensuite, un fichier ne devient pas du PDF/A parce qu’on le renomme, ni parce qu’il prétend en être un dans ses métadonnées. Soit il satisfait aux règles, soit il n’y satisfait pas, et l’archive qui a refusé le vôtre dispose d’un programme qui vérifie.

Ce qu’il interdit réellement

Les règles sont longues, mais presque toutes sont la même règle appliquée à différentes parties du fichier.

  • Chaque police doit être intégrée — y compris les quatorze que les lecteurs étaient autrefois garantis de posséder. Un fichier qui se contente de nommer une police parie sur une machine qu’il ne rencontrera jamais. C’est de loin la raison la plus courante d’un échec de validation, et pourquoi un PDF s’affiche différemment sur un autre ordinateur explique ce qui se passe quand ce n’est pas fait.
  • La couleur doit être indépendante du périphérique. Le fichier doit porter une intention de sortie, ou utiliser des espaces colorimétriques définis plutôt que supposés, pour qu’une couleur signifie une couleur mesurable et non « ce que fait cet écran-ci ».
  • Aucun chiffrement, d’aucune sorte. Une archive ne peut pas conserver un fichier qu’elle ne peut pas ouvrir, et un mot de passe est exactement le genre de chose qui se perd au fil des décennies. Voir ce qu’un mot de passe PDF protège réellement.
  • Ni scripts, ni actions de lancement, ni exécutables intégrés. Un comportement qui dépend de l’exécution de code est un comportement que personne ne peut garantir plus tard.
  • Aucune référence externe. Tout ce qui est dessiné sur la page doit être dans le fichier. Une page qui tire une image ou une police d’une URL est une page qui finira par être blanche.
  • Les métadonnées XMP sont obligatoires, et elles doivent s’accorder avec les champs d’information du document plutôt que les contredire. Ce que contiennent les métadonnées d’un PDF explique les deux enregistrements et pourquoi ils divergent si souvent.

Quelques règles dépendent de la partie de la norme à laquelle vous vous conformez. La transparence et les images JPEG 2000 sont interdites en PDF/A-1 et autorisées à partir de PDF/A-2 ; les pièces jointes intégrées sont interdites en PDF/A-1, limitées à d’autres fichiers PDF/A en PDF/A-2, et sans restriction en PDF/A-3 — ce qui fait du PDF/A-3 le véhicule habituel d’une facture contenant une copie XML lisible par une machine.

Une lacune, honnêtement. Un lien hypertexte vers un site web est autorisé — c’est une annotation, pas un contenu dont la page dépend — et il se périmera exactement aussi vite que n’importe quel autre lien. Le PDF/A préserve le rendu du document. Il ne préserve pas le web.

Les parties, et la lettre qui les suit

Une déclaration de conformité a deux moitiés : quelle partie de la norme, et quel niveau à l’intérieur de celle-ci. PDF/A-2b signifie partie 2, niveau b.

Les parties suivent le format sous-jacent. PDF/A-1 repose sur PDF 1.4 et c’est la plus stricte. PDF/A-2 repose sur ISO 32000-1 et assouplit les restrictions sur la transparence et le JPEG 2000. PDF/A-3, c’est PDF/A-2 plus la possibilité d’intégrer des fichiers quelconques. PDF/A-4 repose sur PDF 2.0 et réorganise le schéma — il abandonne les lettres a/u/b et ajoute un niveau de conformité pour les modèles techniques 3D interactifs, PDF/A-4e.

Au sein des parties 1 à 3, le niveau dit quelle part du sens du document est préservée, et les niveaux sont cumulatifs.

1U+004123

Les niveaux de conformité sont cumulatifs

  1. Niveau b — basique. Le fichier aura à l’avenir la même apparence qu’aujourd’hui. C’est tout ce qu’il promet.
  2. Niveau u — b, plus chaque caractère mis en correspondance avec une valeur Unicode, de sorte que le texte peut encore être cherché et copié.
  3. Niveau a — u, plus un arbre de structure : titres, listes, ordre de lecture. Le seul niveau qu’un réglage d’export ne suffit pas à atteindre.
NiveauCe qu’il garantitCe qu’il coûte à produire
b — basiqueLe fichier aura à l’avenir la même apparence qu’aujourd’hui.Un réglage d’export. Atteignable pour presque n’importe quel document.
u — UnicodeLe niveau b, plus la correspondance de chaque caractère de la page avec une valeur Unicode, de sorte que le texte reste cherchable et copiable.Un réglage d’export lui aussi, en général, si l’application productrice écrit des tables de caractères correctes.
a — accessibleLe niveau u, plus un arbre de structure : titres, listes, tableaux, ordre de lecture, langue.Du travail de rédaction. Ce n’est pas une case à cocher.

PDF/A-1 n’a que les niveaux a et b ; le niveau u a été introduit avec la partie 2.

La plupart des institutions qui demandent du PDF/A veulent du PDF/A-1b ou du PDF/A-2b, et si l’on ne vous a pas dit lequel, c’est sur ce couple qu’il vaut la peine de poser la question. Le niveau a est d’un tout autre ordre de travail : un véritable arbre de structure doit provenir d’un document rédigé avec des titres et des listes plutôt qu’avec du gras et des tabulations, et aucun convertisseur ne l’invente de façon fiable. Ce qui rend un PDF accessible explique pourquoi.

D’où doit venir un fichier PDF/A

De la source. Les traitements de texte, les applications de mise en page, les chaînes d’impression et la plupart des générateurs de rapports peuvent exporter directement en PDF/A, et c’est la seule voie qui fonctionne de façon fiable, parce que l’application a encore les polices, l’information colorimétrique et la structure sous les yeux.

Convertir un PDF existant en PDF/A est un travail de réparation, et il vaut la peine de savoir en quoi consiste cette réparation avant de faire confiance au résultat. Un convertisseur doit trouver des remplaçantes aux polices qui n’ont jamais été intégrées — c’est-à-dire substituer quelque chose et accepter que le texte puisse se déplacer —, attribuer un profil colorimétrique qui n’a jamais été choisi, retirer un chiffrement qu’il n’est peut-être pas capable de retirer, et supprimer l’interactivité. Il y parvient fréquemment. Il modifie parfois le document, et les modifications sont du genre que personne ne vérifie.

iBuildPDF ne produit pas de PDF/A. Aucun outil ici ne convertit un fichier en PDF/A, et un outil de navigateur qui prétendrait le faire sans pouvoir retrouver une police manquante prétendrait quelque chose dont il est incapable. Ce que ce site peut faire, c’est vous dire ce que vous tenez avant que vous n’alliez chercher un logiciel qui, lui, le fait :

  • Nombre de pages et informations sur le fichier — les faits structurels, y compris s’il y a ou non une couche de texte.
  • L’éditeur de métadonnées — ce que l’application productrice a enregistré à son propre sujet, ce qui est généralement l’indice le plus rapide sur la façon dont le fichier a été fabriqué, et donc sur ce qui risque de le faire échouer.
  • PDF en texte — un test grossier du niveau u. Si le texte extrait revient sous forme de caractères corrects et lisibles, les tables de caractères sont là ; s’il revient en charabia, elles n’y sont pas, et le fichier ne peut pas atteindre le niveau u en l’état. Pourquoi le texte copié ressort en charabia explique cet échec.
  • Aplatir un PDF — résout les champs de formulaire et les annotations dans la page, ce qui fait partie de ce qu’une conversion devrait de toute façon faire.

Tous les quatre fonctionnent dans votre navigateur. Aucun d’eux ne rend un fichier conforme.

Comment savoir si un fichier en est vraiment un

Un fichier PDF/A se déclare dans ses métadonnées XMP, où il enregistre la partie et le niveau de conformité. Les lecteurs affichent souvent un bandeau en haut de la fenêtre pour le signaler.

La déclaration est une affirmation, pas une preuve. N’importe quel fichier peut la porter. Un fichier peut aussi être modifié après coup : un document réellement conforme le mardi peut ne plus l’être le vendredi tout en continuant d’annoncer qu’il l’est. Le seul moyen de savoir est de passer un validateur, et l’archive qui a refusé votre fichier en a passé un.

veraPDF est le validateur open source, développé avec la PDF Association, et c’est celui qu’un bon nombre d’institutions utilisent elles-mêmes. Si votre fichier a été refusé, la chose utile à demander n’est pas un nouvel essai mais le rapport du validateur, qui nomme la règle qui a échoué. En pratique, la plupart des refus relèvent de l’une de ces trois causes :

  1. Une police n’est pas intégrée — souvent une seule police, souvent dans un en-tête ou un numéro de page que personne n’a regardé.
  2. Il n’y a pas d’intention de sortie, donc la couleur est indéfinie.
  3. Le fichier est chiffré, parfois par un mot de passe de permissions dont l’expéditeur ignorait l’existence.

Enfin, la limite qui compte le plus et dont on parle le moins : un fichier peut passer la validation et rester un mauvais document d’archive. Un scan sans couche de texte est un PDF/A-1b parfaitement valide et restera à jamais impossible à chercher. La validation contrôle le contenant. Savoir si ce qu’il y a dedans mérite d’être conservé, et si quelqu’un saura le retrouver dans vingt ans, est une autre question, à laquelle aucune norme ne répond à votre place.

Les outils traités dans cet article

Sources

Documentation primaire des affirmations ci-dessus.

Dernière révision : 28 septembre 2026

Publié par iBuildPDF.

Plus dans la base de connaissances

Parcourir la base de connaissances