Ce qu’est vraiment un fichier PDF
Qu’est-ce qu’un PDF, en dessous ?
Enregistrez vos outils favoris
Créez un compte iBuildPDF gratuit pour conserver vos outils favoris et les retrouver rapidement à tout moment.
Compte gratuit. Les outils PDF eux-mêmes n’en demandent jamais.
Réponse courte
Un PDF est une description de pages finies. Il enregistre exactement où se trouve chaque glyphe, chaque ligne et chaque image sur une page de taille fixe, ainsi que les polices nécessaires pour les dessiner. C’est pourquoi il paraît identique partout — et pourquoi le modifier est malaisé. Il n’y a pas de paragraphes dans un PDF, seulement des marques à des positions.
Ce qu’il y a dans le fichier
Un PDF, ce sont quatre parties à la suite, et trois d’entre elles sont lisibles si vous ouvrez le fichier dans un éditeur de texte brut.
Les quatre parties d’un fichier PDF
- En-tête — une ligne nommant la version de PDF utilisée.
- Corps — les objets numérotés : pages, polices, images, et les instructions de dessin.
- Table de références — la position en octets de chaque objet, pour un accès direct.
- Bande de fin — où commence la table et quel objet est la racine. Les lecteurs démarrent ici.
L’en-tête est une ligne unique nommant la version. Le corps est une collection numérotée d’objets — pages, polices, images, et les flux de contenu qui indiquent quoi dessiner où. La table de références croisées enregistre le décalage en octets de chacun de ces objets. La bande de fin (trailer) indique où commence cette table et quel objet est la racine du document.
La table est la partie qui mérite d’être comprise, car elle explique la plus grande part du comportement d’un PDF. Un PDF ne se lit pas du début à la fin comme une lettre ; il se consulte. Un lecteur ouvre le fichier, saute à la fin, lit la bande de fin, trouve la table, et à partir de là va directement à l’objet dont il a besoin. C’est ainsi qu’un lecteur vous montre la page 400 d’un rapport de 900 pages sans lire les 399 premières.
C’est aussi pourquoi un fichier ayant perdu ses derniers kilooctets en transit ne s’ouvre généralement pas du tout. Les objets sont toujours là ; le plan qui y mène ne l’est plus. Pourquoi un PDF ne s’ouvre pas traite ce cas, et Réparer un PDF peut parfois reconstruire la table à partir de ce qui subsiste.
Pour voir ce qu’un fichier dit de lui-même, Nombre de pages et infos fichier rapporte les faits structurels et l’éditeur de métadonnées montre les faits descriptifs.
Pourquoi il paraît identique partout
Chaque position dans un PDF est absolue. Une ligne de texte n’est pas « le deuxième paragraphe » ; c’est un ensemble de glyphes placés à des coordonnées énoncées sur une page de taille énoncée. Rien ne se réajuste quand la fenêtre change, parce qu’il n’y a rien à réajuster. Les décisions de mise en page ont été prises une fois, par ce qui a produit le fichier, puis figées.
Les polices sont l’autre moitié de la promesse. Un PDF peut transporter en lui les polices qu’il utilise, afin qu’un lecteur dessine le texte avec les mêmes formes que l’auteur a vues, plutôt que de substituer ce que la machine a sous la main. Quand une police n’est pas intégrée, la substitution se voit — largeurs de lettres différentes, coupures de ligne différentes, parfois un alphabet différent. C’est presque toujours la cause d’un document qui paraît faux sur l’ordinateur de quelqu’un d’autre, et cela a son propre article.
Cette fixité est toute la valeur du format. C’est aussi tout son coût, et les deux ne peuvent être séparés : un document garanti identique partout est un document incapable de s’adapter à quoi que ce soit.
Les versions, et la question du PDF/A
La version dans l’en-tête — 1.4, 1.7, 2.0 — indique quelles fonctionnalités le fichier peut utiliser, pas son ancienneté ni sa qualité. Les lecteurs sont rétrocompatibles en pratique, donc un fichier 1.4 de 2003 s’ouvre très bien aujourd’hui. Vous n’avez presque jamais besoin de vous en soucier, et « enregistrer sous une version de PDF plus ancienne » ne corrige presque jamais rien.
Les variantes méritent d’être connues :
- PDF/A est fait pour l’archivage. Il exige que chaque police soit intégrée et interdit tout ce dont le sens pourrait dériver — pas de références externes, pas de scripts, pas de chiffrement. Un fichier PDF/A est un pari qu’il s’affichera encore correctement dans trente ans.
- PDF/X est fait pour l’impression commerciale, et fige la couleur et la géométrie de page. Voyez préparer un PDF pour l’impression.
- PDF étiqueté (Tagged PDF) ajoute un arbre de structure — titres, listes, ordre de lecture — ce qui rend un document utilisable avec un lecteur d’écran. Ce qui rend un PDF accessible approfondit le sujet.
Ce sont des contraintes superposées au même format, pas des formats différents. Un fichier PDF/A est un PDF, et tout outil ordinaire peut le lire.
Pourquoi modifier un PDF est malaisé
Parce qu’il n’y a pas de texte à modifier, au sens qu’entend un traitement de texte. Changez « mars » en « septembre » et le remplacement est plus long, donc il entre en collision avec ce qui suivait — et rien dans le fichier ne sait que ces glyphes formaient une phrase, ni que la phrase appartenait à un paragraphe qui devrait se réajuster. Un éditeur de PDF doit reconstruire cette structure par inférence, et c’est bien une inférence, ce qui explique que les résultats varient selon la façon dont le fichier a été produit.
Ce que cela signifie en pratique :
- Les petites corrections — une date, un nombre, un nom — sont ce pour quoi un éditeur de PDF est vraiment doué.
- Réécrire se fait mieux à la source. Modifiez le document d’origine et produisez un nouveau PDF ; si l’original a disparu, PDF en Word vous donne une approximation modifiable, et ce qu’il peut et ne peut pas récupérer vaut la peine d’être lu d’abord.
- Le travail au niveau des pages — réordonner, supprimer, faire pivoter, fusionner — est facile et sans perte, car cela déplace des objets entiers plutôt que de toucher à leur contenu. Réordonner et supprimer des pages explique pourquoi.
Un avertissement qui compte plus que les autres : recouvrir du texte d’un rectangle noir dans un éditeur ne cache rien. Le texte est toujours dans le fichier, en dessous. Caviarder un PDF correctement est une opération différente, et Caviarder un PDF est l’outil pour cela.
Les outils traités dans cet article
Sources
Documentation primaire des affirmations ci-dessus.