Pourquoi les numéros de page d’un PDF ne correspondent pas aux pages
Pourquoi les numéros de page de mon PDF ne correspondent-ils pas à ceux imprimés sur les pages ?
Enregistrez vos outils favoris
Créez un compte iBuildPDF gratuit pour conserver vos outils favoris et les retrouver rapidement à tout moment.
Compte gratuit. Les outils PDF eux-mêmes n’en demandent jamais.
Réponse courte
Parce qu’il y a jusqu’à trois numéros pour le même feuillet et que rien ne les relie. Sa position dans le fichier est ce que comptent tous les outils et ce que signifie une plage de pages. L’étiquette qu’un lecteur affiche dans sa case de page est facultative, et beaucoup d’applications n’en écrivent jamais. Le numéro imprimé sur la page est de l’encre — une partie de l’image, comme n’importe quelle autre marque — et rien ne le lit. Un document avec une couverture et des liminaires en chiffres romains a les trois en désaccord par construction.
Trois numéros pour le même feuillet
La confusion n’est le défaut de rien. C’est que le mot « page » fait trois métiers à la fois.
Three numbers for the same sheet
- Where the sheet sits in the file: the fifth of however many. This is what every tool counts, what a page range means, and it always exists.
- The label the document may carry for that sheet — roman numerals for front matter, a prefix for an appendix. Optional, and many applications never write one.
- The number printed on the page. It is ink: part of the picture, the same as any other mark, and nothing reads it.
La position dans le fichier. Les pages d’un PDF sont rangées dans un arbre, dans l’ordre, et la cinquième est la cinquième. Ce numéro n’est pas stocké à côté de la page — c’est simplement l’ordre — et il existe toujours, de 1 jusqu’au nombre de pages. Tout ce qui est mécanique s’en sert : plages de pages, extraction, suppression, le numéro que votre lecteur fait défiler.
L’étiquette. Un document peut aussi porter une étiquette pour chaque feuillet : i, ii, iii pour les liminaires, puis 1 et suivants pour le corps, puis A-1 pour une annexe. C’est facultatif, c’est une structure distincte des pages elles-mêmes, et un lecteur qui la gère affiche l’étiquette dans sa case de page à la place de la position.
L’encre. Le numéro que l’auteur a imprimé en pied de page est une marque sur la page, dessinée par la même machinerie que les mots au-dessus. Ce n’est pas une valeur que le fichier enregistre quelque part ; c’est une image de numéro. Rien ne le consulte, rien ne peut se tromper à son sujet, et rien ne le changera pour vous.
Ainsi un rapport avec une couverture, un sommaire et deux pages de liminaires a un corps qui commence au feuillet 5, peut être étiqueté 1 et porte 1 imprimé dessus — trois réponses différentes, toutes justes, à « quelle page est-ce ? ». L’ennui ne commence que lorsque deux personnes, ou une personne et un programme, en visent des différentes.
L’étiquette, et pourquoi votre lecteur peut ne pas l’afficher
Les étiquettes de page sont définies dans ISO 32000-1 et sont stockées plus économiquement qu’on ne l’imagine. Un document ne porte pas une étiquette par page. Il porte un petit ensemble de plages, chacune disant : à partir de ce feuillet, numérote les pages dans ce style, avec ce préfixe, en commençant à cette valeur.
How page labels are actually stored
- Where each sheet sits in the file. This is the order of the pages, not a value written beside them, and it runs 1 to N whatever else the document says.
- The labels. A reader that supports them shows these in its page box instead of the position, which is how a document can open at a page called ii.
- They are stored as a few ranges, not one label per page: a style, a prefix and a starting number, applied from one sheet until the next range begins.
Les styles disponibles sont les chiffres décimaux, les chiffres romains en majuscules et minuscules, et les lettres majuscules et minuscules, chacun avec un préfixe facultatif — d’où viennent A-1 et Appendix 2.
Stocker des plages plutôt que des valeurs est efficace et a une conséquence qui surprend tout le monde : les plages sont attachées à des positions, pas à des pages. Déplacez une page et son étiquette ne la suit pas ; l’étiquette appartient à l’endroit où elle se trouve désormais. Supprimez les deux premiers feuillets d’un document dont les étiquettes repartent au troisième et vous obtenez un document qui commence à iii, ou un document avec deux pages étiquetées 1 toutes les deux.
Vient ensuite la prise en charge par les lecteurs, plus inégale que la fonction ne le mérite. Certains affichent les étiquettes dans la case de page et vous laissent les taper ; d’autres affichent la position quoi que dise le fichier ; et l’étude de la PDF Association a constaté que beaucoup de visionneuses n’acceptent que des chiffres arabes dans la case de navigation, de sorte qu’un document étiqueté ii et A-1 a des pages où vous ne pouvez pas aller par leur nom, même dans un logiciel qui affiche ces noms. La même étude soulève le point le plus utile pour la plupart des gens : les traitements de texte courants numérotent très bien les pages sur la page et, le plus souvent, n’exportent pas du tout l’information d’étiquette.
Ce qui veut dire que le cas ordinaire est un document sans aucune étiquette — son lecteur compte des feuillets, ses pieds de page disent autre chose, et rien n’est cassé.
Ce que signifie vraiment une plage de pages
Tous les outils de ce site comptent les feuillets depuis le début du fichier. Pas les étiquettes, et certainement pas les numéros imprimés.
A range box counts sheets, not printed numbers
- A page range, as every tool here reads it: positions in the file, counted from the front.
- So it takes the first three sheets, whatever happens to be printed on them.
- These are the printed numbers — ink, from whatever document these pages were cut out of. Asking for 47 to 49 asks for pages this file does not have.
Donc si on vous a donné les pages 47 à 52 d’un contrat sous forme de PDF à part, ce document a six pages et ce sont les pages 1 à 6. Taper 47-52 demande quelque chose qu’il n’a pas. C’est la façon la plus courante dont une extraction tourne mal, et le fichier n’y est pour rien.
Les deux champs de plage d’ici se comportent différemment l’un de l’autre, ce qu’il vaut mieux savoir avant de faire confiance à l’un ou l’autre :
- Extraire des pages utilise l’analyseur commun. Il accepte
1, 4-6, 12, prend-, un tiret demi-cadratin ou le mottoentre deux nombres, et remet une plage inversée à l’endroit. Il trie puis dédoublonne, donc3,1vous donne les pages 1 et 3 dans cet ordre et non dans celui que vous avez tapé. Si vous nommez une page qui n’existe pas, il refuse et dit laquelle et combien il y en a, plutôt que de deviner. - Découper un PDF a un champ de liste de pages plus tolérant et donc plus silencieux. Il rogne une plage qui dépasse la fin — sur un document de douze pages,
1-500vous donne 1 à 12 — et ignore en silence un numéro de page isolé qui n’existe pas. Il conserve l’ordre que vous avez tapé. Son mode plage utilise en revanche des champs numériques de/à, et c’est la version à employer quand cela compte.
L’habitude qui sauve l’après-midi : avant de taper une plage, passez le fichier par nombre de pages et informations du fichier et lisez-y le nombre de pages. Il indique aussi les dimensions des pages et la présence d’une couche de texte, les deux autres choses que les gens supposent au lieu de vérifier. Comment découper un PDF traite du choix entre les modes.
Ce que vous pouvez changer et ce que vous ne pouvez pas
Ajouter des numéros de page à un PDF imprime des numéros sur les pages. Précisément ce qu’il fait, parce que le détail en est toute la valeur :
- Il dessine du Helvetica 10 points, à 28 unités du bord, dans l’une de cinq positions, en gris foncé. Il utilise l’une des quatorze polices standard, donc aucune donnée de police n’est ajoutée au fichier — quelques centaines d’octets d’instructions de dessin par page et rien d’autre.
- Il a deux réglages de départ distincts, et c’est pour cela que les gens viennent : à quel feuillet commencer, et à partir de quel nombre compter. Ainsi une couverture et un sommaire peuvent rester sans numéro pendant que le feuillet 3 imprime 1. Les feuillets avant le départ ne reçoivent rien du tout.
- Le format
n / totalcompte les feuillets effectivement numérotés, décalés du numéro de départ. Commencez au feuillet 2 d’un document de dix feuillets et le feuillet 2 imprime 1 / 9, pas 1 / 10. C’est sans doute la bonne réponse et c’est assurément une réponse surprenante, donc cela vaut la peine de le voir dans l’aperçu avant de télécharger. - Les numéros sont placés par rapport à la taille propre de chaque page, donc un ensemble mêlant A4 et Letter — ce que font couramment les documents fusionnés — obtient quand même ses numéros au même endroit visuel sur chaque feuillet.
- Sur une page portant une rotation, le numéro est dessiné dans l’espace stocké et non tourné de la page, et le lecteur fait ensuite pivoter toute la page : sur une numérisation en biais, le numéro se pose le long de ce que vous voyez comme un bord, en se lisant de côté. L’aperçu le montre plutôt que de l’embellir. Pourquoi un PDF pivoté revient à son état d’origine explique l’attribut derrière cela.
Deux choses qu’il ne fait pas, et que rien d’autre ici ne fait non plus.
Il n’écrit pas d’étiquettes de page. Aucun outil de ce site ne les définit, donc après avoir ajouté des numéros la case de page de votre lecteur affiche toujours des positions. Si un dépôt exige que la case de navigation corresponde aux numéros imprimés, c’est un travail d’étiquettes de page et il revient à une application capable de les écrire — idéalement celle d’où vient le document.
Il ne retire pas les numéros déjà présents. Les numéros imprimés font partie du contenu de la page ; en ajouter une seconde série vous en donne deux. Les seules façons de retirer de l’encre imprimée sont de la couvrir ou de la couper : caviarder la recouvre et rastérise cette page, et rogner ne fait que masquer ce qui est hors de la nouvelle limite au lieu de le supprimer. Les deux valent moins que de retourner à la source et d’exporter à nouveau, si vous le pouvez.
Là où cela fait mal
- « Voir page 12 » est ambigu. Dans un document dont les liminaires sont numérotés à part, trois feuillets répondent à cela. Dites lequel vous visez — « le douzième feuillet » ou « la page portant 12 » — et l’échange s’arrête là.
- Chercher un numéro imprimé fonctionne rarement. Dans une numérisation ce sont des pixels, il n’y a donc rien à trouver. Même dans un document textuel, un numéro de page en pied est fréquemment dessiné séparément du corps et peut ne pas s’extraire dans un ordre utile. Pourquoi le texte copié sort brouillé explique pourquoi l’ordre d’extraction est une supposition.
- Réordonner ou supprimer des pages ne renumérote rien. Les numéros imprimés restent imprimés ; les étiquettes restent avec leurs plages. Et les outils d’ici reconstruisent le document à partir de pages copiées, ce qui part d’un catalogue de document neuf — donc un schéma d’étiquettes présent dans l’original n’est pas repris dans la sortie, et ce que vous récupérez, ce sont de simples positions. Réordonner et supprimer des pages de PDF couvre ce qui bouge aussi et ce qui ne bouge pas.
- Les signets et les liens internes visent des pages, pas des numéros. Ils survivent au réordonnancement parce qu’ils référencent l’objet page, ce qui est généralement ce que vous voulez — et cela veut aussi dire qu’un sommaire dont vous venez d’invalider les numéros imprimés vous emmènera toujours au bon endroit tout en affichant le mauvais numéro.
- Un ensemble fusionné ne tombe presque jamais juste. Chaque document source a apporté ses propres pieds imprimés, et le nouveau document a un décompte de positions continu et unique. Si l’ensemble doit pouvoir être cité, numérotez-le après la fusion et précisez dans la note d’accompagnement que les numéros imprimés dans le corps sont ceux des originaux.
Les outils traités dans cet article
Sources
Documentation primaire des affirmations ci-dessus.