Taille de fichier et compression
Comment fonctionne réellement la compression PDF
Que se passe-t-il vraiment quand on compresse un PDF ?
Enregistrez vos outils favoris
Créez un compte iBuildPDF gratuit pour conserver vos outils favoris et les retrouver rapidement à tout moment.
Compte gratuit. Les outils PDF eux-mêmes n’en demandent jamais.
Réponse courte
Dans presque tous les PDF volumineux, les octets sont des photographies : compresser le fichier revient donc à décoder ces images, à les réduire et à les réécrire. Le texte, les vecteurs et la structure sont déjà compressés et restent intacts, sauf si vous choisissez le mode destructeur qui rastérise les pages entières.
La réponse courte
Un PDF n’est pas un unique bloc compressé. C’est un ensemble d’objets numérotés — descriptions de page, polices, images, annotations, métadonnées — reliés par une table de références croisées, telle que la définit la norme ISO 32000-1, et chaque objet porte son propre filtre de compression. Il n’existe pas un seul bouton marqué « plus petit » ; il existe plusieurs actions possibles, agissant sur des parties complètement différentes du fichier.
Trois d’entre elles comptent en pratique. L’optimisation structurelle met de l’ordre dans le graphe d’objets et rapporte généralement très peu. La recompression des images décode les photographies intégrées, réduit leurs dimensions en pixels et les ré-encode : c’est de là que vient la quasi-totalité des gains réels. La rastérisation abandonne totalement la description de page et remplace chaque page par une image de celle-ci ; c’est le levier le plus puissant et le seul qui soit destructeur. Savoir lequel des trois convient à votre fichier constitue l’essentiel du problème.
Où se trouvent réellement les octets
Un document texte de 40 pages pèse généralement bien moins d’un mégaoctet. Un contrat scanné de 10 pages peut peser vingt fois plus. La différence ne tient pas au nombre de pages : l’un stocke des instructions, l’autre des photographies.
Où sont vraiment les octets
- Les images. Dans presque tout PDF volumineux, c’est quasiment tout le fichier.
- Les polices intégrées — quelques centaines de kilo-octets, autant pour 5 pages que pour 500.
- Le texte lui-même, et la structure qui le maintient. Généralement une erreur d’arrondi.
Le texte vit dans un flux de contenu : un court programme d’opérateurs de dessin indiquant quelle police, à quelle taille, à quelles coordonnées, avec quels caractères. Ce flux est stocké avec le filtre Flate — l’algorithme DEFLATE de la RFC 1951, la même compression que celle employée dans le ZIP et le PNG. Elle a déjà été appliquée. Une page de prose coûte quelques kilooctets ; quarante d’entre elles coûtent une fraction de ce que coûte une seule photographie.
Une page scannée, c’est l’inverse. Il n’y a ni texte ni description de mise en page : un seul objet image, généralement un JPEG, dessiné sur toute la page, et un flux de contenu long de trois ou quatre opérateurs. Le fichier est les images.
Voilà pourquoi « compresser mon PDF » signifie presque toujours « recompresser les images », et pourquoi les résultats varient tant entre des fichiers qui se ressemblent. Un rapport rempli de photographies de produits contient une marge énorme. Un PDF uniquement textuel n’en a presque aucune : passez-y un compresseur généraliste et vous gagnerez typiquement quelques pour cent, parce que la seule chose qu’il reste à comprimer l’a déjà été. Si vous ne savez pas de quel type de fichier vous disposez, /pdf-page-count indique le nombre de pages, les formats de page et la présence ou non d’une couche de texte.
Optimisation sans perte et optimisation structurelle
Avant même de toucher à une image, un programme d’écriture peut réorganiser le fichier lui-même. Rien de visible ne change et rien n’est perdu. Il y a trois gains courants.
- Les flux d’objets. La norme ISO 32000-1 permet de regrouper de nombreux petits objets non-flux dans un unique flux compressé, plutôt que de les écrire un à un avec leur propre surcharge.
- La suppression des objets orphelins. Modifier un PDF revient souvent à y ajouter plutôt qu’à le réécrire. Une page que vous avez supprimée, une police que vous avez remplacée, une version antérieure d’une annotation — tout cela peut encore traîner dans le fichier, sans que rien n’y renvoie. Une réécriture complète ne conserve que ce que le document désigne réellement.
- Le retrait des métadonnées. Les propriétés du document, les paquets XMP et les données privées propres à une application peuvent être supprimés. On parle de kilooctets, pas de mégaoctets, et l’intérêt réel en est la confidentialité plutôt que la taille ; /remove-pdf-metadata est l’outil dédié.
Soyez réaliste sur le rendement. Sur un PDF exporté proprement une seule fois depuis une application moderne, l’optimisation structurelle rapporte typiquement quelques pour cent, et parfois presque rien, parce que l’exportateur l’a déjà faite. Sur un fichier ouvert, modifié et réenregistré une douzaine de fois par plusieurs applications, les objets orphelins peuvent représenter une part substantielle du fichier et une réécriture rapporte bien davantage. Ce qu’elle ne fera jamais, c’est transformer un scan de 50 Mo en un fichier de 2 Mo.
Recompresser les images : deux leviers indépendants
Une fois admis que le problème vient des images, il n’y a exactement que deux choses à modifier sur chacune d’elles, et elles sont indépendantes.
La résolution
La résolution effective d’une image n’est pas une propriété de l’image seule. C’est sa largeur en pixels divisée par la largeur à laquelle elle est réellement dessinée sur la page. Une photographie de 2400 pixels de large étalée sur une page de 8 pouces fait 300 DPI. Le même fichier placé en logo dans un coin d’un pouce fait 2400 DPI, et chaque pixel au-delà des premières centaines est invisible — un détail qu’aucun écran ni aucune imprimante ne montrera jamais.
La bonne question n’est donc jamais « quelle est la taille de cette image » mais « quelle est sa taille par rapport à l’usage qui en est fait ». Le sous-échantillonnage redimensionne la grille de pixels pour que la résolution effective retombe à une valeur raisonnable. Environ 150 DPI reste confortablement au-dessus de ce qu’un écran distingue et bien en deçà de ce qu’exige l’impression ; en dessous d’environ 100 DPI, le texte contenu dans une image scannée s’adoucit visiblement.
La qualité
Le JPEG, spécifié par la norme ITU-T T.81, est destructeur par conception : il transforme des blocs de pixels en coefficients de fréquence puis les quantifie, en écartant les détails auxquels l’œil est le moins sensible. Le réglage de qualité en détermine l’agressivité. Une qualité basse donne un fichier plus léger et finit par produire des artefacts en blocs et des halos autour des contours francs — or c’est précisément là que vit le texte scanné : les scans supportent donc moins bien qu’une photographie une baisse de qualité.
Ce que fait iBuildPDF
Le mode Intelligent de /compress-pdf parcourt le graphe d’objets du PDF, repère chaque XObject image intégré, le décode, le sous-échantillonne à environ 150 DPI en fonction de la taille à laquelle il est réellement dessiné sur la page, le ré-encode en JPEG à une qualité de 0,80, puis remplace ce flux d’image sur place. Le mode Fort repose sur le même mécanisme, à environ 96 DPI et une qualité de 0,58.
Les flux de contenu des pages ne sont jamais touchés. La conséquence compte : le texte reste sélectionnable et consultable, les illustrations vectorielles restent nettes à n’importe quel zoom, et les liens, signets, champs de formulaire et annotations sont tous préservés. Seuls les pixels contenus dans les objets image changent. Certaines images sont délibérément ignorées — pourquoi certains PDF ne peuvent pas être compressés explique lesquelles et pourquoi.
La rastérisation : l’option destructrice
La dernière approche abandonne le modèle documentaire. Chaque page est rendue telle qu’un lecteur la verrait, enregistrée en JPEG, et un nouveau PDF est construit sans rien contenir d’autre que ces images.
Elle fonctionne là où rien d’autre ne fonctionne, car elle est indifférente aux raisons pour lesquelles l’original était volumineux. Une carte vectorielle dense de cent mille opérations de dessin devient une unique photographie aplatie. Un document dont toutes les images sont dans des formats impossibles à recompresser devient un document sans aucune image de ce genre. La taille du résultat ne dépend que des dimensions des pages et de la qualité JPEG, pas du contenu de l’original.
Le prix à payer est lourd et définitif :
- Plus de texte sélectionnable. Rien ne peut être copié.
- Plus de recherche, dans aucun lecteur, jamais.
- Les liens, les signets, les champs de formulaire et les annotations disparaissent.
- Les lecteurs d’écran n’ont plus rien à lire ; le document devient inaccessible.
- Les illustrations vectorielles ont désormais une résolution fixe et deviennent floues au zoom ou à l’impression en plus grand format.
Le mode Maximum d’iBuildPDF procède ainsi, et c’est le seul mode destructeur. La page le signale comme destructeur avant que vous ne le lanciez, pour que le choix soit explicite plutôt qu’une mauvaise surprise découverte plus tard. Il n’y a pas de retour en arrière : le texte n’est pas masqué, il n’existe plus dans le fichier. Et comme iBuildPDF ne fait aucun OCR, aucun outil d’ici ne pourra ensuite y remettre une couche de texte. Conservez l’original.
Choisir une approche
| Approche | Ce qui change | Texte toujours sélectionnable | Usage typique |
|---|---|---|---|
| Structurelle / sans perte | Agencement des objets, objets orphelins, métadonnées. Aucun changement visible. | Oui | Fichiers modifiés et réenregistrés de nombreuses fois ; nettoyage lié à la confidentialité. |
| Recompression des images (Intelligent, ~150 DPI, q0,80) | Les photographies intégrées sont sous-échantillonnées et ré-encodées. Flux de contenu intacts. | Oui | Le choix par défaut. Rapports, brochures, tout ce qui contient des photographies. |
| Recompression des images (Fort, ~96 DPI, q0,58) | Même mécanisme, plus agressif. Adoucissement visible sur les images détaillées. | Oui | Une limite de taille stricte impossible à respecter autrement, quand la lisibilité à l’écran suffit. |
| Rastérisation (Maximum) | Chaque page devient une image aplatie. Tout le reste est abandonné. | Non | Dernier recours : fichiers très vectoriels, ou quand rien d’autre n’a approché la cible. |
Un ordre de marche raisonnable : commencez par le mode Intelligent et regardez le résultat. S’il est assez léger, arrêtez-vous — vous n’avez rien perdu d’important. Sinon, cherchez pourquoi le fichier est volumineux avant de passer au niveau supérieur, car le mode Fort n’aide que si le fichier est lourd à cause de photographies. Pour tous les autres cas, voyez pourquoi certains PDF ne peuvent pas être compressés ; si vous devez respecter une limite fixe, faire passer un PDF sous 1 Mo explique quoi faire quand la cible n’est pas atteignable.
Tout cela s’exécute dans votre navigateur : le fichier est lu avec l’API File puis traité localement par pdf-lib et PDF.js, et rien n’est envoyé en ligne. Le plafond pratique est la mémoire de votre appareil, pas une taille de fichier fixe.
Les outils traités dans cet article
Sources
Documentation primaire des affirmations ci-dessus.