Taille de fichier et compression
Pourquoi un PDF numérisé est bien plus lourd que l’original
Pourquoi mon PDF numérisé est-il si lourd ?
Enregistrez vos outils favoris
Créez un compte iBuildPDF gratuit pour conserver vos outils favoris et les retrouver rapidement à tout moment.
Compte gratuit. Les outils PDF eux-mêmes n’en demandent jamais.
Réponse courte
Parce qu’un scan n’est pas un document, c’est un ensemble de photographies — une par page, de plusieurs millions de pixels chacune — et le nombre de pages compte bien moins que la résolution et le mode de couleur auxquels elles ont été capturées. Doubler la résolution de numérisation quadruple les données, et numériser en couleur plutôt qu’en niveaux de gris les triple encore avant compression, ce qui, dans un fichier fini, se traduit généralement par environ deux à trois fois la taille. C’est ainsi que dix pages de texte simple deviennent un fichier plus lourd qu’un film.
Faites le calcul une fois et cela cesse d’être mystérieux
Un scanner ne lit pas un document. Il échantillonne une feuille de papier sur une grille et enregistre le résultat, et la taille de cette grille est fixée par deux nombres que vous avez choisis sans y penser.
Une page A4 fait 210 × 297 mm, soit environ 8,3 × 11,7 pouces. À 300 échantillons par pouce, cela fait à peu près 2 480 × 3 500 pixels — environ 8,7 millions d’entre eux, pour une seule page. En couleur, à trois octets par pixel, cela représente autour de 26 Mo de données brutes avant la moindre compression. Montez le réglage à 600 DPI et la grille double dans chaque direction, donc le nombre de pixels quadruple : environ 35 millions de pixels et 104 Mo bruts, pour la même feuille de papier.
La compression fait énormément baisser ces chiffres — c’est pourquoi une page numérisée pèse typiquement quelques centaines de kilooctets plutôt que 26 Mo —, mais elle ne change pas les rapports. Un scan à 600 DPI représente à peu près quatre fois le travail d’un scan à 300 DPI, quoi que fasse ensuite le compresseur, et un scan en couleur porte à peu près trois fois plus d’échantillons qu’un scan en gris.
Comparez cela à l’autre solution. La même page écrite comme du texte est un flux de contenu fait d’instructions de dessin : quelle police, quel corps, quels caractères, à quelles coordonnées. Une page de prose coûte quelques kilooctets. Tout l’écart est là, et c’est pourquoi un rapport de 40 pages exporté depuis un traitement de texte est plus léger qu’un scan de 4 pages du même rapport.
Pour savoir quel genre de fichier vous avez réellement, nombre de pages et informations sur le fichier indique les formats de page et la présence ou non d’une couche de texte, et ce PDF est-il scanné ou est-ce du texte présente la version en deux secondes du test.
Les deux réglages qui décident de tout
La résolution
La résolution ne signifie quelque chose que par rapport à l’usage qui sera fait du résultat. Un texte imprimé à 300 DPI est indiscernable du papier à bout de bras ; sur un écran, où vous regardez peut-être 100 à 150 pixels par pouce de page affichée, la moitié de cela est déjà invisible. Le 600 DPI sert à reproduire le détail fin — une photographie que vous comptez réimprimer, une gravure, une écriture manuscrite que vous devez examiner — et c’est le mauvais réglage pour un document de bureau, où il quadruple le fichier en échange d’un détail qu’aucun lecteur ne verra jamais.
Ce que la résolution décide vraiment
- 72 DPI. Net sur un écran, visiblement en escalier sur papier.
- 150 DPI. Acceptable pour une imprimante de bureau et un document que personne n’examinera.
- 300 DPI. Ce qu’attend un imprimeur professionnel, mesuré à la taille où l’image est réellement imprimée.
Le mode de couleur
Chaque pixel est stocké à une certaine profondeur. La couleur conserve trois canaux ; les niveaux de gris en conservent un ; le noir et blanc conserve un seul bit, allumé ou éteint.
Ce que coûte le réglage de couleur, par pixel
- Couleur — trois canaux pour chaque pixel. À retenir seulement quand la couleur porte de l’information.
- Gris — une valeur par pixel, 256 niveaux. Suffisant pour du texte imprimé, du crayon, des tampons et des visages.
- Noir et blanc — un bit par pixel, allumé ou éteint. Très léger, et tout ce qui se trouve entre les deux est jeté avant même d’atteindre le fichier.
Après compression, les rapports ne sont pas exactement 24 : 8 : 1 — le JPEG traite l’information de couleur plus grossièrement que la luminosité, si bien qu’un scan en couleur est souvent plus proche du double d’un scan en gris que du triple, et qu’un scan en noir et blanc compressé avec les schémas fax et bi-niveau que le PDF prend en charge peut faire moins d’un vingtième. La direction est fiable même là où le facteur exact ne l’est pas.
| Réglage | Bon pour | Ce qu’il vous coûte |
|---|---|---|
| 150 DPI, gris | Lire à l’écran, partager une copie de référence. | Les petits corps s’adoucissent. Pas assez bon pour imprimer. |
| 300 DPI, gris | Le choix par défaut raisonnable pour un document de bureau : texte, formulaires, signatures, notes au crayon, tampons. | Rien, pour un document qui était de l’encre noire sur du papier blanc. |
| 300 DPI, couleur | Tout ce où la couleur porte du sens — un contrat surligné, un graphique en couleur, une photographie. | Environ deux à trois fois la taille du même scan en gris. |
| 600 DPI, couleur | La reproduction : photographies, œuvres graphiques, tout ce qui sera réimprimé à la même taille. | Quatre fois les pixels du 300 DPI. Presque jamais le bon choix pour un document de texte. |
| Noir et blanc (1 bit) | Du texte imprimé net et des dessins au trait, et rien d’autre. | Tout ce qui se trouve entre le noir et le blanc est jeté. Voir plus bas. |
Les menus des scanners emploient rarement ces mots. Les modes « Document », « Texte » ou « Fax » sont généralement des niveaux de gris ou du 1 bit ; « Photo » est de la couleur à haute résolution. Si le vôtre ne propose qu’un curseur de qualité, le milieu de ce curseur est presque toujours la bonne réponse pour de la paperasse.
Réparer le fichier que vous avez déjà
Un scan est le seul genre de PDF sur lequel la compression fonctionne de façon fiable, parce qu’un scan n’est rien d’autre que des images et que c’est dans les images que sont les octets. L’ordre qui en tire le plus :
- Regardez d’abord. Nombre de pages et informations sur le fichier, puis divisez la taille du fichier par le nombre de pages. Au-delà d’environ un mégaoctet par page, vous avez affaire à un scan couleur haute résolution où il y a beaucoup de marge. En dessous d’environ 150 Ko par page, il ne reste presque rien à prendre.
- Abandonnez la couleur si elle ne porte rien. PDF en niveaux de gris convertit les pages en gris, ce qui supprime les canaux de couleur et facilite aussi le travail du compresseur ensuite. Faites-le avant de compresser, pas après.
- Compressez. Compresser un PDF décode chaque image intégrée, la rééchantillonne à une résolution raisonnable pour la taille à laquelle elle est dessinée, puis la réencode. Comment fonctionne la compression PDF décrit ce que change chaque mode. Si vous visez un chiffre précis, compresser à 1 Mo le vise directement.
Deux mises en garde honnêtes sur la compression d’un scan en particulier.
Les scans le supportent moins bien que les photographies. Le JPEG jette du détail là où l’œil est le moins sensible, et concentre ses erreurs autour des bords nets à fort contraste — c’est-à-dire exactement ce qu’est une lettre. Une photo de vacances en basse qualité paraît légèrement floue ; un scan de page au même réglage voit des bavures apparaître autour des lettres et commence à ressembler à une mauvaise photocopie. Vérifiez le résultat à 100 % avant de l’envoyer, et pourquoi mon PDF est-il flou explique ce que vous regardez si cela a mal tourné.
Vous ne pouvez pas récupérer ce que le scanner a jeté. La compression peut se débarrasser du superflu d’un scan couleur à 600 DPI sans rien perdre que vous remarqueriez à la taille de lecture. Elle ne peut pas rendre du détail à un scan qui a été fait à 150 DPI au départ, et aucun réglage sur ce site ni ailleurs ne le fera.
Quand renumériser est tout simplement la bonne réponse
Si vous avez encore le papier, renumériser au bon réglage est généralement plus rapide que de se battre avec le fichier, et le résultat est meilleur — parce que les artefacts de compression n’ont jamais été introduits, au lieu d’être introduits puis partiellement retirés.
Pour de la paperasse ordinaire : 300 DPI, niveaux de gris, numérisé directement en un seul PDF multipage. C’est léger, net, cela s’imprime correctement, cela garde le crayon et les signatures lisibles, et cela ne demande aucun travail supplémentaire. La couleur seulement quand la couleur signifie quelque chose.
Numériser chaque page dans son propre fichier puis les réunir ensuite avec fusionner des PDF fonctionne parfaitement et c’est parfois la seule option qu’offre votre scanner, mais un scanner capable de produire directement un seul document en produira généralement un plus léger, parce qu’il compresse tout le lot avec des réglages cohérents.
Les photographies de pages prises au téléphone sont le cas à éviter si vous avez le choix. Un éclairage inégal, un léger angle et un arrière-plan donnent tous au compresseur plus de variation à préserver qu’un scanner à plat : le fichier ressort donc plus lourd et plus difficile à lire. Si vous n’avez qu’un téléphone, une application de numérisation qui redresse la perspective et seuille la page est nettement meilleure que la pellicule photo.
Trois choses à savoir avant de décider
La taille est le moindre de ce qu’un scan vous coûte. Une page numérisée ne contient pas de texte : le document ne peut donc pas être cherché, ne peut pas être copié, ne peut pas être lu à voix haute par un lecteur d’écran, et se convertit en Word sous forme d’image. L’OCR reconnaît les caractères et ajoute une couche de texte sous l’image, ce qui corrige tout cela — et rend le fichier légèrement plus lourd plutôt que plus léger, puisque le texte s’ajoute à l’image au lieu de la remplacer. Cet outil fonctionne sur un serveur : le document est donc téléversé pour être traité ; pour un scan confidentiel, c’est une décision à prendre délibérément.
Les modes noir et blanc les plus agressifs peuvent changer les caractères. Certains scanners compressent la sortie 1 bit en repérant les formes répétées et en n’en stockant qu’un exemplaire, ce qui est extrêmement efficace et, là où deux caractères se ressemblent à la résolution numérisée, a été documenté comme substituant l’un à l’autre — un chiffre devenant discrètement un autre chiffre dans un tableau que personne n’a relu. Si les chiffres comptent, n’utilisez pas le plus petit réglage noir et blanc, et comparez la sortie au papier.
Ce que la numérisation en noir et blanc jette
- Une marque pâle — une note au crayon, un tampon clair, un filet gris. Sur le papier, elle est manifestement là.
- Le scanner choisit un seuil. Tout ce qui est plus sombre que la ligne devient noir, tout ce qui est plus clair devient blanc, et il n’y a rien entre les deux à stocker.
- Le texte imprimé survit parce qu’il était franchement sombre. La marque pâle a disparu, et rien de ce qu’on fera ensuite au fichier ne la ramènera.
Conservez l’original. Chaque étape décrite ici est à sens unique. Le rééchantillonnage, la conversion en niveaux de gris et la recompression écartent tous de l’information définitivement, et le moment où l’on découvre qu’on avait besoin de la version en couleur n’est jamais celui qu’on attendait.
Les outils traités dans cet article
Sources
Documentation primaire des affirmations ci-dessus.