Ce PDF est-il scanné ou est-ce du texte ?
Comment savoir si un PDF est scanné ?
Enregistrez vos outils favoris
Créez un compte iBuildPDF gratuit pour conserver vos outils favoris et les retrouver rapidement à tout moment.
Compte gratuit. Les outils PDF eux-mêmes n’en demandent jamais.
Réponse courte
Essayez de sélectionner un mot avec le curseur. Si le texte se surligne, le fichier contient du vrai texte. Si vous obtenez à la place un cadre de sélection sur une image, la page est une image et le fichier ne contient aucun texte. Les deux paraissent identiques à l’écran et se comportent de façon totalement différente dans tous les outils.
Le test en deux secondes
Ouvrez le fichier et essayez de sélectionner un mot par glissement.
- Le mot se surligne — il y a une couche de texte. La recherche, la copie et la conversion fonctionneront toutes.
- Un rectangle se dessine sur la page à la place, sans rien sélectionner — la page est une seule image. Il n’y a pas de texte à trouver.
Un second test : appuyez sur Ctrl+F (Cmd+F) et cherchez un mot que vous voyez clairement. Aucune correspondance sur un mot pourtant visible signifie qu’il n’y a pas de couche de texte.
La même page, avec et sans texte
- Un PDF numérique. À l’écran, indiscernable de celui de droite.
- En dessous : des codes de caractères, chacun avec une police et une position. Cherchable, sélectionnable, convertible.
- Un PDF scanné. La même page, et la même apparence.
- En dessous : une grille d’échantillons clairs et sombres. Pas de lettres, pas de mots, rien à chercher.
Les deux pages ci-dessus sont la même page, et à l’écran elles sont indiscernables. En dessous, l’une est une suite de codes de caractères avec des positions et une police ; l’autre est une grille d’échantillons clairs et sombres qui, pour un œil humain, ressemble à de l’écriture. Rien dans la seconde ne sait qu’elle contient des lettres.
Si vous préférez ne pas plisser les yeux : passez le fichier dans PDF en texte. Un fichier scanné revient vide ou presque, et voilà votre réponse.
Pourquoi cela change tout en aval
Presque toutes les plaintes sur les outils PDF se ramènent à cette distinction.
- Convertir en Word donne des photographies. Ce n’est pas un bogue, et un meilleur convertisseur n’y changerait rien : il n’y avait pas de texte dans le fichier à convertir. Le convertisseur a fidèlement transposé ce qu’il y avait, à savoir deux images.
- La recherche ne trouve rien, dans le fichier comme dans tout système qui l’indexe.
- Le copier-coller ne donne rien.
- La compression se comporte différemment. Un scan est une donnée d’image, donc il répond bien à la compression d’image et pas du tout aux astuces qui allègent le texte — c’est pourquoi certains fichiers refusent de rétrécir alors que les scans, eux, rétrécissent généralement.
- Le caviardage est un travail différent. Il n’y a pas de texte à retirer, seulement des pixels à recouvrir — mais l’image d’origine est toujours en dessous, sauf si l’outil reconstruit la page.
- Les lecteurs d’écran ne reçoivent rien du tout. Un document scanné est, pour une technologie d’assistance, une page blanche.
Ce que l’OCR y change
La reconnaissance optique de caractères regarde l’image, détermine quelles formes sont des lettres, et écrit une couche de texte sous l’image. La page paraît exactement pareille — vous voyez toujours le scan — mais il y a maintenant un texte cherchable, sélectionnable et copiable qui se trouve, invisible, derrière.
C’est l’opération qu’effectue OCR PDF, et c’est l’étape qui doit venir en premier. Faites l’OCR, puis convertissez, cherchez ou extrayez ; les outils inutiles sur l’original fonctionneront sur le résultat.
Choisir la bonne langue compte plus qu’on ne l’imagine. L’OCR tranche entre des formes similaires à l’aide d’un modèle de ce à quoi ressemblent les mots dans une langue donnée, donc lui indiquer la mauvaise langue augmente sensiblement les erreurs — et pour l’arabe, le chinois ou le grec, un mauvais réglage produit du non-sens plutôt que de simples fautes.
Ce que l’OCR ne corrigera pas
L’OCR est de la reconnaissance, et la reconnaissance peut se tromper. Elle est très bonne sur un scan net, droit, à 300 DPI, de texte imprimé ordinaire. Elle se dégrade sur tout le reste, et elle ne vous dit pas quand elle devine.
- L’écriture manuscrite lui échappe presque totalement.
- Les scans basse résolution — en dessous d’environ 200 DPI — perdent le détail qui distingue des lettres semblables.
- Les pages inclinées, ombrées ou photographiées font bien pire que les scans à plat.
- Les tableaux et les mises en page multi-colonnes peuvent être lus dans le mauvais ordre, car l’ordre de lecture doit être déduit de la position.
- Les tampons, signatures et annotations manuscrites par-dessus du texte imprimé brouillent les formes de lettres en dessous.
Traitez donc un résultat d’OCR comme une copie cherchable, pas comme une transcription vérifiée. Pour tout ce où un chiffre erroné compte — un total de facture, une posologie, une référence juridique — relisez le texte reconnu en le comparant à l’image avant de vous y fier. OCR ou PDF en Word ? indique lequel des deux vous voulez vraiment.
Les outils traités dans cet article
Sources
Documentation primaire des affirmations ci-dessus.