OCR et extraction de texte PDF
Rendez un document scanné consultable, ou récupérez-en le texte.
De quel outil avez-vous besoin ?
- Un PDF qui a déjà une couche de texte, et dont vous voulez récupérer les mots. Extraire le texte les lit directement, dans votre navigateur, sans rien deviner.
- Un scan ou la photographie d’une page. Il n’y a aucun texte dedans à extraire. Il faut d’abord l’OCR, qui lit les pixels et détermine quels caractères ils forment — ensuite le résultat peut être extrait, recherché et copié.
Comment savoir lequel des deux vous avez
Ouvrez le fichier et essayez de sélectionner une ligne de texte à la souris. Si une sélection bleue nette suit les mots, il y a une couche de texte et l’extraction fonctionnera. Si rien ne se passe, ou si vous sélectionnez un rectangle couvrant toute la page comme s’il s’agissait d’une seule image, c’est un scan.
L’apparence ne vous apprend rien : le scan d’une page sortie d’une imprimante laser peut paraître plus net à l’écran qu’un véritable document numérique. Seul le test de sélection est fiable, et il prend deux secondes.
Un document peut aussi être en partie les deux — un rapport nativement numérique auquel une annexe scannée a été accrochée à la fin est extrêmement courant : l’extraction marche parfaitement sur quarante pages, puis ne renvoie plus rien.
L’erreur que les gens commettent
Faire confiance au résultat de l’OCR sans le relire. L’OCR est une très bonne hypothèse, et cela reste une hypothèse. Les caractères qu’elle confond le plus sont ceux qui comptent le plus : 0 et O, 1 et l et I, 5 et S, 8 et B. Un chiffre mal lu dans un numéro de référence ou dans un montant n’a l’air faux nulle part — la phrase se lit encore normalement — il survit donc à une relecture qui attraperait un mot mal orthographié. Vérifiez les chiffres un par un contre l’original.
À lire avant de commencer
Les trois choses que l’on regrette le plus souvent de ne pas avoir sues avant ce genre de travail.