OCR et extraction de texte PDF

Rendez un document scanné consultable, ou récupérez-en le texte.

Extraire le texte d’un PDFRécupérer les mots en texte brutRendre un PDF scanné consultableReconnaître le texte d’un scan

De quel outil avez-vous besoin ?

Comment savoir lequel des deux vous avez

Ouvrez le fichier et essayez de sélectionner une ligne de texte à la souris. Si une sélection bleue nette suit les mots, il y a une couche de texte et l’extraction fonctionnera. Si rien ne se passe, ou si vous sélectionnez un rectangle couvrant toute la page comme s’il s’agissait d’une seule image, c’est un scan.

L’apparence ne vous apprend rien : le scan d’une page sortie d’une imprimante laser peut paraître plus net à l’écran qu’un véritable document numérique. Seul le test de sélection est fiable, et il prend deux secondes.

Un document peut aussi être en partie les deux — un rapport nativement numérique auquel une annexe scannée a été accrochée à la fin est extrêmement courant : l’extraction marche parfaitement sur quarante pages, puis ne renvoie plus rien.

L’erreur que les gens commettent

Faire confiance au résultat de l’OCR sans le relire. L’OCR est une très bonne hypothèse, et cela reste une hypothèse. Les caractères qu’elle confond le plus sont ceux qui comptent le plus : 0 et O, 1 et l et I, 5 et S, 8 et B. Un chiffre mal lu dans un numéro de référence ou dans un montant n’a l’air faux nulle part — la phrase se lit encore normalement — il survit donc à une relecture qui attraperait un mot mal orthographié. Vérifiez les chiffres un par un contre l’original.

À lire avant de commencer

Les trois choses que l’on regrette le plus souvent de ne pas avoir sues avant ce genre de travail.

Tous les articles de la base de connaissances

Catégories liées