Convertir et extraire

OCR ou conversion d’un PDF en Word

Quelle est la différence entre l’OCR et la conversion d’un PDF en Word ?

Réponse courte

L’OCR examine les pixels d’une page scannée et devine quels caractères ils représentent. Convertir un PDF en Word part d’un texte déjà stocké dans le fichier et le reconstruit sous forme de document modifiable. Si votre PDF est un scan, il n’y a aucun texte à convertir : seul l’OCR peut aider — et iBuildPDF ne propose pas d’outil d’OCR.

Deux sortes de PDF d’apparence identique

Presque toutes les confusions autour de l’OCR viennent d’un seul fait : un PDF peut enregistrer une page de deux façons complètement différentes, et à l’écran les deux se ressemblent.

1T e x t54 65 78 74234

La même page, avec et sans texte

  1. Un PDF numérique. À l’écran, indiscernable de celui de droite.
  2. En dessous : des codes de caractères, chacun avec une police et une position. Cherchable, sélectionnable, convertible.
  3. Un PDF scanné. La même page, et la même apparence.
  4. En dessous : une grille d’échantillons clairs et sombres. Pas de lettres, pas de mots, rien à chercher.

La première possède une couche de texte. Le fichier contient de vrais objets texte — une chaîne de caractères, une police, une taille et des coordonnées indiquant où chaque élément est dessiné sur la page. La page est un jeu d’instructions pour peindre des lettres. Un programme peut relire ces caractères à l’identique, car ils n’ont jamais été autre chose que des caractères.

La seconde est faite d’images de page. C’est ce que produisent un scanner, l’appareil photo d’un téléphone ou un télécopieur : chaque page est une photographie unique, enveloppée dans un PDF. Il n’y a de texte nulle part dans le fichier. Ce qui ressemble à la lettre « e » est un motif de pixels sombres qu’un œil humain reconnaît comme un « e » ; pour le logiciel, ce n’est pas différent d’une photo de chat.

Le test de deux secondes

Essayez de sélectionner un mot en faisant glisser le curseur dessus dans n’importe quelle visionneuse. Si des mots se surlignent un à un, le fichier a une couche de texte. Si le curseur dessine plutôt un rectangle — une zone de sélection, pas une sélection de texte — il n’y a pas de couche de texte et vous avez affaire à une image.

Deux outils d’ici le confirment sans tâtonner. Nombre de pages indique si le document possède une couche de texte. PDF en texte ne renvoie rien d’utile pour un scan — le plus souvent un résultat vide, parfois une ligne isolée ajoutée par le logiciel de numérisation. Ce résultat vide n’est pas une anomalie : c’est la bonne réponse à la question « quel texte ce fichier contient-il ? »

Les documents peuvent être mixtes. Un contrat rédigé dans un traitement de texte, puis signé et scanné, peut comporter une couche de texte sur la plupart des pages et aucune sur la page scannée. Vérifiez la page qui vous intéresse.

Ce que fait l’OCR

OCR signifie reconnaissance optique de caractères. Le procédé prend une image, repère les zones qui ressemblent à du texte, les découpe en lignes puis en formes de glyphes isolées, et compare chaque forme à un modèle de l’apparence des caractères. Pour chaque caractère, il produit une hypothèse la plus probable et un indice de confiance — le degré de certitude.

Le mot hypothèse est celui qui compte. L’OCR ne récupère pas le texte d’origine, puisque ce texte n’est pas dans le fichier. Il produit un nouveau texte dont il estime qu’il correspond à l’image — en général très bon, parfois faux, et rien dans le résultat ne vous dit lequel est lequel, à moins d’examiner les indices de confiance.

La précision dépend de facteurs que vous pouvez pour l’essentiel constater vous-même :

  • La qualité du scan. Résolution, contraste, inclinaison, ombres d’un appareil photo de téléphone, grain d’un scanner bon marché, et texte photocopié quelques fois de trop.
  • La langue et la typographie. Il faut indiquer au moteur la langue attendue ; un mauvais modèle produit des absurdités pleines d’assurance. Les polices inhabituelles et l’écriture manuscrite sont bien plus difficiles que de la prose imprimée ordinaire.
  • La mise en page. C’est là que l’OCR se trompe le plus souvent. L’ordre de lecture doit être déduit des positions : une page sur deux colonnes peut donc revenir avec les colonnes entremêlées ligne par ligne. Les tableaux sont pires : les limites des cellules peuvent être des filets ou seulement des blancs, et un tableau arrive souvent sous forme d’un flot de chiffres, lignes et colonnes envolées.

Le moteur open source de référence est Tesseract, celui qu’utilisent en interne la plupart des outils d’OCR gratuits ou auto-hébergés. Quel que soit le moteur employé, traitez le résultat comme un brouillon : relisez-le, et regardez surtout les chiffres et les paires de caractères qui se ressemblent à l’impression.

Ce que fait une conversion PDF en Word

Un convertisseur PDF en Word fait quelque chose de très différent. Il lit les objets texte déjà présents dans le fichier, avec leurs polices et leurs coordonnées, et reconstruit à partir d’eux un document modifiable.

Les caractères sont connus exactement — ils ont été enregistrés comme caractères. Ce qu’il faut déterminer, c’est la structure, car une page PDF dit « dessine cette chaîne à cette position », pas « ceci est un paragraphe » ni « ceci est la deuxième cellule de la ligne quatre ». Un convertisseur déduit donc :

  • les paragraphes, à partir des lignes qui partagent une police et présentent un interligne et un retrait constants ;
  • les titres et les mises en valeur, à partir des polices plus grandes ou plus grasses ;
  • les listes, à partir de puces ou de numéros répétés en retrait négatif ;
  • les tableaux, à partir des filets ou d’un texte qui s’aligne en colonnes sur la hauteur de la page.

Cette déduction est elle aussi une hypothèse, mais d’une autre nature que celle de l’OCR. Un convertisseur peut se tromper sur l’endroit où finit un paragraphe ; il ne se trompe pas sur les lettres qui le composent.

Lancez un convertisseur sur un scan et il échoue pour une raison simple : il n’y a rien à convertir. Il ne lit pas de pixels, il ne trouve donc aucun texte et produit soit un document vide, soit un fichier Word contenant une image pleine page par page — pas plus modifiable que ne l’était le PDF.

Lequel vous faut-il

Le cheminement est court :

  1. Essayez de sélectionner un mot dans le PDF.
  2. Si des mots se surlignent, il vous faut une conversion. Le texte est là ; vous le voulez dans un format modifiable.
  3. Si vous obtenez une zone de sélection, il vous faut d’abord un OCR. La conversion n’a rien sur quoi travailler tant que l’OCR n’a pas créé de couche de texte.
  4. Si vous ne voulez que les mots — pour les citer, les rechercher ou les coller — PDF en texte suffit ; vous n’avez pas du tout besoin d’un fichier Word.
OCRConversion PDF en Word
EntréeUn scan ou une photographie : des pages sans couche de texteUn PDF qui possède déjà une couche de texte
Ce qu’il litDes pixelsDes objets texte et leurs coordonnées
SortieDu texte reconnu, chaque caractère assorti d’un indice de confianceUn document modifiable, avec paragraphes, styles et tableaux déduits
Principal mode d’échecCaractères mal lus, et ordre de lecture perdu dans les tableaux et les pages multicolonnesStructure erronée — paragraphes fusionnés, tableaux cassés ; et échec total sur un scan, faute de texte à lire

Si vous ne savez pas comment un fichier a été produit, ses propres métadonnées le disent souvent. Le champ producteur nomme fréquemment le scanner ou l’application qui a écrit le PDF — voyez ce que contiennent les métadonnées d’un PDF.

Ce qu’iBuildPDF peut et ne peut pas faire ici

Disons-le clairement : iBuildPDF ne peut faire pour vous ni l’une ni l’autre moitié de ce travail.

Il n’y a pas d’outil d’OCR sur ce site. Aucun de nos outils ne reconnaît de caractères dans une image. PDF en texte extrait une couche de texte qui existe déjà ; il ne peut pas en créer une. Sur un PDF scanné, il ne renvoie rien, et aucun réglage n’y change quoi que ce soit.

Le convertisseur PDF en Word n’est pas disponible. Il est annoncé comme à venir et il est désactivé, tout comme les entrées PDF en Excel et PDF en PowerPoint. N’organisez pas votre travail autour d’eux.

Que faire à la place, dans l’ordre à essayer :

  • Demandez l’original à l’expéditeur. Si quelqu’un a scanné un document qu’il a lui-même rédigé, le fichier source existe toujours, et il sera plus exact que tout ce qu’un OCR ou une conversion pourra reconstruire.
  • Utilisez un outil d’OCR dédié. Tesseract est gratuit et largement distribué ; les produits commerciaux gèrent généralement mieux les tableaux et les scans médiocres. Choisissez-en un qui vous laisse définir la langue.
  • Améliorez d’abord le scan. Renumériser à un DPI plus élevé, à plat et bien droit, avec un bon contraste, fait plus pour la précision que n’importe quel traitement a posteriori.
  • Vérifiez avec le nombre de pages avant de commencer, pour savoir quel problème vous avez réellement.

Les outils traités dans cet article

Sources

Documentation primaire des affirmations ci-dessus.

Dernière révision : 16 septembre 2026

Publié par iBuildPDF.

Plus dans la base de connaissances

Parcourir la base de connaissances