Pourquoi un tableau extrait d’un PDF ressort mal dans Excel
Pourquoi mon tableau ressort en désordre quand je convertis un PDF en Excel ?
Enregistrez vos outils favoris
Créez un compte iBuildPDF gratuit pour conserver vos outils favoris et les retrouver rapidement à tout moment.
Compte gratuit. Les outils PDF eux-mêmes n’en demandent jamais.
Réponse courte
Parce que le tableau n’a jamais été dans le fichier. Un PDF enregistre chaque morceau de texte à une position sur la page, et les filets comme des instructions de dessin distinctes, rattachées à rien. Aucune ligne, aucune colonne, aucune cellule n’est stockée. Un convertisseur doit déduire où étaient les colonnes à partir de l’alignement des valeurs : un en-tête fusionné, une valeur renvoyée sur deux lignes, ou un tableau sans filets peuvent chacun déplacer les frontières et faire glisser les données dans les mauvaises cellules. Rien n’est corrompu quand cela arrive ; l’information dont le convertisseur avait besoin n’a pas été enregistrée au départ.
Il n’y a pas de tableau dans le fichier
C’est la partie qu’il vaut la peine d’admettre avant toute autre, parce que toutes les autres surprises en découlent.
La même page, telle qu’un lecteur la voit et telle que le fichier la contient
- Ce que vous voyez : des lignes, des colonnes et des cellules, avec des filets qui rendent la structure évidente.
- Ce que le fichier enregistre : chaque valeur comme son propre morceau de texte, à sa propre position sur la page. Rien ne relie entre elles les trois valeurs d’une ligne.
- Les filets sont des instructions de dessin, comme n’importe quelle autre marque sur la page. Ils ne sont pas rattachés au texte, et un tableau dessiné sans eux est stocké de façon identique.
Quand un traitement de texte ou un tableur exporte un PDF, il dessine le tableau. Il écrit INV-1001 à une position, 2026-01-04 à une autre, 1,240.00 à une troisième, puis trace quelques filets. Les filets sont des instructions de dessin comme les autres — la même machinerie qui a dessiné un logo ou un soulignement. Rien dans le fichier ne dit que ces trois valeurs appartiennent à une même ligne, ni que le trait entre deux d’entre elles est une frontière de colonne plutôt qu’un filet décoratif.
C’est facile à vérifier. Prenez une page portant deux tableaux, l’un avec des filets et l’autre sans, et demandez à n’importe quel extracteur de texte ce qu’il y a sur la page. Les deux reviennent sous la même forme : une liste de valeurs, l’une après l’autre, à peu près dans l’ordre où elles ont été dessinées. Le tableau avec filets et celui sans filets sont indiscernables dans la sortie, parce que les filets n’ont jamais fait partie des données.
Un PDF peut porter une véritable structure : le PDF balisé enregistre quelles marques forment un tableau, une ligne et une cellule, principalement pour les lecteurs d’écran. C’est facultatif, la plupart des exports n’en produisent pas, et la plupart de ceux qui en produisent le font imparfaitement. Ce qui rend un PDF accessible explique ce qu’est le balisage et pourquoi il en existe si peu dans la nature.
Donc quand un convertisseur vous remet une feuille de calcul, il n’a pas lu un tableau dans le document. Il a regardé où le texte était tombé et a formulé une hypothèse.
Ce que le convertisseur devine réellement
Deux choses, et la seconde est bien plus difficile que la première.
D’où viennent les frontières de colonnes, et ce qui les déplace
- Les frontières sont déduites, pas lues : une bande de blanc qui court sur toute la hauteur du tableau est prise pour le bord d’une colonne.
- Une valeur assez longue pour traverser cette bande la comble, et la frontière qui en dépendait se déplace ou disparaît.
- Du texte renvoyé à la ligne dans sa cellule occupe une nouvelle ligne de base : il est donc lu comme une nouvelle ligne, toutes les autres cellules vides.
Les lignes sont généralement faciles : le texte posé à peu près sur la même ligne de base forme une ligne du tableau. Cela marche la plupart du temps, et c’est pourquoi un tableau simple se convertit généralement bien.
Les colonnes doivent être déduites des écarts verticaux — les couloirs de blanc qui descendent la page là où aucun texte n’apparaît jamais. Trouvez une bande de blanc dégagée du haut au bas du tableau, et c’est une frontière de colonne. C’est une bonne heuristique. Voici ce qui la met en échec :
- Une valeur assez longue pour combler le couloir. Une description longue, ou un grand nombre avec ses séparateurs, peut traverser la bande qui définissait la frontière, et toutes les lignes en dessous risquent d’être lues avec une colonne de moins.
- Du texte renvoyé à la ligne dans une cellule. La deuxième ligne a sa propre ligne de base, elle est donc lue comme une ligne de tableau à part — et les cellules à côté d’elle sont vides, et c’est ainsi qu’un tableau de 40 lignes arrive avec 60 lignes dedans.
- Les en-têtes fusionnés ou à cheval sur plusieurs colonnes. Un titre centré sur trois colonnes ne s’aligne avec aucune d’elles, et peut désaligner la ligne d’en-tête de tout ce qui se trouve en dessous.
- Des nombres alignés à droite à côté de texte aligné à gauche. Le couloir n’est pas droit, ses bords sont donc flous et la frontière tombe à un endroit différent selon les lignes examinées.
- Un tableau qui continue sur la page suivante. Chaque page est reconstruite sur ses seuls indices : un en-tête répété devient donc une ligne de données au milieu, et les frontières de colonnes trouvées en page deux n’ont aucune raison de correspondre à celles de la page un.
Rien de tout cela n’est un défaut d’un convertisseur particulier. C’est un problème de reconstruction, et les reconstructions sont parfois fausses.
Ce que fait l’outil PDF en Excel de ce site
PDF en Excel est un extracteur de tableaux. Ce n’est pas un détail de fabrication, c’est ce que l’outil est, et le savoir évite beaucoup de confusion :
- Il cherche une structure de tableau et écrit ce qu’il trouve dans un classeur. Il n’essaie pas de reproduire la page.
- Le texte courant n’est pas un tableau, donc le texte courant ne sort pas. Une page de paragraphes ne produit rien, et c’est la réponse correcte plutôt qu’un échec.
- Il s’exécute sur le serveur de traitement de ce site, pas dans votre navigateur — c’est l’un des travaux qu’un navigateur ne peut réellement pas faire. Le fichier est envoyé, converti, puis supprimé après le traitement ; la note sur la page de l’outil indique ce qui lui arrive.
Deux outils voisins sont souvent le meilleur choix :
- PDF en Word essaie de reconstruire la page — mise en page, titres, et tableaux sous forme de tableaux Word. Si c’est le document que vous voulez plutôt que les chiffres, commencez là. Convertir un PDF en Word sans perdre la mise en forme explique ce qui survit.
- Extraire le texte s’exécute dans votre navigateur et vous donne le texte brut, sans aucune reconstruction. Pour un petit tableau, le coller dans un tableur et le découper vous-même est souvent plus rapide que de discuter avec un convertisseur, et vous voyez exactement avec quoi vous travaillez.
Quand il indique qu’il n’y avait rien à extraire
Ce message signifie que le convertisseur a tourné, a lu les pages et n’a trouvé aucune structure de tableau. C’est une vraie réponse, et il y a trois raisons habituelles.
La page est une image. Un scan, une photographie, ou une copie d’écran collée dans un document ne contient aucun texte — seulement des pixels qui ressemblent à du texte. Il n’y a rien qu’un extracteur puisse positionner, donc rien à trouver. Passez d’abord l’OCR pour ajouter une couche de texte, puis convertissez. Ce PDF est-il scanné ou est-ce du texte ? montre comment le voir en quelques secondes, et OCR ou conversion d’un PDF en Word explique lequel il vous faut.
Ce que vous regardez n’est pas un tableau. Une liste avec des nombres alignés, un formulaire, ou une mise en page sur deux colonnes peut ressembler à un tableau pour un lecteur et ne présenter aucune structure de tableau à un extracteur. Extraire le texte est le bon outil dans ces cas.
Le tableau est disposé de façon lâche. Un espacement large et irrégulier, sans couloirs de blanc réguliers, ne donne rien à quoi l’heuristique puisse s’accrocher. Convertir cette page seule fonctionne parfois là où convertir tout le document a échoué, parce que les indices ne sont plus moyennés sur des pages qui se contredisent.
Obtenir un meilleur résultat
- Revenez à la source si elle existe. Si le PDF vient d’un tableur, ce tableur contient encore les vraies lignes et les vraies colonnes. Toute conversion est une reconstruction ; l’original, non.
- Convertissez les pages qui portent le tableau, pas le document entier. Utilisez d’abord extraire des pages. Moins de pages signifie moins d’indices contradictoires, et vous découvrez vite si le problème tient à une seule page difficile.
- Vérifiez le résultat contre le PDF avant de l’utiliser. Comparez le nombre de lignes et additionnez une colonne. Les erreurs silencieuses — une colonne décalée, une ligne fondue dans celle du dessus — sont celles qui font des dégâts, parce que rien n’a l’air cassé.
- Si la mise en page est désespérée, extrayez plutôt le texte. Extraire le texte plus la fonction « Convertir du texte en colonnes » d’Excel vous donne la main sur le découpage, et pour un tableau de quelques dizaines de lignes c’est généralement plus rapide.
- Les pages scannées demandent l’OCR, et l’OCR d’un tableau est doublement une supposition — d’abord quel est chaque caractère, puis où étaient les colonnes. Vérifiez les chiffres un par un ; un 6 lu comme un 8 n’a l’air faux nulle part.
- Vérifiez d’abord le nombre de pages. Nombre de pages et informations sur le fichier indique aussi si le document a une couche de texte, ce qui répond à la question du scan avant toute conversion.
Les outils traités dans cet article
Sources
Documentation primaire des affirmations ci-dessus.