PDF en Excel

Récupérez les tableaux d’un PDF dans Excel.

Sélectionner un fichier PDF

ou glissez-déposez vos fichiers ici

Formats acceptés : PDF

Traitement serveur sécurisé — suppression automatiqueCet outil nécessite un traitement côté serveur. Votre fichier est transmis via une connexion chiffrée au serveur de traitement d’iBuildPDF, conservé uniquement le temps de la conversion, puis supprimé automatiquement.

En bref

Ce que fait l’outil
Repère les tableaux à l’intérieur d’un PDF et les écrit dans une feuille de calcul sous forme de vraies cellules, une feuille par document.
Entrée
PDF
Sortie
XLSX
Traitement
Sur notre serveur
Fichiers envoyés ?
Oui, temporairement
Compte nécessaire ?
Non
Idéal pour
Récupérer les chiffres d’un relevé, d’une facture ou d’un rapport pour les additionner au lieu de les recopier à la main.
Limite principale
Il extrait des tableaux, pas des pages. Un PDF fait de texte courant ne produit rien, parce qu’il n’y a rien qui ait la forme d’un tableau — c’est une réponse correcte, pas un échec. Les tableaux dessinés sans filets sont le cas le plus difficile et peuvent revenir avec des colonnes fusionnées.

Comment utiliser cet outil

  1. Choisissez un PDF qui contient un tableau.
  2. Cliquez sur « Appliquer » pour l’envoyer en extraction via une connexion chiffrée.
  3. Attendez pendant que les pages sont examinées à la recherche d’une structure de tableau.
  4. Téléchargez le .xlsx et vérifiez que les colonnes sont tombées là où vous les attendiez.

Pourquoi choisir iBuildPDF

C’est la conversion la moins prévisible du site, et il vaut la peine de savoir pourquoi avant d’essayer. Les PDF ne contiennent pas de tableaux. Ils contiennent du texte positionné sur une page, et un tableau est quelque chose que l’œil humain déduit de ce positionnement. L’extracteur doit faire la même déduction, et sa réussite dépend entièrement de la façon dont le PDF a été fabriqué — un tableau exporté depuis un tableur s’extrait presque parfaitement, tandis qu’un tableau dessiné à la main avec des tabulations peut n’être pas reconnu du tout.

Comment ça marche

Chaque page est examinée à la recherche de texte disposé en lignes et en colonnes alignées. Là où cette structure est trouvée, elle est écrite dans le classeur sous forme de cellules ; là où elle ne l’est pas, rien n’est écrit. Le fichier est traité sur notre serveur via une connexion chiffrée, puis supprimé.

Questions fréquentes

J’ai obtenu un fichier vide, ou une erreur indiquant qu’il n’y avait rien à extraire.

Cela signifie qu’aucun tableau n’a été reconnu. Il y a généralement deux causes : soit le PDF est un scan, et il n’y a donc aucun texte à aligner en colonnes — passez-le d’abord à l’OCR ; soit le contenu relève du texte courant et non d’un tableau, auquel cas c’est Extraire le texte d’un PDF qu’il vous faut.

Les colonnes sont fusionnées ou coupées au mauvais endroit.

Cela arrive avec les tableaux dépourvus de filets et à l’espacement irrégulier, où la frontière entre deux colonnes est réellement ambiguë. Toutes les données sont là — il est plus rapide de scinder la colonne dans Excel que de ressaisir la page.

Gère-t-il un tableau qui s’étend sur plusieurs pages ?

Chaque page est extraite à son tour : un long tableau arrive donc sous forme de blocs consécutifs plutôt que d’une plage continue. Supprimer ensuite les lignes d’en-tête répétées est généralement le seul nettoyage nécessaire.

Peut-il extraire d’un relevé bancaire numérisé ?

Pas en l’état — un scan n’a pas de couche de texte. Passez-le d’abord à l’OCR, puis extrayez. La précision après OCR dépend de la propreté du scan : vérifiez donc les chiffres par rapport à l’original.

En savoir plus