Extraire le texte d’un PDF
Récupérez tout ce que dit un PDF sous forme de texte brut, prêt à rechercher, coller ou modifier.
Enregistrez vos outils favoris
Créez un compte iBuildPDF gratuit pour conserver vos outils favoris et les retrouver rapidement à tout moment.
Compte gratuit. Les outils PDF eux-mêmes n’en demandent jamais.
Sélectionner un fichier PDF
ou glissez-déposez vos fichiers ici
Formats acceptés : PDF
Traitement…
En bref
- Ce que fait l’outil
- Extrait la couche de texte d’un PDF et la renvoie sous forme de fichier texte brut.
- Entrée
- Sortie
- TXT
- Traitement
- Dans votre navigateur
- Fichiers envoyés ?
- Non
- Compte nécessaire ?
- Non
- Idéal pour
- Récupérer les mots d’un rapport pour les citer, les rechercher ou les coller ailleurs.
- Limite principale
- Il lit le texte déjà stocké dans le fichier. Un PDF numérisé qui n’est fait que d’images de pages n’a pas de couche de texte, et cet outil ne peut pas en créer une — cela demande un OCR.
Comment utiliser cet outil
- Importez votre PDF.
- Choisissez de conserver ou non les sauts de page et les repères de page.
- Prévisualisez le texte extrait.
- Téléchargez-le en fichier .txt, ou copiez-le.
Pourquoi choisir iBuildPDF
Copier le texte d’un PDF à la main produit des fins de ligne cassées, des espaces manquants et des paragraphes perdus. Lire correctement la couche de texte vous donne quelque chose d’exploitable.
Comment ça marche
La couche de texte de chaque page est lue directement, et la position des mots et des lignes sert à reconstituer les espacements et les retours à la ligne. Rien n’est retapé ni deviné — si le document possède une couche de texte, voici ce qu’elle contient.
Questions fréquentes
Rien n’est ressorti — pourquoi ?
Votre PDF est presque certainement un scan : l’image d’une page, sans aucune couche de texte. Il n’y a rien à extraire tant que la page n’est pas passée par une reconnaissance de texte. C’est le rôle de l’OCR, et c’est un autre outil.
La mise en page est-elle conservée ?
L’ordre de lecture, les paragraphes et les retours à la ligne sont conservés. Les colonnes, les tableaux et la mise en forme ne le sont pas — le texte brut n’a aucun moyen de les exprimer. Pour la mise en page, la conversion PDF en Word est la bonne solution.
Pourquoi l’extraction de texte de mon scan n’a-t-elle rien renvoyé ?
Parce qu’il n’y a aucun texte à en extraire. Une page scannée ou une photo enregistrée en PDF est une image, et l’extraction lit de vrais objets texte au lieu de reconnaître des lettres dans une image. Transformer l’image de mots en texte réel demande un OCR, qui est une technologie différente et que ce site ne propose pas actuellement. Votre fichier n’est pas défectueux — il n’a simplement pas de couche de texte.
Le texte extrait conserve-t-il la mise en page d’origine ?
Pas de façon fiable, et cela prend les gens au dépourvu. Un PDF positionne le texte par coordonnées au lieu d’enregistrer les paragraphes, colonnes ou tableaux comme des structures : l’extraction doit donc déduire l’ordre de lecture à partir des positions. Les mises en page sur deux colonnes peuvent s’entremêler, et les cellules d’un tableau se retrouver sur une même ligne. L’extraction est le bon outil pour récupérer les mots ; c’est le mauvais outil pour préserver l’aspect de la page.
Comment savoir si mon PDF contient du vrai texte ?
Ouvrez-le dans n’importe quel lecteur PDF et essayez de sélectionner quelques mots avec le curseur. Si les lettres se surlignent une à une et que vous pouvez les copier, le texte est réel et l’extraction fonctionnera. Si le glissement sélectionne toute la page comme un seul bloc, ou si rien ne se surligne, c’est une image et vous avez affaire à un scan — aucun outil d’extraction n’y trouvera de texte sans OCR préalable.
En savoir plus
Continuer avec votre PDF
Votre fichier est prêt. Voici ce que les gens font généralement ensuite.