Pourquoi une conversion de PDF échoue, et de quel échec il s’agit
Pourquoi ma conversion de PDF a-t-elle échoué ?
Enregistrez vos outils favoris
Créez un compte iBuildPDF gratuit pour conserver vos outils favoris et les retrouver rapidement à tout moment.
Compte gratuit. Les outils PDF eux-mêmes n’en demandent jamais.
Réponse courte
Presque toujours pour l’une de ces cinq raisons : le fichier est protégé par mot de passe, il n’a pas de couche de texte parce que c’est une numérisation, il est trop volumineux ou trop long pour que le traitement aboutisse, ce n’est pas vraiment le type de fichier qu’il prétend être, ou quelque chose a cassé chez nous. Chacune appelle une réponse complètement différente : l’une demande un mot de passe, l’autre de l’OCR, une autre de découper le fichier, et une autre encore ne demande rien de vous. Un outil qui se contente de dire que quelque chose a mal tourné vous laisse deviner laquelle.
Cinq échecs qui se ressemblent de l’extérieur
Du côté du visiteur, toute conversion ratée se ressemble : vous avez attendu, puis cela n’a pas marché. En dessous, ce ne sont pas du tout les mêmes événements.
- Chiffré. Le document a un mot de passe et l’outil ne peut pas l’ouvrir. Rien n’est cassé dans votre fichier.
- Pas de couche de texte. Les pages sont des images. Il n’y a rien à convertir en texte, donc le résultat serait vide.
- Trop volumineux ou trop long. Le travail ne peut réellement pas aboutir dans le temps imparti à une requête web.
- Pas le fichier que vous croyez. Une extension .pdf sur autre chose qu’un PDF, ou un PDF tronqué par un téléchargement interrompu.
- De notre côté. Le service de conversion redémarrait, était saturé, ou comporte un défaut.
Cela compte parce que seul le dernier nous revient, et que seuls les trois premiers vous laissent agir. Les distinguer, c’est tout le travail d’un bon message d’erreur, et c’est pourquoi nos outils indiquent une cause plutôt qu’un échec générique dès que la cause est réellement connue.
Le fichier est protégé par mot de passe
Un PDF peut porter deux mots de passe différents, et ils échouent différemment. Un mot de passe d’ouverture signifie que le contenu est chiffré et que rien ne peut lire une seule page sans lui : tous les convertisseurs échouent immédiatement, et à juste titre. Un mot de passe propriétaire laisse le fichier lisible mais le marque comme restreint, et certains outils refusent de le traiter par principe alors qu’ils le lisent parfaitement. Ce qu’un mot de passe PDF protège vraiment explique la différence comme il faut.
Si vous connaissez le mot de passe, retirez-le d’abord puis convertissez le résultat. Si vous ne le connaissez pas, aucun outil ne peut vous aider : c’est le chiffrement qui fonctionne comme prévu, et tout ce qui prétend le contraire sur un fichier moderne chiffré en AES devine des mots de passe ou ment.
Il n’y a pas de texte dans le fichier
C’est la surprise la plus fréquente, parce qu’une page numérisée ressemble à l’écran exactement à une page saisie. Une photo ou un scan d’un document contient une image de mots, pas des mots. Demandez-lui une sortie Word ou Excel et la réponse honnête est qu’il n’y a rien à extraire.
Vous pouvez le vérifier en deux secondes sans aucun outil : ouvrez le PDF et essayez de sélectionner une ligne de texte avec le curseur. Si vous obtenez un rectangle de sélection sur toute la page au lieu d’une ligne surlignée, c’est une image. Nombre de pages et informations du fichier vous dira aussi s’il existe une couche de texte.
La solution est l’OCR, qui lit l’image et écrit une couche de texte en dessous. Convertissez le fichier passé à l’OCR, pas l’original. Sachez que l’OCR est une très bonne supposition plutôt qu’une transcription : l’OCR et la conversion PDF vers Word ne font pas le même travail, et les chiffres qu’il confond sont ceux qui comptent le plus.
Il est trop volumineux, ou il y en a trop
Les conversions côté serveur s’exécutent dans une limite de temps, parce qu’une requête web qui ne se termine jamais est pire pour tout le monde qu’une requête qui s’arrête et le dit. Un document de six cents pages, un fichier plein de numérisations haute résolution ou une page comportant des dizaines de milliers d’objets vectoriels peuvent légitimement la dépasser.
Trois choses qui marchent généralement :
- Convertissez une plage plutôt que tout le fichier. La plupart des outils ici acceptent une sélection de pages, et la plupart des gens n’ont besoin que d’une partie du document.
- Découpez-le d’abord et convertissez les morceaux.
- Compressez-le d’abord si la taille vient des images. Compresser un PDF fait souvent passer un document numérisé d’impossible à ordinaire.
Ici, un dépassement de temps est signalé comme tel et non comme un échec générique, précisément pour que ce soit ce paragraphe que vous finissiez par lire.
Quand c’est nous
Certains échecs sont les nôtres, et l’utile est qu’ils ont une autre allure : ils touchent des fichiers qui fonctionnaient hier, ils touchent plusieurs outils en même temps, ou ils surviennent au premier essai et pas au second.
Si une conversion échoue et que le même fichier passe une minute plus tard, vous avez croisé un service en cours de redémarrage. Si elle échoue deux fois avec un fichier dont vous êtes sûr, cela vaut la peine de nous le signaler : dites quel outil, combien de pages environ, et quel genre de document. Merci de ne pas nous envoyer le fichier. Nous n’en voulons pas et n’en avons presque jamais besoin ; savoir ce qu’est le document cerne un défaut bien plus vite que le document lui-même.
Les outils qui tournent dans le navigateur échouent encore autrement. Ceux-là s’exécutent entièrement sur votre machine : un navigateur ancien, un très gros fichier face à une mémoire limitée ou un script bloqué les arrêtent, pendant que tous les outils serveur continuent de fonctionner.
Les outils traités dans cet article
Sources
Documentation primaire des affirmations ci-dessus.