Convertir et extraire

Enregistrer une page web en PDF

Pourquoi une page web enregistrée en PDF ressort-elle mal ?

Réponse courte

Parce qu’une page web n’a pas de pages. C’est une colonne continue unique qui s’adapte à la fenêtre, et en faire un PDF signifie la couper en feuillets fixes à des endroits que personne n’a choisis. Des titres atterrissent en bas de page, des tableaux se coupent en plein milieu, et tout ce qui est positionné par rapport à la fenêtre finit quelque part d’imprévu.

Deux formats aux hypothèses opposées

Une page HTML est écrite pour ne pas avoir de taille fixe. Elle se réajuste pour un téléphone ou un large moniteur, elle peut charger davantage de contenu à mesure qu’on défile, et sa mise en page est calculée au moment où on la regarde.

Un PDF est l’opposé en tout point : taille de page fixe, positions fixes, décidées une fois pour toutes. Voyez ce qu’est vraiment un PDF.

La conversion doit donc inventer l’information que la page web n’a jamais eue — quelle largeur donner à la page, et où chaque feuillet se termine. Les victimes habituelles :

  • Les en-têtes collants et les boutons flottants se répètent sur chaque page, ou se posent par-dessus le texte.
  • Les bandeaux de cookies et les fenêtres surgissantes de newsletter sont capturés avec tout le reste.
  • Tout ce qui se charge en défilant peut manquer, parce que cela n’a jamais été chargé.
  • Les tableaux larges sont coupés au bord droit plutôt que renvoyés à la ligne.
  • Les thèmes sombres s’impriment sombres, en consommant beaucoup d’encre.

Où tombent les coupures

Le convertisseur remplit un feuillet, coupe, et commence le suivant. Il n’a aucune idée que la ligne qu’il vient de couper était un titre.

123

Découper une page continue en feuillets

  1. Une page web : une colonne sans pages ni endroit naturel où s’arrêter.
  2. Où tombent les coupes — décidé par ce qui tient, pas par le sens du contenu.
  3. Le résultat. Une feuille de style d’impression empêche une coupe en plein titre ou tableau.

Les sites bien construits incluent une feuille de style d’impression — des instructions pour exactement cette situation, disant au navigateur de masquer la navigation, d’éviter de couper à l’intérieur d’une ligne de tableau, et de garder un titre avec le texte qui le suit. Quand une page se convertit magnifiquement, c’est pour cette raison. Quand elle se convertit mal, le site n’a tout simplement jamais pensé à l’impression, et rien dans la page ne guide la coupe.

HTML en PDF effectue la conversion et respecte une feuille de style d’impression là où elle existe.

Obtenir un résultat propre

  • Cherchez d’abord une vue impression ou lecture. Beaucoup d’articles en ont une, et c’est une page construite exactement pour cela — pas de navigation, pas de barre latérale, pas de bandeau.
  • Défilez jusqu’en bas avant de convertir, pour que tout ce qui se charge paresseusement ait été chargé.
  • Fermez les bandeaux avant de capturer, ou ils deviennent permanents.
  • Utilisez le format paysage pour les tableaux larges. C’est le seul réglage qui les sauve de façon fiable.
  • Rognez ensuite plutôt que de lutter contre la mise en page. Rogner un PDF retire une marge d’en-tête répétée sur chaque page en une seule passe, et Supprimer des pages retire la section des commentaires.
  • Combinez les pages liées en un seul document avec Fusionner des PDF — utile pour un ensemble de documentation enregistré page par page.

Si la page capturée est énorme à cause de photographies pleine largeur, Compresser un PDF en récupérera généralement la majeure partie.

Ce qui ne peut pas être capturé

Tout ce qui est derrière une connexion qu’un convertisseur ne peut pas atteindre. Un outil qui récupère une URL voit la page comme un visiteur anonyme, donc un tableau de bord personnel ou un article payant revient sous forme d’écran de connexion. Imprimer depuis votre propre navigateur, où vous êtes connecté, permet de contourner cela.

Tout ce qui est interactif. Cartes, graphiques qui réagissent au survol, vidéo, formulaires, et tout ce qui est piloté par un script deviennent une image fixe de leur état actuel — ou de leur état vide, s’ils n’avaient pas fini de se dessiner.

Les pages qui bloquent la récupération automatisée. Certains sites refusent les requêtes qui ne viennent pas d’un navigateur, et renverront une page d’erreur au lieu de leur contenu.

Et un point qui mérite d’être dit clairement : capturer une page produit une copie du travail de quelqu’un d’autre. Enregistrer un article pour le lire hors ligne est ordinairement sans problème ; le redistribuer est une autre affaire, et c’est une question de permission plutôt que de format de fichier.

Les outils traités dans cet article

Sources

Documentation primaire des affirmations ci-dessus.

Dernière révision : 24 septembre 2026

Publié par iBuildPDF.

Plus dans la base de connaissances

Parcourir la base de connaissances