Confidentialité et sécurité

Ce que contiennent les métadonnées d’un PDF

Quelles informations personnelles se cachent dans un PDF, et comment les supprimer ?

Réponse courte

Un PDF transporte un ensemble de champs cachés — le plus souvent un nom d’auteur repris du compte de votre système d’exploitation, le nom et la version du logiciel qui a produit le fichier, ainsi que les dates de création et de modification — que vous n’avez pas saisis et qui n’apparaissent pas sur la page. Ils sont lisibles par quiconque ouvre le fichier et peuvent être supprimés avec un outil de nettoyage des métadonnées comme /remove-pdf-metadata.

La version courte

Ouvrez n’importe quel PDF que vous avez envoyé à quelqu’un et regardez ses propriétés. Vous y trouverez généralement un nom dans le champ Auteur. Vous ne l’avez pas saisi. Il provient du nom de compte de l’ordinateur qui a produit le fichier — ce qui, sur un portable professionnel, correspond souvent à votre nom complet d’état civil ou à un identifiant interne, et sur une machine personnelle à la façon dont vous vous êtes désigné lors de sa configuration.

Ce champ est l’un parmi plusieurs. Un PDF est un format de document structuré, et la spécification (ISO 32000-1, la forme normalisée du PDF 1.7 d’Adobe) réserve des emplacements dédiés aux informations sur le document, qui ne font pas partie de ce qui est dessiné sur la page. Traitements de texte, scanners, pilotes d’impression et boîtes de dialogue d’export remplissent tous ces emplacements, généralement sans vous le dire.

Rien de tout cela n’est une faille ; c’est le format qui fonctionne comme prévu. Cela compte parce que cette conception suppose que vous le sachiez, et que la plupart des gens qui envoient un CV ou une réclamation anonyme l’ignorent.

Ce qui s’y trouve réellement

Un PDF moderne comporte deux systèmes de métadonnées distincts, et un fichier peut porter les deux, souvent avec des valeurs différentes.

123

La partie d’un PDF que personne ne lit

  1. Ce qui est sur la page. C’est la partie que vous avez vérifiée avant l’envoi.
  2. Le registre qui y est attaché : auteur, logiciel, dates, parfois un chemin de fichier ou un nom d’entreprise.
  3. Rien de tout cela n’apparaît à l’impression ou à la lecture, ce qui explique qu’il voyage inaperçu.

Le dictionnaire d’informations du document

C’est le mécanisme le plus ancien, défini par la norme ISO 32000-1. Il s’agit d’un petit ensemble de champs nommés attachés au document :

ChampCe qu’il contient généralement
TitleSouvent le nom de fichier d’origine, y compris un nom de brouillon ou un code de projet interne
AuthorPresque toujours le nom du compte système de la personne qui a créé le fichier
SubjectGénéralement vide, parfois une description saisie des années plus tôt dans un modèle
KeywordsGénéralement vide ; quand il est rempli, il révèle fréquemment une catégorisation interne
CreatorL’application dans laquelle le contenu a été rédigé — Word, InDesign, LaTeX, le pilote d’un scanner
ProducerLa bibliothèque qui a écrit le PDF lui-même, normalement avec son numéro de version exact
CreationDateDate et heure de création, y compris le décalage horaire
ModDateDate et heure de la dernière modification

Deux d’entre eux méritent une attention particulière. Author est le champ qui identifie une personne, et il est rempli automatiquement. Producer identifie un logiciel jusqu’à sa version, ce qui indique au lecteur ce que vous utilisez et, par extension, ce que déploie votre organisation.

Les dates sont également instructives. Un décalage horaire vous situe géographiquement, et un ModDate postérieur à la date où un document était censé être finalisé est le genre de détail qu’on remarque en cas de litige.

Les métadonnées XMP

Le mécanisme le plus récent est le XMP — l’Extensible Metadata Platform, normalisée sous la référence ISO 16684-1. C’est un bloc XML intégré au fichier, et il contient plus que les huit champs ci-dessus : mentions de droits, historique d’édition, enregistrements propres à un logiciel, et un identifiant de document qui persiste d’un enregistrement à l’autre et peut rattacher des fichiers distincts à un ancêtre commun.

Comme le XMP est séparé du dictionnaire d’informations, les deux peuvent se contredire. Modifier l’un ne met pas nécessairement l’autre à jour : c’est ainsi qu’un fichier finit par afficher un champ Auteur nettoyé dans son panneau de propriétés, tandis que le nom d’origine se trouve dans le bloc XMP, quelques milliers d’octets plus loin.

Les métadonnées à l’intérieur des images intégrées

Un PDF contenant des photographies les intègre comme objets à l’intérieur du fichier. Si une image portait des données EXIF au moment de son insertion — modèle d’appareil, date de prise de vue, et très souvent, pour les photos de téléphone, des coordonnées GPS — ces données peuvent voyager avec elle jusque dans le PDF. C’est une troisième couche indépendante, que rien de ce qui modifie les métadonnées du document lui-même ne vient toucher.

Comment voir ce que transporte votre fichier

Le plus rapide est l’éditeur de métadonnées PDF. Déposez-y un fichier : il analyse le document et affiche les champs du dictionnaire d’informations avec leurs valeurs actuelles. Le fichier est lu dans votre navigateur et n’est pas envoyé en ligne : vous pouvez donc inspecter un document confidentiel sans le confier à qui que ce soit.

Vérifiez le fichier que vous êtes sur le point d’envoyer, pas celui dont vous êtes parti : chaque étape d’export réécrit Producer, et certaines en réécrivent davantage.

L’outil de comptage des pages est un bon complément pour un rapide coup d’œil structurel — il ouvre le document et indique combien de pages il contient, ce qui confirme aussi que le fichier s’analyse proprement comme un PDF. Un fichier incapable d’indiquer son nombre de pages est endommagé, et il faut alors commencer par le réparer.

En dehors du navigateur, pdfinfo (issu de Poppler) et exiftool extraient tous deux les métadonnées, et exiftool signale en outre les EXIF trouvés dans les images intégrées. Un PDF est en partie du texte brut : ouvrir un fichier dans un éditeur de texte et y chercher /Producer ou <x:xmpmeta fait souvent apparaître les champs directement.

Les supprimer

Utilisez supprimer les métadonnées d’un PDF. L’outil lit le document avec pdf-lib, efface les champs d’information du document — Titre, Auteur, Sujet, Mots-clés, Créateur, Producteur, ainsi que les dates de création et de modification — et écrit un nouveau PDF. Le contenu des pages n’est pas réécrit : le document que vous récupérez s’affiche et se lit exactement comme celui que vous avez fourni.

Si vous préférez remplacer les valeurs plutôt que les vider, l’éditeur de métadonnées vous permet de définir chaque champ explicitement. Cela a une réelle utilité : un nom d’organisation dans le champ Auteur se remarque moins qu’un champ vide, lequel constitue à lui seul un signal au milieu d’un lot de documents par ailleurs ordinaires.

Les deux outils s’exécutent entièrement dans votre navigateur. Rien n’est envoyé en ligne, ce qui compte plus que d’habitude ici — tout l’enjeu est que le fichier contient quelque chose que vous ne voulez pas partager : l’envoyer au serveur d’un inconnu pour l’en débarrasser serait un curieux marché. Voyez comment fonctionnent les outils PDF dans le navigateur pour les détails techniques.

Une remarque pratique : faites-le en dernière étape avant l’envoi. Tout ce qui réécrit le fichier ensuite — un nouvel export, une impression au format PDF, une ouverture puis un enregistrement dans une autre application — y réinscrira un Producer tout neuf et de nouvelles dates.

Ce que le nettoyage des métadonnées ne fait pas

C’est la partie qui met les gens en difficulté, parce que vider le panneau des propriétés donne un sentiment de conclusion qu’il ne mérite pas.

  • Cela ne touche pas à la page visible. Un nom dans un en-tête, un pied de page indiquant Brouillon — J. Okonkwo, un en-tête portant le nom d’un client : ce sont des contenus de page, pas des métadonnées. Ils sont toujours là, et c’est la première chose que voit un lecteur.
  • Cela ne supprime pas les EXIF contenus dans les images intégrées. Les métadonnées du document et celles d’une photographie intégrée sont des structures différentes. Effacer les premières laisse les secondes intactes, coordonnées GPS comprises. Si un PDF contient des photos de téléphone et que la localisation compte, retirez les EXIF des images avant de construire le PDF.
  • Cela ne supprime pas le texte masqué sous une forme dessinée. Un rectangle noir posé sur un paragraphe n’efface pas ce paragraphe — les objets texte sont toujours dans le flux de contenu et ressortent tels quels au copier-coller. C’est une défaillance distincte et bien plus grave, traitée dans comment caviarder un PDF définitivement, et aucun outil de métadonnées ne la résout.
  • Cela n’atteint pas les copies déjà envoyées. La suppression des métadonnées produit un nouveau fichier propre. Toutes les copies diffusées auparavant transportent encore tout, dans chaque boîte de réception et chaque sauvegarde qu’elles ont atteintes. Le nettoyage se fait avant qu’un fichier ne parte, pas après.

Considérez les métadonnées comme quatre couches distinctes : le dictionnaire d’informations, le XMP, les EXIF des images intégrées et le contenu visible de la page. Chacune demande sa propre vérification. Nettoyer l’une en supposant que les autres ont suivi est l’erreur à éviter.

Les outils traités dans cet article

Sources

Documentation primaire des affirmations ci-dessus.

Dernière révision : 16 septembre 2026

Publié par iBuildPDF.

Plus dans la base de connaissances

Parcourir la base de connaissances