Privacidad y seguridad

Qué información personal se esconde en un PDF

¿Qué información personal se esconde dentro de un PDF y cómo la elimino?

Respuesta breve

Un PDF lleva un conjunto de campos ocultos —normalmente un nombre de autor tomado de la cuenta de tu sistema operativo, el nombre y la versión del software que creó el archivo, y las fechas de creación y modificación— que tú no has escrito y que no aparecen en la página. Cualquiera que abra el archivo puede leerlos, y se eliminan con un limpiador de metadatos como /remove-pdf-metadata.

La versión corta

Abre cualquier PDF que le hayas enviado a alguien y mira sus propiedades. Normalmente encontrarás un nombre en el campo Autor. Tú no lo escribiste. Viene del nombre de la cuenta del ordenador que produjo el archivo, que en un portátil de trabajo suele ser tu nombre legal completo o un nombre de usuario interno, y en una máquina doméstica es como te llamaras a ti mismo cuando la configuraste.

Ese campo es uno de varios. Un PDF es un formato de documento estructurado, y la especificación (ISO 32000-1, la versión normalizada del PDF 1.7 de Adobe) reserva lugares específicos para información sobre el documento que no forma parte de lo que se dibuja en la página. Los procesadores de texto, los escáneres, los controladores de impresión y los cuadros de exportación rellenan todos esos lugares, por lo general sin decírtelo.

Nada de esto es un fallo de seguridad; es el formato funcionando tal como se diseñó. Importa porque el diseño da por hecho que sabes que ocurre, y la mayoría de la gente que envía un currículum o una denuncia anónima no lo sabe.

Qué hay realmente ahí dentro

En un PDF moderno hay dos sistemas de metadatos separados, y un archivo puede llevar los dos, a menudo con valores distintos.

123

La parte de un PDF que nadie lee

  1. Lo que hay en la página. Esta es la parte que revisaste antes de enviarla.
  2. El registro adjunto: autor, software, fechas, a veces una ruta de archivo o el nombre de una empresa.
  3. Nada de esto aparece al imprimir o leer el documento, y por eso viaja sin que nadie lo note.

El diccionario de información del documento

Es el mecanismo más antiguo, definido en la ISO 32000-1. Es un pequeño conjunto de campos con nombre asociados al documento:

CampoQué contiene normalmente
TitleA menudo el nombre original del archivo, incluido un nombre de borrador o un código de proyecto interno
AuthorCasi siempre el nombre de la cuenta del sistema operativo de quien creó el archivo
SubjectNormalmente vacío, a veces una descripción escrita hace años en una plantilla
KeywordsNormalmente vacío; cuando tiene contenido, con frecuencia revela una clasificación interna
CreatorLa aplicación en la que se redactó el contenido: Word, InDesign, LaTeX, el controlador de un escáner
ProducerLa biblioteca que escribió el propio PDF, normalmente con su número de versión exacto
CreationDateFecha y hora de creación, incluido el desfase de zona horaria
ModDateFecha y hora de la última modificación

Dos merecen atención especial. Author es el campo que identifica a una persona, y se rellena automáticamente. Producer identifica el software hasta la versión, lo que le dice a quien lo lea qué usas tú y, por extensión, qué despliega tu organización.

Las fechas también son reveladoras. Un desfase de zona horaria te sitúa geográficamente, y un ModDate posterior a la supuesta fecha de cierre de un documento es el tipo de detalle que se acaba notando en un litigio.

Metadatos XMP

El mecanismo más nuevo es XMP, la Extensible Metadata Platform, normalizada como ISO 16684-1. Es un bloque XML incrustado en el archivo, y guarda más que los ocho campos anteriores: declaraciones de derechos, historial de edición, registros específicos de cada herramienta y un identificador de documento que persiste entre guardados y que puede enlazar archivos distintos con un antepasado común.

Como el XMP está separado del diccionario de información, los dos pueden no coincidir. Editar uno no actualiza necesariamente el otro, y así es como un archivo acaba mostrando un campo Autor limpio en su panel de propiedades mientras el nombre original sigue en el bloque XMP unos miles de bytes más allá.

Metadatos dentro de las imágenes incrustadas

Un PDF que contiene fotografías incrusta esas imágenes como objetos dentro del archivo. Si una imagen llevaba datos EXIF cuando se colocó —modelo de cámara, fecha de captura y, en las fotos de teléfono, muy a menudo coordenadas GPS—, esos datos pueden viajar dentro del PDF con ella. Es una tercera capa independiente, a la que no afecta nada de lo que edite los metadatos propios del documento.

Cómo ver qué lleva tu archivo

Lo más rápido es el editor de metadatos PDF. Suelta ahí un archivo y analizará el documento y mostrará los campos del diccionario de información con sus valores actuales. El archivo se lee en tu navegador y no se sube, así que puedes inspeccionar un documento confidencial sin entregárselo a nadie.

Revisa el archivo que vas a enviar, no el de partida: cada paso de exportación reescribe Producer, y algunos reescriben más.

La herramienta de contar páginas es un buen complemento para un vistazo estructural rápido: abre el documento e indica cuántas páginas contiene, lo que además confirma que el archivo se analiza limpiamente como PDF. Un archivo que no da un número de páginas está dañado, y lo primero es repararlo.

Fuera del navegador, pdfinfo (parte de Poppler) y exiftool vuelcan ambos los metadatos, y exiftool además informa del EXIF encontrado en las imágenes incrustadas. Un PDF es en parte texto plano, así que abrir uno en un editor de texto y buscar /Producer o <x:xmpmeta suele mostrar los campos directamente.

Cómo eliminarlos

Usa eliminar metadatos de un PDF. Lee el documento con pdf-lib, borra los campos de información del documento —Title, Author, Subject, Keywords, Creator, Producer y las fechas de creación y modificación— y escribe un PDF nuevo. El contenido de la página no se reescribe, así que el documento que recuperas se ve y se lee exactamente igual que el que metiste.

Si prefieres sustituir los valores en lugar de vaciarlos, el editor de metadatos te deja fijar cada campo de forma explícita. Eso tiene una utilidad real: el nombre de una organización en el campo Autor llama menos la atención que un campo en blanco, que en un lote de documentos por lo demás normales es en sí mismo una señal.

Ambas herramientas se ejecutan por completo en tu navegador. No se sube nada, algo que aquí importa más de lo habitual: la razón de ser de todo esto es que el archivo contiene algo que no quieres compartir, así que enviarlo al servidor de un desconocido para que lo quite es un intercambio extraño. Consulta cómo funcionan las herramientas PDF en el navegador para ver el mecanismo.

Un apunte práctico: haz esto como último paso antes de enviar. Cualquier cosa que reescriba el archivo después —volver a exportarlo, imprimirlo a PDF, abrirlo y guardarlo en otra aplicación— volverá a estampar un Producer nuevo y fechas nuevas.

Qué no hace eliminar los metadatos

Esta es la parte que mete a la gente en problemas, porque vaciar el panel de propiedades parece definitivo y no lo es.

  • No toca la página visible. Un nombre en un membrete, un pie que dice Borrador — J. Okonkwo, un encabezado con el nombre de un cliente: eso es contenido de la página, no metadatos. Siguen ahí, y son lo primero que ve quien lo lee.
  • No elimina el EXIF de las imágenes incrustadas. Los metadatos del documento y los de una fotografía incrustada son estructuras distintas. Borrar los primeros deja los segundos intactos, coordenadas GPS incluidas. Si un PDF contiene fotos de teléfono y la ubicación importa, quita el EXIF de las imágenes antes de construir el PDF.
  • No elimina el texto oculto bajo una figura dibujada. Un rectángulo negro colocado sobre un párrafo no borra el párrafo: los objetos de texto siguen en el flujo de contenido y salen tal cual al copiar y pegar. Ese es un fallo distinto y mucho más grave, que tratamos en cómo censurar un PDF de forma permanente, y no lo resuelve ninguna herramienta de metadatos.
  • No llega a las copias ya enviadas. Eliminar los metadatos produce un archivo nuevo y limpio. Todas las copias distribuidas antes de eso siguen llevándolo todo, en cada bandeja de entrada y cada copia de seguridad a la que llegaron. La limpieza se hace antes de que un archivo salga, no después.

Trata los metadatos como cuatro capas separadas: el diccionario de información, el XMP, el EXIF de las imágenes incrustadas y el contenido visible de la página. Cada una necesita su propia comprobación. Limpiar una y dar por hecho que las demás han ido detrás es el error que conviene evitar.

Herramientas que cubre este artículo

Fuentes

Documentación primaria de las afirmaciones anteriores.

Última revisión: 16 de septiembre de 2026

Publicado por iBuildPDF.

Más de la base de conocimientos

Explorar la base de conocimientos