Fundamentos de PDF

Qué es realmente un archivo PDF

¿Qué es un PDF, por dentro?

Respuesta breve

Un PDF es una descripción de páginas terminadas. Registra exactamente dónde va cada glifo, línea e imagen en una página de tamaño fijo, junto con las fuentes necesarias para dibujarlos. Por eso se ve igual en todas partes, y por eso editarlo resulta incómodo. Dentro de un PDF no hay párrafos, solo marcas en posiciones.

Qué hay dentro del archivo

Un PDF son cuatro partes seguidas, y tres de ellas se pueden leer si abres el archivo en un editor de texto plano.

%PDF-1.712xref3trailer4

Las cuatro partes de un archivo PDF

  1. Cabecera — una línea que indica la versión de PDF que usa el archivo.
  2. Cuerpo — los objetos numerados: páginas, fuentes, imágenes e instrucciones de dibujo.
  3. Tabla de referencias — la posición en bytes de cada objeto, para saltar directo a él.
  4. Tráiler — dónde empieza la tabla y cuál es el objeto raíz. Los lectores empiezan aquí, al final.

La cabecera es una línea que indica la versión. El cuerpo es una colección numerada de objetos: páginas, fuentes, imágenes y los flujos de contenido que dicen qué dibujar y dónde. La tabla de referencias cruzadas registra la posición en bytes de cada uno de esos objetos. El tráiler indica dónde empieza esa tabla y cuál es el objeto raíz del documento.

La tabla es la parte que merece la pena entender, porque explica la mayor parte del comportamiento de un PDF. Un PDF no se lee de principio a fin como una carta; se consulta. Un visor abre el archivo, salta al final, lee el tráiler, encuentra la tabla y, a partir de ahí, va directo al objeto que necesite. Así es como un lector te muestra la página 400 de un informe de 900 páginas sin leer las primeras 399.

Es también la razón por la que un archivo que perdió sus últimos kilobytes en el envío normalmente no llega a abrirse. Los objetos siguen ahí; el mapa hasta ellos no. Por qué un PDF no se abre cubre ese caso, y Reparar PDF a veces puede reconstruir la tabla a partir de lo que sobrevive.

Para ver lo que el propio archivo dice de sí mismo, Número de páginas e información del archivo informa de los datos estructurales y el editor de metadatos muestra los descriptivos.

Por qué se ve igual en todas partes

Toda posición en un PDF es absoluta. Una línea de texto no es «el segundo párrafo»; es un conjunto de glifos colocados en unas coordenadas concretas de una página de un tamaño concreto. Nada se reajusta cuando cambia la ventana, porque no hay nada que reajustar. Las decisiones de maquetación se tomaron una vez, por lo que produjo el archivo, y quedaron congeladas.

Las fuentes son la otra mitad de la promesa. Un PDF puede llevar dentro de sí las fuentes que usa, de modo que un lector dibuja el texto con las mismas formas que vio el autor en lugar de sustituirlas por lo que tenga la máquina a mano. Cuando una fuente no está incrustada, la sustitución se nota: anchos de letra distintos, saltos de línea distintos, a veces incluso un alfabeto distinto. Eso es casi siempre la causa de un documento que se ve mal en el ordenador de otra persona, y tiene su propio artículo.

Esta fijeza es todo el valor del formato. Es también todo su coste, y las dos cosas no se pueden separar: un documento que garantiza verse idéntico en todas partes es un documento que no puede adaptarse a nada.

Versiones, y la cuestión del PDF/A

La versión de la cabecera —1.4, 1.7, 2.0— indica qué funciones puede usar el archivo, no lo nuevo o bueno que sea. En la práctica los lectores son compatibles hacia atrás, así que un archivo 1.4 de 2003 se abre hoy sin problema. Casi nunca necesitas preocuparte de esto, y «guardar como una versión de PDF más antigua» casi nunca soluciona nada.

Merece la pena conocer las variantes:

  • PDF/A es para archivar. Exige que todas las fuentes estén incrustadas y prohíbe cualquier cosa cuyo significado pueda variar: sin referencias externas, sin scripts, sin cifrado. Un archivo PDF/A es una apuesta a que seguirá mostrándose correctamente dentro de treinta años.
  • PDF/X es para impresión comercial, y fija el color y la geometría de la página. Consulta preparar un PDF para imprimir.
  • PDF etiquetado añade un árbol de estructura —encabezados, listas, orden de lectura— que es lo que hace que un documento se pueda usar con un lector de pantalla. Qué hace accesible a un PDF entra en detalle.

Son restricciones superpuestas sobre el mismo formato, no formatos distintos. Un archivo PDF/A es un PDF, y cualquier herramienta corriente puede leerlo.

Por qué editar un PDF es incómodo

Porque no hay texto que editar, en el sentido en que lo entiende un procesador de textos. Cambia «marzo» por «septiembre» y el reemplazo es más largo, así que choca con lo que venía después; y nada en el archivo sabe que esos glifos formaban una frase, o que la frase pertenecía a un párrafo que debería reajustarse. Un editor de PDF tiene que reconstruir esa estructura por inferencia, y es inferencia, que es la razón por la que el resultado varía según cómo se hizo el archivo.

En la práctica, esto significa:

  • Las correcciones pequeñas —una fecha, un número, un nombre— son en lo que un editor de PDF es realmente bueno.
  • Reescribir se hace mejor en el origen. Edita el documento original y genera un PDF nuevo; si el original se ha perdido, PDF a Word te da una aproximación editable, y conviene leer antes qué puede recuperar y qué no.
  • El trabajo a nivel de página —reordenar, eliminar, rotar, unir— es fácil y sin pérdidas, porque mueve objetos completos en lugar de tocar su contenido. Reordenar y eliminar páginas explica por qué.

Una advertencia que importa más que el resto: cubrir un texto con un rectángulo negro en un editor no oculta nada. El texto sigue en el archivo, debajo. Censurar un PDF correctamente es una operación distinta, y Censurar PDF es la herramienta para ello.

Herramientas que cubre este artículo

Fuentes

Documentación primaria de las afirmaciones anteriores.

Última revisión: 24 de septiembre de 2026

Publicado por iBuildPDF.

Más de la base de conocimientos

Explorar la base de conocimientos