Qué es PDF/A y por qué un archivo rechaza un PDF normal
¿Qué es PDF/A, y por qué me han rechazado el PDF?
Guarda tus herramientas favoritas
Crea una cuenta gratuita de iBuildPDF para guardar tus herramientas favoritas y encontrarlas rápido cuando quieras.
Cuenta gratuita. Las herramientas PDF nunca necesitan una.
Respuesta breve
PDF/A es PDF corriente con opciones quitadas. Todo aquello cuyo significado pueda cambiar con el tiempo —una fuente que el archivo solo nombra, un color definido por la pantalla que te tocó usar, el cifrado, los scripts, un enlace a un archivo guardado en otro sitio— está prohibido, así que el documento tiene que bastarse a sí mismo. Un archivo histórico rechaza un PDF normal no porque hoy tenga nada malo, sino porque no puede prometer que el archivo se siga viendo igual dentro de treinta años.
Un PDF al que no se le permite depender de nada
PDF/A lo define ISO 19005, que es una norma distinta de la que define el propio PDF. No añade funciones. Quita opciones.
PDF/A: un archivo al que no se le permite depender de nada
- El archivo. Es un PDF corriente: cualquier lector lo abre y aquí no hay ningún formato nuevo.
- Todo lo que necesita está dentro: los contornos de las fuentes, un perfil que dice qué significan los colores y metadatos que describen el documento.
- No se puede depender de nada de fuera. Esa es toda la regla; el resto de la norma es esa regla aplicada a cada parte del archivo.
- Así que esto está prohibido: cifrado, scripts, referencias a contenido guardado en otro sitio, cualquier cosa cuyo significado pueda cambiar después de escribir el archivo.
El problema que existe para resolver es que un PDF corriente es un archivo más un conjunto de suposiciones sobre la máquina que lo abre: que la fuente que se nombra está instalada, que este tono de rojo significa algo medible, que la imagen enlazada sigue en el servidor, que el lector puede ejecutar el script. Cada suposición se sostiene hasta que deja de hacerlo, y el archivo no avisa cuando una deja de ser cierta: simplemente se ve distinto, y normalmente nadie se entera de qué día empezó eso.
PDF/A es el mismo formato con esas suposiciones prohibidas. Todo lo que el documento necesita para dibujarse tiene que estar dentro del archivo.
Dos consecuencias que conviene decir con claridad. Primera, un archivo PDF/A es un PDF. No hay un lector de PDF/A ni una extensión PDF/A; cualquier herramienta corriente lo abre, y la mayoría de las veces no se distingue a simple vista. Segunda, un archivo no se convierte en PDF/A por cambiarle el nombre ni por declararlo en sus metadatos. O cumple las reglas o no, y el archivo histórico que rechazó el tuyo tiene un programa que lo comprueba.
Qué prohíbe en realidad
Las reglas son largas, pero casi todas son la misma regla aplicada a partes distintas del archivo.
- Todas las fuentes deben ir incrustadas —incluidas las catorce que en su día estaban garantizadas en todos los lectores—. Un archivo que solo nombra una tipografía está apostando por una máquina que nunca conocerá. Este es, con diferencia, el motivo más común de que un documento no pase la validación, y por qué un PDF se ve distinto en otro ordenador cuenta qué sale mal cuando no se hace.
- El color debe ser independiente del dispositivo. El archivo tiene que llevar una intención de salida, o usar espacios de color definidos en lugar de supuestos, para que un color signifique un color medible y no «lo que haga este monitor».
- Nada de cifrado de ningún tipo. Un archivo histórico no puede conservar un archivo que no puede abrir, y una contraseña es justo el tipo de cosa que se pierde a lo largo de las décadas. Consulta qué protege realmente una contraseña de PDF.
- Nada de scripts, acciones de lanzamiento ni ejecutables incrustados. Un comportamiento que depende de ejecutar código es un comportamiento que nadie puede garantizar más adelante.
- Nada de referencias externas. Todo lo que se dibuja en la página tiene que estar en el archivo. Una página que trae una imagen o una fuente desde una URL es una página que acabará en blanco.
- Los metadatos XMP son obligatorios, y deben coincidir con los campos de información del documento en lugar de contradecirlos. Qué contienen los metadatos de un PDF explica los dos registros y por qué discrepan tan a menudo.
Unas cuantas reglas dependen de con qué parte de la norma estés cumpliendo. La transparencia y las imágenes JPEG 2000 están prohibidas en PDF/A-1 y permitidas a partir de PDF/A-2; los archivos adjuntos incrustados están prohibidos en PDF/A-1, restringidos a otros archivos PDF/A en PDF/A-2 y sin restricción en PDF/A-3, que es lo que hace de PDF/A-3 el portador habitual de una factura con una copia XML legible por máquina dentro.
Un hueco que conviene reconocer. Un hipervínculo a un sitio web está permitido —es una anotación, no contenido del que dependa la página— y se pudrirá exactamente igual de rápido que cualquier otro enlace. PDF/A conserva la representación del documento. No conserva la web.
Las partes, y la letra que va detrás
Una declaración de conformidad tiene dos mitades: qué parte de la norma, y qué nivel dentro de ella. PDF/A-2b significa parte 2, nivel b.
Las partes siguen al formato subyacente. PDF/A-1 se apoya en PDF 1.4 y es la más estricta. PDF/A-2 se apoya en ISO 32000-1 y relaja las restricciones de transparencia y JPEG 2000. PDF/A-3 es PDF/A-2 más la posibilidad de incrustar archivos cualesquiera. PDF/A-4 se apoya en PDF 2.0 y reorganiza el esquema: suprime las letras a/u/b y añade un nivel de conformidad para modelos de ingeniería 3D interactivos, PDF/A-4e.
Dentro de las partes 1 a 3, el nivel dice cuánto del significado del documento se conserva, y los niveles son acumulativos.
Los niveles de conformidad son acumulativos
- Nivel b — básico. El archivo se verá en el futuro igual que ahora. Eso es todo lo que promete.
- Nivel u — el b, más cada carácter correspondido con un valor Unicode, para que el texto se siga pudiendo buscar y copiar.
- Nivel a — el u, más un árbol de estructura: encabezados, listas, orden de lectura. El único nivel al que no se llega solo con un ajuste de exportación.
| Nivel | Qué garantiza | Cuánto cuesta producirlo |
|---|---|---|
| b — básico | El archivo se verá en el futuro igual que ahora. | Un ajuste de exportación. Alcanzable para casi cualquier documento. |
| u — Unicode | El nivel b, más que cada carácter de la página se corresponda con un valor Unicode, para que el texto siga siendo buscable y copiable. | Normalmente también un ajuste de exportación, si la aplicación que lo produce escribe mapas de caracteres correctos. |
| a — accesible | El nivel u, más un árbol de estructura: encabezados, listas, tablas, orden de lectura, idioma. | Trabajo de redacción. Esto no es una casilla. |
PDF/A-1 solo tiene los niveles a y b; el nivel u se introdujo con la parte 2.
La mayoría de las instituciones que piden PDF/A quieren PDF/A-1b o PDF/A-2b, y si no te han dicho cuál, ese es el par por el que merece la pena preguntar. El nivel a es otro orden de trabajo: un árbol de estructura de verdad tiene que venir de un documento escrito con encabezados y listas en lugar de con negritas y tabulaciones, y ningún conversor se lo inventa de forma fiable. Qué hace accesible a un PDF entra en el porqué.
De dónde tiene que salir un archivo PDF/A
Del origen. Los procesadores de textos, las aplicaciones de maquetación, los flujos de impresión y la mayoría de los generadores de informes pueden exportar PDF/A directamente, y esa es la única vía que funciona de forma fiable, porque la aplicación todavía tiene delante las fuentes, la información de color y la estructura.
Convertir un PDF existente a PDF/A es un trabajo de reparación, y conviene saber en qué consiste la reparación antes de fiarte del resultado. Un conversor tiene que buscar sustitutos para las fuentes que nunca se incrustaron —lo que significa sustituir por algo y aceptar que el texto puede desplazarse—, asignar un perfil de color que nadie eligió, quitar un cifrado que quizá no pueda quitar y eliminar la interactividad. Lo consigue con frecuencia. A veces cambia el documento, y los cambios son de los que nadie comprueba.
iBuildPDF no produce PDF/A. Aquí no hay ninguna herramienta que convierta un archivo a ese formato, y una herramienta de navegador que dijera hacerlo sin poder localizar una fuente que falta estaría afirmando algo que no puede hacer. Lo que este sitio sí puede hacer es decirte qué tienes entre manos antes de que vayas a buscar algo que sí lo haga:
- Contar páginas e información del archivo: los datos estructurales, incluido si hay capa de texto siquiera.
- El editor de metadatos: lo que la aplicación que lo produjo registró sobre sí misma, que suele ser la pista más rápida de cómo se hizo el archivo y, por tanto, de en qué es probable que falle.
- PDF a texto: una prueba aproximada del nivel u. Si el texto extraído vuelve como caracteres correctos y legibles, los mapas de caracteres están ahí; si vuelve como un sinsentido, no están, y el archivo no puede alcanzar el nivel u tal como está. Por qué el texto copiado sale ilegible explica ese fallo.
- Aplanar PDF: resuelve los campos de formulario y las anotaciones dentro de la página, que es una de las cosas que una conversión tendría que hacer de todos modos.
Las cuatro se ejecutan en tu navegador. Ninguna de ellas hace conforme a un archivo.
Cómo saber si un archivo lo es de verdad
Un archivo PDF/A se declara como tal en sus metadatos XMP, donde registra la parte y el nivel de conformidad. Los lectores suelen mostrar una barra en la parte superior de la ventana diciéndolo.
La declaración es una afirmación, no una prueba. Cualquier archivo puede llevarla. Un archivo también se puede editar después de hecho, así que un documento que el martes era conforme de verdad puede no serlo el viernes y seguir anunciando que lo es. La única manera de saberlo es pasar un validador, y el archivo histórico que rechazó el tuyo pasó uno.
veraPDF es el validador de código abierto, desarrollado con la PDF Association, y es el que usan bastantes instituciones. Si te han rechazado el archivo, lo útil que hay que pedir no es otro intento, sino el informe del validador, que nombra la regla que falló. En la práctica, la mayoría de los rechazos son una de estas tres cosas:
- Una fuente no está incrustada, a menudo una sola fuente y a menudo en un encabezado o un número de página en los que nadie se fijó.
- No hay intención de salida, así que el color queda sin definir.
- El archivo está cifrado, a veces con una contraseña de permisos que quien lo envió no sabía que estaba ahí.
Por último, el límite que más importa y que menos se dice: un archivo puede pasar la validación y aun así ser un mal documento de archivo. Un escaneado sin capa de texto es PDF/A-1b perfectamente válido y no se podrá buscar nunca. La validación comprueba el contenedor. Si lo que hay dentro merece la pena conservarlo, y si alguien podrá encontrarlo dentro de veinte años, es otra pregunta que ninguna norma responde por ti.
Herramientas que cubre este artículo
Fuentes
Documentación primaria de las afirmaciones anteriores.