Tamaño de archivo y compresión
Cómo funciona realmente la compresión de PDF
¿Qué ocurre realmente cuando se comprime un PDF?
Guarda tus herramientas favoritas
Crea una cuenta gratuita de iBuildPDF para guardar tus herramientas favoritas y encontrarlas rápido cuando quieras.
Cuenta gratuita. Las herramientas PDF nunca necesitan una.
Respuesta breve
En casi todos los PDF grandes, los bytes son fotografías, así que comprimir el archivo significa decodificar esas imágenes, reducirlas y volver a escribirlas. El texto, los vectores y la estructura ya están comprimidos y se dejan intactos, salvo que elijas el modo destructivo que rasteriza páginas enteras.
La respuesta corta
Un PDF no es un único bloque comprimido. Es un conjunto de objetos numerados —descripciones de página, fuentes, imágenes, anotaciones, metadatos— unidos por una tabla de referencias cruzadas, tal como define la norma ISO 32000-1, y cada objeto lleva su propio filtro de compresión. No hay un único mando que ponga "más pequeño"; hay varias cosas distintas que puede hacer una herramienta, actuando sobre partes completamente diferentes del archivo.
Tres de ellas importan en la práctica. La optimización estructural ordena el grafo de objetos y normalmente gana muy poco. La recompresión de imágenes decodifica las fotografías incrustadas, reduce sus dimensiones en píxeles y las vuelve a codificar, y de ahí sale casi todo el ahorro real. El rasterizado descarta por completo la descripción de la página y sustituye cada página por una imagen de sí misma; es la palanca más grande y la única destructiva. Saber cuál de las tres necesita tu archivo es la mayor parte del problema.
Dónde están realmente los bytes
Un documento de texto de 40 páginas suele ocupar bastante menos de un megabyte. Un contrato escaneado de 10 páginas puede ocupar veinte veces eso. La diferencia no es el número de páginas: un archivo guarda instrucciones y el otro guarda fotografías.
Dónde están realmente los bytes
- Imágenes. En casi todo PDF grande, esto es casi el archivo entero.
- Fuentes incrustadas: unos pocos cientos de kilobytes, iguales tanto si el documento tiene 5 páginas como 500.
- El texto en sí, y la estructura que lo mantiene unido. Normalmente un error de redondeo.
El texto vive en un flujo de contenido: un pequeño programa de operadores de dibujo que indica qué fuente, a qué tamaño, en qué coordenadas y con qué caracteres. Ese flujo se guarda con el filtro Flate, el algoritmo DEFLATE de la RFC 1951, la misma compresión que se usa dentro de ZIP y PNG. Ya se ha aplicado. Una página de prosa cuesta unos pocos kilobytes; cuarenta de ellas cuestan una fracción de lo que cuesta una sola fotografía.
Una página escaneada es lo contrario. No hay texto ni descripción de diseño en absoluto: un objeto de imagen, normalmente un JPEG, dibujado sobre toda la página, y un flujo de contenido de tres o cuatro operadores. El archivo son las imágenes.
Por eso "comprimir mi PDF" es casi siempre "recomprimir las imágenes", y por eso los resultados varían tantísimo entre archivos que parecen similares. Un informe lleno de fotografías de producto tiene un margen enorme. Un PDF de solo texto casi no tiene ninguno: pásale un compresor genérico y normalmente ganarás porcentajes de un solo dígito, porque lo único que queda por exprimir ya está exprimido. Si no sabes qué tipo de archivo tienes, /pdf-page-count te dice el número de páginas, los tamaños de página y si hay capa de texto.
Optimización sin pérdida y estructural
Antes de tocar ninguna imagen, un escritor de PDF puede reorganizar el propio archivo. No cambia nada visible y no se pierde nada. Hay tres ganancias habituales.
- Flujos de objetos. La ISO 32000-1 permite empaquetar muchos objetos pequeños que no son flujos dentro de un único flujo comprimido, en lugar de escribirlos uno a uno con su propia sobrecarga.
- Descartar objetos huérfanos. Editar un PDF a menudo añade en lugar de reescribir. Una página que borraste, una fuente que sustituiste, una versión anterior de una anotación: todo eso puede seguir dentro del archivo sin que nada lo referencie. Una reescritura completa conserva solo aquello a lo que el documento apunta de verdad.
- Eliminar metadatos. Se pueden quitar las propiedades del documento, los paquetes XMP y los datos privados específicos de cada aplicación. Esto son kilobytes, no megabytes, y su valor real es la privacidad más que el tamaño; la herramienta para eso es /remove-pdf-metadata.
Sé realista con el beneficio. En un PDF exportado limpiamente una sola vez desde una aplicación moderna, la optimización estructural gana normalmente porcentajes de un solo dígito y a veces casi nada, porque el exportador ya lo hizo. En un archivo abierto, editado y vuelto a guardar una docena de veces con varias aplicaciones, los objetos huérfanos pueden ser una parte considerable del archivo y una reescritura gana bastante más. Lo que nunca hará es convertir un escaneado de 50 MB en uno de 2 MB.
Recomprimir las imágenes: dos palancas independientes
Una vez asumido que el problema son las imágenes, hay exactamente dos cosas que puedes cambiar en cada una, y son independientes.
Resolución
La resolución efectiva de una imagen no es una propiedad solo de la imagen. Es su anchura en píxeles dividida entre la anchura con la que realmente se dibuja en la página. Una fotografía de 2400 píxeles de ancho sobre una página de 8 pulgadas son 300 DPI. Ese mismo archivo colocado como logotipo en una esquina de una pulgada son 2400 DPI, y cada píxel más allá de los primeros cientos es invisible: detalle que ninguna pantalla y ninguna impresora mostrarán jamás.
Así que la pregunta útil nunca es "cuánto ocupa esta imagen", sino "cuánto ocupa en relación con el uso que se le da". Reducir la resolución redimensiona la retícula de píxeles para que la resolución efectiva quede en un valor sensato. Unos 150 DPI están cómodamente por encima de lo que resuelve una pantalla y bastante por debajo de lo que necesita la imprenta; por debajo de unos 100 DPI, el texto dentro de una imagen escaneada pierde definición de forma visible.
Calidad
JPEG, especificado en la norma ITU-T T.81, tiene pérdida por diseño: transforma bloques de píxeles en coeficientes de frecuencia y los cuantiza, descartando el detalle al que el ojo es menos sensible. El ajuste de calidad controla con cuánta agresividad. Una calidad baja ocupa menos y acaba produciendo artefactos de bloque y halos alrededor de los bordes nítidos, que es justo donde vive el texto escaneado, así que los escaneados toleran peor una bajada de calidad que las fotografías.
Qué hace iBuildPDF
El modo Inteligente de /compress-pdf recorre el grafo de objetos del PDF, localiza cada XObject de imagen incrustado, lo decodifica, lo reduce a aproximadamente 150 DPI según el tamaño con el que se dibuja realmente en la página, lo vuelve a codificar como JPEG con calidad 0,80 y sustituye ese flujo de imagen en su sitio. El modo Fuerte es el mismo mecanismo con aproximadamente 96 DPI y calidad 0,58.
Los flujos de contenido de las páginas no se tocan nunca. La consecuencia importa: el texto sigue siendo seleccionable y buscable, los dibujos vectoriales siguen nítidos con cualquier zoom, y los enlaces, esquemas, campos de formulario y anotaciones sobreviven. Solo cambian los píxeles dentro de los objetos de imagen. Algunas imágenes se omiten a propósito: en por qué algunos PDF no se pueden comprimir explicamos cuáles y por qué.
Rasterizar: la opción destructiva
El último enfoque abandona el modelo de documento. Cada página se renderiza tal como la vería un lector, se guarda como JPEG y se construye un PDF nuevo que no contiene más que esas imágenes.
Funciona donde no funciona nada más, porque le da igual por qué era grande el original. Un mapa vectorial denso de cien mil operaciones de dibujo se convierte en una fotografía plana. Un documento cuyas imágenes están todas en formatos que no se pueden recomprimir se convierte en un documento sin esas imágenes. El tamaño del resultado depende solo de las dimensiones de la página y de la calidad JPEG, no del contenido del original.
El coste es grave y permanente:
- No hay texto seleccionable. No se puede copiar nada.
- No hay búsqueda, en ningún lector, nunca.
- Los enlaces, marcadores, campos de formulario y anotaciones desaparecen.
- Los lectores de pantalla no tienen nada que leer; el documento deja de ser accesible.
- Los dibujos vectoriales pasan a tener resolución fija y se ven borrosos al ampliarlos o imprimirlos más grandes.
El modo Máximo de iBuildPDF hace esto, y es el único modo destructivo. La página lo etiqueta como destructivo antes de ejecutarlo, así que la elección es explícita y no una sorpresa que descubres después. No hay vuelta atrás: el texto no está oculto, ya no existe en el archivo. Y como iBuildPDF no hace OCR, ninguna herramienta de aquí puede devolverle después una capa de texto. Conserva el original.
Cómo elegir un enfoque
| Enfoque | Qué cambia | El texto sigue siendo seleccionable | Uso típico |
|---|---|---|---|
| Estructural / sin pérdida | La disposición de los objetos, los objetos huérfanos, los metadatos. Ningún cambio visible. | Sí | Archivos editados y vueltos a guardar muchas veces; limpieza por privacidad. |
| Recompresión de imágenes (Inteligente, ~150 DPI, q0,80) | Las fotografías incrustadas se reducen de resolución y se vuelven a codificar. Los flujos de contenido no se tocan. | Sí | La opción por defecto. Informes, folletos, cualquier cosa con fotografías dentro. |
| Recompresión de imágenes (Fuerte, ~96 DPI, q0,58) | El mismo mecanismo, más agresivo. Pérdida de definición visible en imágenes detalladas. | Sí | Un límite de tamaño estricto que no puedes cumplir de otra forma y en el que basta con que se lea en pantalla. |
| Rasterizado (Máximo) | Cada página se convierte en una imagen plana. Todo lo demás se descarta. | No | Último recurso: archivos con mucho vector, o cuando nada más se ha acercado. |
Un orden que funciona: empieza con Inteligente y mira el resultado. Si es lo bastante pequeño, para ahí: no has perdido nada que importe. Si no lo es, averigua por qué el archivo es grande antes de subir de nivel, porque el modo Fuerte solo ayuda si el archivo es grande por las fotografías. Para todo lo demás, consulta por qué algunos PDF no se pueden comprimir; y si trabajas con un límite fijo, cómo bajar un PDF de 1 MB explica qué hacer cuando el objetivo es inalcanzable.
Todo esto se ejecuta en tu navegador: el archivo se lee con la File API y lo procesan localmente pdf-lib y PDF.js, y no se sube nada. El techo práctico es la memoria de tu dispositivo, no un tamaño de archivo fijo.
Herramientas que cubre este artículo
Fuentes
Documentación primaria de las afirmaciones anteriores.