Tamaño de archivo y compresión

Por qué algunos PDF no se hacen más pequeños

¿Por qué mi PDF no se hace más pequeño?

Respuesta breve

Normalmente porque no queda nada que comprimir: el archivo ya está construido de forma eficiente, o su tamaño viene de fuentes incrustadas, dibujos vectoriales densos o formatos de imagen que no se pueden recomprimir en un navegador. La compresión de imágenes solo ayuda a un archivo cuyos bytes son fotografías.

La respuesta corta

Toda herramienta de compresión tiene el mismo límite: solo puede eliminar la redundancia que todavía está ahí. Cuando un PDF se niega a encoger, casi nunca es que la herramienta haya fallado. Es que el archivo no tiene margen, o que su volumen está en una parte del documento a la que la compresión de imágenes no llega.

Hay cuatro causas habituales, y cada una pide una respuesta distinta. El archivo ya está cerca de su suelo. Su tamaño son fuentes incrustadas. Su tamaño son dibujos vectoriales. O sus imágenes están en formatos que no se pueden decodificar y volver a codificar en un navegador. Averigua primero cuál tienes: /pdf-page-count indica el número de páginas, los tamaños de página y si hay capa de texto, lo que suele bastar para saberlo.

El archivo ya está construido de forma eficiente

Es el caso más habitual y el menos satisfactorio. Un PDF exportado una sola vez desde una aplicación moderna ya suele estar cerca de lo más pequeño que puede ser, porque la compresión genérica ya se ha aplicado.

123

Dónde están realmente los bytes

  1. Imágenes. En casi todo PDF grande, esto es casi el archivo entero.
  2. Fuentes incrustadas: unos pocos cientos de kilobytes, iguales tanto si el documento tiene 5 páginas como 500.
  3. El texto en sí, y la estructura que lo mantiene unido. Normalmente un error de redondeo.

Los flujos de contenido de las páginas —las instrucciones que describen dónde va el texto, qué fuentes usar y cómo dibujar las líneas— se guardan con el filtro Flate, el algoritmo DEFLATE de la RFC 1951, el mismo que hay dentro de ZIP y PNG. El exportador lo aplicó al escribir el archivo. Pasar DEFLATE sobre datos ya comprimidos con DEFLATE no recupera nada; una salida comprimida le parece ruido a un compresor, que es precisamente por lo que está comprimida.

Así que un documento de texto de 40 páginas sin imágenes no tiene margen apreciable. La optimización estructural —reempaquetar objetos en flujos de objetos, descartar objetos que quedaron huérfanos en ediciones anteriores, eliminar metadatos— gana porcentajes de un solo dígito y a veces apenas eso. No es una limitación de una herramienta concreta; es lo que el archivo es.

Conviene conocer una excepción. Un PDF abierto, editado y vuelto a guardar muchas veces con varias aplicaciones puede arrastrar mucha basura sin referenciar de versiones anteriores de sí mismo, y reescribirlo bien gana bastante más. Si un archivo parece increíblemente grande para lo que contiene y tiene un largo historial de edición, esa es la explicación probable.

Fuentes incrustadas

Un PDF debe verse igual en todas partes. Esa promesa se cumple metiendo las fuentes dentro del archivo, para que el documento no dependa de lo que haya instalado en la máquina de quien lo lee. Es una de las razones por las que existe el formato, y cuesta bytes.

Cuántos depende de la fuente. Un subconjunto —solo los glifos que el documento usa realmente— de una tipografía de texto latina ocupa normalmente decenas de kilobytes y no da para preocuparse. Una fuente completa, sin subconjuntos, ocupa más. Una fuente CJK, que cubre chino, japonés o coreano, puede llegar por sí sola a varios megabytes, porque contiene muchos miles de glifos. Incrusta dos pesos de una de ellas y tendrás un PDF de varios megabytes que contiene una página de texto.

Un mal uso de los subconjuntos es una ineficiencia real y corregible, pero la solución es volver a exportar desde el documento de origen con los subconjuntos activados: un trabajo para la aplicación que creó el PDF, no para un compresor.

Lo que no debes hacer es quitar las fuentes. Un PDF al que le han eliminado las fuentes se renderiza con sustitutas en cualquier máquina que no tenga las originales: las métricas cambian, los saltos de línea se mueven, el diseño se descuadra y pueden faltar caracteres por completo. El documento deja de ser el documento en silencio. iBuildPDF no elimina las fuentes incrustadas, en ningún modo, precisamente por esto.

Dibujos vectoriales densos

Un mapa, una exportación de CAD, un plano de planta, un gráfico con decenas de miles de puntos representados: parecen imágenes y no lo son. Son dibujos vectoriales, así que el flujo de contenido de la página guarda una operación de dibujo individual por cada línea, curva, relleno y trazado de recorte del dibujo. Un mapa detallado puede ser cientos de miles de operaciones. Eso es el archivo.

No hay ninguna palanca de calidad de imagen que accionar, porque no hay imagen. Nada que reducir de resolución, nada que volver a codificar, ningún ajuste de calidad JPEG que aplique. Pasa la compresión de imágenes por un archivo así e informará correctamente de que no ha encontrado nada sobre lo que trabajar, y el resultado tendrá el mismo tamaño que la entrada. Eso no es un fallo; es el resultado honesto. El flujo de contenido, como siempre, ya está comprimido con Flate, así que la palanca genérica también se ha accionado.

Las opciones reales son simplificar el dibujo en la aplicación que lo produjo —menos trazados, menos detalle oculto, capas innecesarias eliminadas— o renunciar a los vectores y rasterizar, que se explica más abajo. El consuelo es que los archivos vectoriales son independientes de la resolución: un mapa de 500 KB se imprime perfectamente a cualquier tamaño, cosa que una fotografía de 500 KB de un mapa no hace.

Formatos de imagen que no se pueden recomprimir

A veces el archivo sí son imágenes y aun así no se pueden tocar, porque el navegador no puede decodificarlas. Recomprimir implica decodificar primero los píxeles originales, y una herramienta de navegador solo tiene los decodificadores que trae el navegador.

  • JPEG 2000 (JPXDecode). Un sucesor de JPEG basado en ondículas, usado en algunos flujos de archivo, médicos y de escaneo profesional. Los navegadores no lo admiten de forma fiable: no hay un decodificador JPX nativo con el que se pueda contar, así que no hay forma segura de llegar a los píxeles.
  • JBIG2. Un formato para imágenes escaneadas binarias (blanco y negro puro). Reconoce formas repetidas —la misma letra apareciendo mil veces en una página— y guarda cada forma una sola vez. Es extremadamente eficiente con texto escaneado, y un JPEG no podría mejorarlo.
  • Fax CCITT Grupo 3 y Grupo 4. Las codificaciones binarias clásicas de fax, que todavía producen los escáneres de documentos y las impresoras multifunción. Cada píxel es un bit, así que el resultado normalmente ya es más pequeño que cualquier JPEG que pudiéramos hacer de esa misma página; convertir un escaneado binario nítido a JPEG lo dejaría más grande y peor, con halos grises alrededor de cada letra.

También se omiten otras cosas a propósito: las máscaras de plantilla y cualquier cosa usada como /SMask o /Mask, las imágenes de menos de unos 100×100 píxeles, las muestras en bruto con algo que no sean 8 bits por componente, los espacios de color que no se pueden asignar de forma fiable como Separation, DeviceN y Lab, y los JPEG CMYK en un navegador que no supera una prueba de decodificación al arrancar.

Cuando iBuildPDF omite una imagen, cuenta la omisión y la informa en lugar de no hacer nada en silencio. Si tu archivo apenas ha cambiado y el resultado dice que se omitieron la mayoría de sus imágenes, esa es la explicación.

Qué ayuda de verdad

Ajusta el remedio a la causa.

  • Ya está construido de forma eficiente. Acéptalo, o cambia lo que estás enviando: divide el documento, o envía un enlace en lugar de un adjunto. Ningún ajuste ayudará.
  • Archivo guardado muchas veces. Una reescritura limpia elimina los objetos huérfanos acumulados; volver a exportarlo desde la aplicación de origen hace lo mismo.
  • Fuentes. Vuelve a exportar con los subconjuntos activados. No quites las fuentes.
  • Vectores. Simplifica el dibujo en el origen, o rasteriza.
  • Formatos de imagen omitidos. Si es JBIG2 o CCITT, es probable que el archivo ya esté cerca de su suelo; déjalo estar. Con JPEG 2000, volver a exportar desde el software de escaneo con salida JPEG normal suele dar un archivo que después sí se puede comprimir con normalidad.

Para un archivo con mucho vector, rasterizar es la única palanca que queda. El modo Máximo de /compress-pdf renderiza cada página y la sustituye por un JPEG de sí misma, así que el tamaño del resultado depende solo de las dimensiones de la página y de la calidad, no de la complejidad del dibujo. Funciona. También es el único modo destructivo, y la página lo dice antes de ejecutarlo: el resultado no tiene texto seleccionable, ni búsqueda, ni copiar y pegar, ni enlaces o campos de formulario que funcionen, ni nada para un lector de pantalla, y los dibujos vectoriales se ven borrosos al ampliarlos o imprimirlos más grandes. Como iBuildPDF no hace OCR, aquí nada puede devolverle después una capa de texto. Conserva el original.

Para ver en detalle qué cambia cada modo, consulta cómo funciona la compresión de PDF.

Herramientas que cubre este artículo

Fuentes

Documentación primaria de las afirmaciones anteriores.

Última revisión: 16 de septiembre de 2026

Publicado por iBuildPDF.

Más de la base de conocimientos

Explorar la base de conocimientos