Privacidad y seguridad

Censurar un PDF de forma irreversible

¿Cómo tacho texto en un PDF para que realmente no se pueda recuperar?

Respuesta breve

Dibujar un rectángulo negro sobre un texto no elimina el texto: las palabras siguen debajo en el archivo y salen tal cual al copiar y pegar. Una censura de verdad significa destruir el contenido subyacente, que es lo que hace /redact-pdf reconstruyendo como imágenes las páginas marcadas, y siempre deberías verificar el resultado intentando extraer el texto de nuevo.

La versión corta

Un PDF es una lista de instrucciones de dibujo. Añadir un rectángulo negro sobre un nombre añade una instrucción más: dibuja un rectángulo negro relleno en estas coordenadas. La instrucción que dibuja el nombre sigue en el archivo, antes en esa misma lista. El rectángulo se sitúa encima visualmente y no le hace nada estructuralmente.

Selecciona la zona en un lector de PDF y pulsa copiar. El nombre está en tu portapapeles; no se ha roto nada, el texto simplemente se ha leído del archivo igual que cualquier lector lee cualquier texto.

Una censura que aguante significa eliminar contenido, no ocultarlo. Todo lo demás de esta página se deriva de esa distinción.

Por qué fallan los recuadros negros

Según la ISO 32000-1, la norma que define el PDF, las marcas de una página proceden de un flujo de contenido: una secuencia de operadores que colocan una fuente, fijan un color y muestran una cadena de caracteres. El texto se guarda como texto. Eso es lo que hace que un PDF sea buscable, y por lo que un lector puede darte las palabras cuando las seleccionas.

1S E C R E T234

Cubrir no es eliminar

  1. Un rectángulo negro dibujado sobre el texto. Parece terminado.
  2. El texto sigue en el archivo, debajo. Selecciónalo, cópialo o abre el archivo en cualquier editor y ahí está.
  3. La censura correcta reconstruye la página sin esos caracteres.
  4. Ahora no hay nada bajo la marca, porque ya no queda nada que encontrar.

Una figura dibujada después es un operador más dentro del mismo flujo. El orden de pintado decide lo que ves; no decide lo que existe. Así que las palabras sobreviven a cualquier vía de acceso al archivo que no consista en mirarlo:

  • Seleccionar y copiar en cualquier lector de PDF.
  • pdftotext, o cualquier otra utilidad de extracción, que ignora por completo los gráficos y devuelve la capa de texto.
  • La búsqueda: el documento sigue siendo indexable por las palabras ocultas, incluidos los motores de búsqueda si está publicado.
  • Abrir el archivo en un editor y borrar el rectángulo, lo que restaura exactamente el aspecto original.

Este fallo ha provocado filtraciones reales. El patrón se repite en escritos judiciales y publicaciones oficiales: se publica un documento con nombres o cifras tapados con rectángulos negros y, en cuestión de horas, alguien ha copiado el texto directamente. La Agencia de Seguridad Nacional de EE. UU. publica una guía para sanear archivos PDF precisamente por esto, y su instrucción central es la de arriba: tapar contenido no es eliminarlo.

Lo mismo vale para todas las variantes. Un marcador amarillo sobre texto negro, texto blanco sobre fondo blanco, un recuadro de color o una figura en una capa de anotaciones son cambios cosméticos de lo que se dibuja; los caracteres siguen en el flujo de contenido y un extractor de texto los devuelve. El blanco sobre blanco es el peor del grupo, porque ni siquiera parece censurado.

Qué funciona de verdad

Una censura correcta tiene un requisito: el contenido que llevaba la información delicada ya no debe estar en el archivo. Hay dos formas de conseguirlo.

La primera es quirúrgica: analizar el flujo de contenido, eliminar los operadores de mostrar texto que cubren la región censurada y reescribir el flujo. Es precisa, pero frágil: el texto se posiciona en fragmentos que rara vez coinciden con las palabras. Mal hecha, deja cadenas parciales por ahí, que es el peor resultado posible, porque entonces el archivo parece censurado y no lo está.

La segunda es reconstruir la página para que los objetos de texto originales dejen de existir por completo. Es lo que hace la herramienta de censura de iBuildPDF. Tú marcas las regiones que hay que eliminar; para cada página marcada, la herramienta renderiza esa página con PDF.js, dibuja tus zonas de censura como relleno sólido sobre los píxeles renderizados y escribe una página nueva construida a partir de esa imagen con pdf-lib. La página reconstruida contiene una imagen y ningún operador de texto. No hay nada debajo de las zonas negras porque no hay nada debajo de nada: la página ahora son píxeles.

El coste es real y conviene contar con él. En cada página que censuras, todo el texto deja de ser seleccionable, no solo la parte censurada. Esas páginas dejan de ser buscables, copiables y legibles por un lector de pantalla, y el tamaño del archivo normalmente sube, porque la imagen de una página de texto ocupa más que el texto.

Las páginas que no marcas se dejan exactamente como estaban, así que un informe de 200 páginas con dos páginas censuradas conserva 198 buscables. Cuando ese coste es inaceptable —un requisito de accesibilidad, o un documento que debe seguir siendo buscable de principio a fin—, censura en el origen: quita el texto del original y exporta un PDF nuevo. En cualquier caso, censura en último lugar: volver a exportar desde el original después reinstaura en silencio todo lo que habías quitado.

Comprobar que ha funcionado

No entregues nunca un documento censurado que no hayas probado. La prueba lleva dos minutos.

  1. Copiar y pegar. Abre el archivo descargado, selecciona la zona censurada y un margen generoso a su alrededor, copia y pega en un editor de texto plano. En una página correctamente reconstruida no obtienes nada, porque no hay texto que seleccionar.
  2. Extrae todo el documento. Pasa el resultado por PDF a texto y busca en la salida la cadena censurada. Esta es la comprobación que más importa, porque cubre el archivo entero y no solo la zona que te dio por seleccionar, incluida una página donde aparece el mismo nombre y que se te olvidó marcar. Busca también fragmentos: un apellido suelto, los últimos seis dígitos de un número de cuenta.
  3. Revisa los metadatos. Abre el archivo en el editor de metadatos. Los términos delicados sobreviven habitualmente en los campos Title o Keywords, y el Title es muy a menudo el nombre original del archivo: Smith-settlement-confidential.pdf echa por tierra la censura de la página cuatro sin que nadie lea la página.

Las tres herramientas se ejecutan en tu navegador, así que verificar un archivo confidencial no implica subirlo. Si una búsqueda sí encuentra algo, trata el archivo como no censurado en lugar de parchearlo con otro rectángulo.

Qué no puede hacer la censura

Cuatro límites, dichos claramente.

  • Solo afecta a la copia que descargas. La censura produce un archivo nuevo. El original sigue igual en tu disco, y cualquier copia ya enviada, archivada o respaldada sigue conteniéndolo todo. Si la versión sin censurar ha salido de tu control, censurarla ahora no cambia nada de eso.
  • El orden importa al rasterizar. Reconstruir una página como imagen solo es seguro porque la zona censurada se rellena antes de escribir la imagen: los píxeles negros sustituyen a los píxeles que mostraban el texto. Un proceso que rasteriza primero la página y luego coloca un rectángulo negro sobre la imagen resultante ha recreado el problema original de otra forma: las palabras siguen ahí, como píxeles bajo el recuadro, recuperables por cualquiera que lo quite. Confírmalo con la prueba de extracción de arriba en lugar de dar por hecho que una herramienta ha acertado con el orden.
  • La imagen de una página la puede seguir leyendo una máquina. Rasterizar impide copiar y pegar y extraer texto; no hace que el texto visible restante sea ilegible para un reconocimiento óptico de caracteres, algo normal en software ampliamente disponible. La censura protege el contenido tapado, no el resto de la página. iBuildPDF no ofrece OCR —no hay ninguna herramienta así en el sitio—, así que esto va de lo que otra persona puede hacer con lo que tú produces.
  • Los metadatos son un sistema aparte. Los campos de información del documento y el bloque XMP viven fuera del contenido de la página y no los toca nada de lo que se haga con las páginas. Bórralos con eliminar metadatos de un PDF, y consulta qué contienen los metadatos de un PDF para saber qué guardan esos campos.

La costumbre que evita la mayoría de los fallos de censura es sencilla: da por hecho que el archivo sigue conteniendo lo que quitaste y oblígalo a demostrar lo contrario extrayendo el texto y buscando en él.

Herramientas que cubre este artículo

Fuentes

Documentación primaria de las afirmaciones anteriores.

Última revisión: 16 de septiembre de 2026

Publicado por iBuildPDF.

Más de la base de conocimientos

Explorar la base de conocimientos