Qué hace que un PDF sea accesible
¿Qué hace que un PDF sea accesible para un lector de pantalla?
Guarda tus herramientas favoritas
Crea una cuenta gratuita de iBuildPDF para guardar tus herramientas favoritas y encontrarlas rápido cuando quieras.
Cuenta gratuita. Las herramientas PDF nunca necesitan una.
Respuesta breve
La estructura, no solo el texto. Un lector de pantalla necesita saber que esta línea es un encabezado, que ese bloque es una tabla con estas columnas, que esta imagen significa aquello y que el orden de lectura va por aquí. Esa información vive en una capa de etiquetas que un PDF puede llevar o no. El texto seleccionable es necesario y ni de lejos suficiente: un documento puede ser perfectamente buscable y aun así resultar inutilizable.
Qué son las etiquetas
Visualmente, una página de PDF es un conjunto de instrucciones de dibujo: coloca estos glifos en estas coordenadas. Nada de eso dice qué glifos forman un encabezado, ni cuáles pertenecen al mismo párrafo, ni que estas doce series de texto son celdas de una tabla. Una persona que ve lo deduce todo del tamaño, el grosor y la posición. El software no puede.
El orden de lectura se guarda, no se adivina
- Lo que ve un lector con vista: un encabezado y luego dos columnas.
- El árbol de etiquetas: encabezado, luego párrafo, luego párrafo. Esto dice qué columna va primero.
- Sin etiquetas, el orden hay que inferirlo por la posición, y una página a dos columnas es donde eso falla.
Un PDF etiquetado añade un árbol de estructura paralelo —encabezados, párrafos, listas, tablas, figuras— muy parecido a la estructura de un documento HTML. Con él, la tecnología de apoyo puede anunciar "encabezado de nivel 2", dejar que alguien salte entre secciones, leer una tabla por filas y columnas y leer el texto alternativo de una figura. Sin él, ese mismo software recurre a adivinar a partir de la maquetación, y adivina mal en cualquier cosa que no sea la página de una sola columna más simple.
La capa de etiquetas lleva otras tres cosas, todas importantes y ninguna visible:
- El orden de lectura, que no es el orden en que se dibujaron las cosas. Una maquetación a dos columnas dibujada columna a columna se lee correctamente; dibujada línea a línea a través de ambas columnas se lee como un sinsentido, y se ve idéntica.
- El texto alternativo de las imágenes, sin el cual una figura se anuncia como "gráfico" y nada más.
- El idioma del documento, que le dice a un lector de pantalla qué reglas de pronunciación usar. Un documento en francés leído con reglas inglesas resulta casi incomprensible.
Por qué el OCR no es accesibilidad
Este es el malentendido más común y más costoso, así que conviene ser tajante al respecto.
Pasar el OCR por un documento escaneado añade una capa de texto reconocido detrás de la imagen. El documento pasa a ser buscable, el texto pasa a ser seleccionable y un lector de pantalla leerá algo en lugar de nada. Es una mejora real y grande, y no es accesibilidad.
Lo que el OCR produce es un flujo indiferenciado de palabras. No sabe que una línea era un encabezado; produce una línea de texto. No sabe que una tabla es una tabla; produce el contenido de las celdas en el orden en que las escaneó, que para una tabla es a menudo el orden equivocado, y lo anuncia sin ninguna indicación de a qué columna pertenece un número. No puede escribir texto alternativo para una fotografía, porque no sabe de qué es la fotografía.
Así que el OCR es el primer paso necesario para un escaneo, y después el documento sigue sin tener nada de la estructura que lo hace utilizable. Tratar "le hemos pasado el OCR" como "lo hemos hecho accesible" es la manera en que las organizaciones acaban creyendo que un archivo documental cumple la norma cuando no la cumple.
Comprobar un documento con honestidad
Parte de esto se puede comprobar rápidamente, y merece la pena hacerlo antes de dar por bueno un archivo.
- ¿Hay algo de texto? Intenta seleccionar una frase. Si no se selecciona nada, la página es una imagen y necesita OCR antes que nada. Extraer el texto de un PDF responde a la misma pregunta: un resultado vacío significa que no hay capa de texto.
- ¿Es correcto el orden de lectura? Selecciona todo el texto de una página compleja y pégalo en un editor de texto plano. Lo que obtienes se parece mucho al orden que usará un lector de pantalla. Si una página a dos columnas sale entrelazada, el orden de lectura es incorrecto por bien que se vea.
- ¿Está etiquetado? Los lectores de escritorio lo muestran en las propiedades del documento, normalmente como "PDF etiquetado: sí/no". Un no es definitivo; un sí solo significa que existen etiquetas, no que sean correctas.
- ¿Está definido el idioma? El editor de metadatos muestra las propiedades a nivel de documento registradas en el archivo.
Los verificadores automáticos son útiles y limitados de una forma concreta: comprueban que las estructuras estén presentes y bien formadas, no que sean correctas. Un verificador no puede decirte que un encabezado se etiquetó como párrafo, ni que el texto alternativo de una fotografía dice "image1.jpg". Eso necesita a una persona.
Qué pueden y qué no pueden hacer las herramientas de navegador al respecto
Siendo francos sobre los límites: iBuildPDF no hace accesibles los PDF, y ninguna herramienta que solo edite un archivo existente puede hacerlo realmente. La accesibilidad se decide en gran medida donde se redacta el documento: un estilo de encabezado aplicado en un procesador de textos se convierte en una etiqueta de encabezado al exportar; el texto escrito dentro de un cuadro de texto se convierte en un fragmento sin etiquetar. Exportar correctamente desde el origen vale más que cualquier cosa que se haga después.
Lo que sí pueden hacer las herramientas de aquí es el trabajo previo y el diagnóstico:
- El OCR da a un escaneo una capa de texto, que es el requisito previo para todo lo demás.
- Extraer texto te muestra lo que ve realmente una máquina, incluido el orden de lectura.
- PDF a Word lleva un documento a un editor donde se pueden aplicar correctamente los encabezados, el texto alternativo y la estructura de las tablas, y volver a exportarlo.
- El editor de metadatos expone las propiedades a nivel de documento, incluido el título que la tecnología de apoyo anuncia primero.
Hay dos operaciones que empeoran activamente la accesibilidad, y ambas se hacen a veces por buenos motivos: convertir las páginas en imágenes destruye por completo la capa de texto, y aplanar elimina la estructura interactiva de los campos de formulario. Ninguna está mal, pero ninguna debería hacerse a un documento que alguien necesita leer con tecnología de apoyo.
Si un documento tiene un requisito legal o contractual de accesibilidad, las normas con las que trabajar son PDF/UA (ISO 14289) y las técnicas para PDF publicadas junto a las WCAG, ambas enlazadas más abajo.
Herramientas que cubre este artículo
Fuentes
Documentación primaria de las afirmaciones anteriores.