¿Este PDF está escaneado o es texto?
¿Cómo sé si un PDF está escaneado?
Guarda tus herramientas favoritas
Crea una cuenta gratuita de iBuildPDF para guardar tus herramientas favoritas y encontrarlas rápido cuando quieras.
Cuenta gratuita. Las herramientas PDF nunca necesitan una.
Respuesta breve
Intenta seleccionar una palabra con el cursor. Si el texto se resalta, el archivo contiene texto real. Si en su lugar arrastras un recuadro sobre una imagen, la página es una fotografía y el archivo no contiene texto en absoluto. Los dos casos son idénticos en pantalla y se comportan de forma completamente distinta en cualquier herramienta que les apliques.
La prueba de los dos segundos
Abre el archivo e intenta arrastrar el cursor para seleccionar una palabra.
- La palabra se resalta: hay una capa de texto. La búsqueda, la copia y la conversión funcionarán todas.
- En su lugar se arrastra un rectángulo por la página sin seleccionar nada: la página es una sola imagen. No hay texto que encontrar.
Una segunda comprobación: pulsa Ctrl+F (Cmd+F) y busca una palabra que veas claramente. Que no haya coincidencia con una palabra visible significa que no hay capa de texto.
La misma página, con y sin texto
- Un PDF digital. En pantalla, indistinguible del de la derecha.
- Por debajo: códigos de carácter, cada uno con una fuente y una posición. Buscable, seleccionable, convertible.
- Un PDF escaneado. La misma página, y la misma apariencia.
- Por debajo: una cuadrícula de muestras claras y oscuras. Sin letras, sin palabras, nada que buscar.
Las dos páginas de arriba son la misma página, e indistinguibles en pantalla. Por debajo, una es una secuencia de códigos de carácter con posiciones y una fuente; la otra es una cuadrícula de muestras claras y oscuras que a un ojo humano le parece escritura. Nada en la segunda sabe que contiene letras.
Si prefieres no forzar la vista: pasa el archivo por PDF a texto. Un archivo escaneado vuelve vacío o casi, y esa es tu respuesta.
Por qué lo cambia todo a partir de ahí
Casi toda queja sobre herramientas de PDF se remonta a esta distinción.
- Conviertes a Word y obtienes fotografías. No es un fallo, y no es algo que arreglaría un conversor mejor: no había texto en el archivo que convertir. El conversor trasladó fielmente lo que había, que eran dos imágenes.
- La búsqueda no encuentra nada, ni en el archivo ni en ningún sistema que lo indexe.
- Copiar y pegar no da nada.
- La compresión se comporta de otro modo. Un escaneado son datos de imagen, así que responde bien a la compresión de imagen y nada a los trucos que reducen el texto; por eso algunos archivos se niegan a encoger y los escaneados normalmente sí lo hacen.
- La censura es otro trabajo. No hay texto que eliminar, solo píxeles que pintar encima; pero la imagen original sigue debajo a menos que la herramienta reconstruya la página.
- Los lectores de pantalla no obtienen nada en absoluto. Para una tecnología de asistencia, un documento escaneado es una página en blanco.
Qué hace el OCR al respecto
El reconocimiento óptico de caracteres mira la imagen, averigua qué formas son letras y escribe una capa de texto debajo de la imagen. La página sigue viéndose exactamente igual —sigues viendo el escaneado— pero ahora hay texto buscable, seleccionable y copiable colocado de forma invisible detrás.
Esa es la operación que hace OCR PDF, y es el paso que tiene que ir primero. Aplica OCR, y luego convierte, busca o extrae; las herramientas que eran inútiles con el original funcionarán sobre el resultado.
Elegir el idioma correcto importa más de lo que la gente espera. El OCR decide entre formas parecidas usando un modelo de qué aspecto tienen las palabras en un idioma concreto, así que indicarle uno equivocado aumenta los errores de forma medible; y para el árabe, el chino o el griego, un ajuste equivocado produce sinsentido en lugar de simples errores.
Lo que el OCR no arregla
El OCR es reconocimiento, y el reconocimiento puede equivocarse. Es muy bueno con un escaneado limpio, recto y a 300 DPI de texto impreso corriente. Empeora con todo lo demás, y no te avisa cuando está adivinando.
- La letra manuscrita se le escapa casi por completo.
- Los escaneados de baja resolución —por debajo de unos 200 DPI— pierden el detalle que distingue letras parecidas.
- Las páginas torcidas, con sombras o fotografiadas salen mucho peor que los escaneados planos.
- Las tablas y las maquetas a varias columnas pueden leerse en el orden equivocado, porque el orden de lectura hay que inferirlo por la posición.
- Los sellos, firmas y anotaciones manuscritas sobre texto impreso confunden las formas de las letras que quedan debajo.
Así que trata un resultado de OCR como una copia buscable, no como una transcripción verificada. Para cualquier cosa en la que un dígito equivocado importe —el total de una factura, una dosis, una referencia legal— compara el texto reconocido con la imagen antes de confiar en él. ¿OCR o PDF a Word? explica cuál de los dos quieres en realidad.
Herramientas que cubre este artículo
Fuentes
Documentación primaria de las afirmaciones anteriores.