OCR frente a convertir un PDF a Word
¿Qué diferencia hay entre el OCR y convertir un PDF a Word?
Guarda tus herramientas favoritas
Crea una cuenta gratuita de iBuildPDF para guardar tus herramientas favoritas y encontrarlas rápido cuando quieras.
Cuenta gratuita. Las herramientas PDF nunca necesitan una.
Respuesta breve
El OCR mira los píxeles de una página escaneada y deduce qué caracteres representan. Convertir un PDF a Word toma el texto que ya está guardado en el archivo y lo reconstruye como documento editable. Si tu PDF es un escaneado, no hay texto que convertir, así que solo el OCR puede ayudar, y iBuildPDF no tiene herramienta de OCR.
Dos tipos de PDF que parecen idénticos
Casi toda la confusión sobre el OCR viene de un hecho: un PDF puede guardar una página de dos formas completamente distintas, y en pantalla las dos se ven igual.
La misma página, con y sin texto
- Un PDF digital. En pantalla, indistinguible del de la derecha.
- Por debajo: códigos de carácter, cada uno con una fuente y una posición. Buscable, seleccionable, convertible.
- Un PDF escaneado. La misma página, y la misma apariencia.
- Por debajo: una cuadrícula de muestras claras y oscuras. Sin letras, sin palabras, nada que buscar.
El primer tipo tiene capa de texto. El archivo contiene objetos de texto reales: una cadena de caracteres, una fuente, un tamaño y unas coordenadas que indican en qué punto de la página se dibuja cada trozo. La página es un conjunto de instrucciones para pintar letras. Un programa puede volver a leer esos caracteres exactamente, porque nunca fueron otra cosa que caracteres.
El segundo tipo son imágenes de página. Es lo que produce un escáner, la cámara de un teléfono o un fax: cada página es una fotografía envuelta en un PDF. No hay texto en ninguna parte del archivo. Lo que parece la letra "e" es un patrón de píxeles oscuros que un ojo humano reconoce como una "e"; para el software no se diferencia de la foto de un gato.
La prueba de dos segundos
Intenta seleccionar una palabra arrastrando sobre ella en cualquier visor. Si se resaltan palabras sueltas, el archivo tiene capa de texto. Si en cambio el cursor dibuja un rectángulo —un recuadro de selección, no una selección de texto—, no hay capa de texto y estás ante una imagen.
Dos herramientas de aquí lo confirman sin conjeturas. Contar páginas indica si el documento tiene capa de texto. PDF a texto no devuelve nada útil con un escaneado: normalmente un resultado vacío, a veces alguna línea suelta que añadió el software de escaneo. Ese resultado vacío no es un error; es la respuesta correcta a "¿qué texto hay en este archivo?".
Los documentos pueden ser mixtos. Un contrato escrito en un procesador de textos y después firmado y escaneado puede tener capa de texto en la mayoría de las páginas y ninguna en la escaneada. Comprueba la página que te interesa.
Qué hace el OCR
OCR son las siglas en inglés de reconocimiento óptico de caracteres. Toma una imagen, localiza las zonas que parecen texto, las divide en líneas y luego en formas de caracteres individuales, y compara cada forma con un modelo de cómo son los caracteres. Para cada carácter emite la mejor hipótesis y una cifra de confianza: lo seguro que está.
La palabra importante es hipótesis. El OCR no recupera el texto original, porque el texto original no está en el archivo. Produce un texto nuevo que cree que coincide con la imagen: normalmente muy bueno, a veces equivocado, y nada en el resultado te dice cuál es cuál a menos que inspecciones los valores de confianza.
La precisión depende de cosas que, en su mayoría, puedes ver tú mismo:
- La calidad del escaneado. Resolución, contraste, inclinación, sombras de la cámara de un teléfono, ruido de un escáner barato y texto fotocopiado unas cuantas veces de más.
- El idioma y la tipografía. Hay que decirle al motor qué idioma debe esperar; el modelo equivocado produce disparates con mucha seguridad. Las fuentes poco habituales y la escritura a mano son mucho más difíciles que la prosa impresa normal.
- El diseño. Aquí es donde el OCR falla más a menudo. El orden de lectura hay que deducirlo de la posición, así que una página a dos columnas puede volver con las columnas entremezcladas línea a línea. Las tablas son peores: los límites de las celdas pueden ser líneas o simplemente espacio en blanco, y una tabla suele llegar como un flujo de números con las filas y las columnas perdidas.
El motor de código abierto estándar es Tesseract, que es lo que usan por debajo la mayoría de las herramientas de OCR gratuitas y autoalojadas. Sea cual sea el motor que uses, trata el resultado como un borrador: revísalo, y fíjate especialmente en los dígitos y en los pares de caracteres que se parecen impresos.
Qué hace una conversión de PDF a Word
Un conversor de PDF a Word hace algo bastante distinto. Lee los objetos de texto que ya están en el archivo, junto con sus fuentes y coordenadas, y reconstruye a partir de ellos un documento editable.
Los caracteres se conocen con exactitud: se guardaron como caracteres. Lo que hay que deducir es la estructura, porque una página de PDF dice "dibuja esta cadena en esta posición", no "esto es un párrafo" o "esta es la segunda celda de la fila cuatro". Así que el conversor infiere:
- los párrafos, a partir de líneas que comparten fuente y mantienen un interlineado y una sangría coherentes;
- los títulos y los énfasis, a partir de fuentes más grandes o más gruesas;
- las listas, a partir de viñetas o números repetidos con sangría francesa;
- las tablas, a partir de líneas de trazado o de texto que se alinea en columnas a lo largo de la página.
Esa inferencia también es una hipótesis, pero distinta de la del OCR. Un conversor puede equivocarse sobre dónde termina un párrafo; no se equivoca sobre qué letras hay dentro.
Pasa un conversor por un escaneado y falla por una razón sencilla: no hay nada que convertir. No lee píxeles, así que no encuentra texto y produce o bien un documento vacío, o bien un archivo de Word con una imagen a página completa por cada página: no más editable de lo que era el PDF.
Cuál necesitas
El camino de decisión es corto:
- Intenta seleccionar una palabra en el PDF.
- Si se resaltan palabras, necesitas una conversión. El texto está ahí; lo que quieres es tenerlo en un formato editable.
- Si te sale un recuadro de selección, necesitas OCR primero. La conversión no tiene nada con lo que trabajar hasta que el OCR haya creado una capa de texto.
- Si solo quieres las palabras —para citarlas, buscarlas o pegarlas—, con PDF a texto basta; no necesitas ningún archivo de Word.
| OCR | Conversión de PDF a Word | |
|---|---|---|
| Entrada | Un escaneado o una fotografía: páginas sin capa de texto | Un PDF que ya tiene capa de texto |
| Qué lee | Píxeles | Objetos de texto y sus coordenadas |
| Salida | Texto reconocido, con una cifra de confianza por carácter | Un documento editable con párrafos, estilos y tablas deducidos |
| Fallo principal | Caracteres mal leídos y pérdida del orden de lectura en tablas y páginas a varias columnas | Estructura equivocada —párrafos fusionados, tablas rotas— y fallo total con un escaneado, porque no hay texto que leer |
Si no estás seguro de cómo se produjo un archivo, sus propios metadatos suelen decirlo. El campo de productor a menudo nombra el escáner o la aplicación que escribió el PDF: consulta qué contienen los metadatos de un PDF.
Qué puede y qué no puede hacer iBuildPDF aquí
Dicho claramente: iBuildPDF no puede hacer por ti ninguna de las dos mitades de este trabajo.
En este sitio no hay herramienta de OCR. Ninguna de las herramientas reconoce caracteres dentro de una imagen. PDF a texto extrae una capa de texto que ya existe; no puede crearla. Con un PDF escaneado no devuelve nada, y ningún ajuste cambia eso.
El conversor de PDF a Word no está disponible. Figura como "próximamente" y está desactivado, igual que las entradas de PDF a Excel y PDF a PowerPoint. No planifiques tu trabajo contando con ellas.
Qué hacer en su lugar, en el orden que merece la pena probar:
- Pídele el original a quien te lo envió. Si alguien escaneó un documento que había escrito, el archivo de origen sigue existiendo, y será más exacto que cualquier cosa que puedan reconstruir el OCR o una conversión.
- Usa una herramienta de OCR específica. Tesseract es gratuito y está disponible en muchas distribuciones; los productos comerciales suelen manejar mejor las tablas y los escaneados malos. Elige uno que te deje indicar el idioma.
- Mejora antes el escaneado. Volver a escanear con más DPI, la hoja plana y recta y con buen contraste hace más por la precisión que cualquier procesado posterior.
- Comprueba con contar páginas antes de empezar, para saber qué problema tienes realmente.
Herramientas que cubre este artículo
Fuentes
Documentación primaria de las afirmaciones anteriores.