OCR y extracción de texto de PDF
Haz que un documento escaneado se pueda buscar, o extrae su texto.
¿Cuál necesitas?
- Un PDF que ya tiene capa de texto y quieres sacar las palabras. Extraer texto las lee directamente, en tu navegador, sin adivinar nada.
- Un escaneado o la fotografía de una página. No hay texto dentro que extraer. Primero necesita OCR, que lee los píxeles y deduce qué caracteres son; después el resultado ya se puede extraer, buscar y copiar.
Cómo saber cuál de los dos tienes
Abre el archivo e intenta seleccionar una línea de texto con el ratón. Si una selección azul limpia sigue las palabras, hay capa de texto y la extracción funcionará. Si no pasa nada, o si seleccionas un rectángulo que cubre la página entera como si fuera una sola foto, es un escaneado.
El aspecto no te dice nada: el escaneado de una página impresa en láser puede verse más limpio en pantalla que un documento digital auténtico. Solo la prueba de la selección es fiable, y lleva dos segundos.
Un documento también puede ser en parte las dos cosas: un informe de origen digital con un anexo escaneado grapado al final es muy habitual, y extrae perfectamente durante cuarenta páginas y luego no devuelve nada.
El error que comete la gente
Fiarse del resultado del OCR sin leerlo. El OCR es una conjetura muy buena y sigue siendo una conjetura. Los caracteres que más confunde son justo los que más importan: 0 y O, 1 y l y I, 5 y S, 8 y B. Un dígito mal leído en un número de referencia o en un importe no parece mal en ningún sitio —la frase sigue leyéndose con normalidad—, así que sobrevive a una revisión que sí habría pillado una palabra mal escrita. Comprueba las cifras una a una contra el original.
Vale la pena leer esto antes de empezar
Las tres cosas que la gente más suele lamentar no haber sabido antes de un trabajo de este tipo.