OCR y extracción de texto de PDF

Haz que un documento escaneado se pueda buscar, o extrae su texto.

Extraer el texto de un PDFSaca las palabras como texto planoHaz buscable un PDF escaneadoReconoce el texto de un escaneado

¿Cuál necesitas?

Cómo saber cuál de los dos tienes

Abre el archivo e intenta seleccionar una línea de texto con el ratón. Si una selección azul limpia sigue las palabras, hay capa de texto y la extracción funcionará. Si no pasa nada, o si seleccionas un rectángulo que cubre la página entera como si fuera una sola foto, es un escaneado.

El aspecto no te dice nada: el escaneado de una página impresa en láser puede verse más limpio en pantalla que un documento digital auténtico. Solo la prueba de la selección es fiable, y lleva dos segundos.

Un documento también puede ser en parte las dos cosas: un informe de origen digital con un anexo escaneado grapado al final es muy habitual, y extrae perfectamente durante cuarenta páginas y luego no devuelve nada.

El error que comete la gente

Fiarse del resultado del OCR sin leerlo. El OCR es una conjetura muy buena y sigue siendo una conjetura. Los caracteres que más confunde son justo los que más importan: 0 y O, 1 y l y I, 5 y S, 8 y B. Un dígito mal leído en un número de referencia o en un importe no parece mal en ningún sitio —la frase sigue leyéndose con normalidad—, así que sobrevive a una revisión que sí habría pillado una palabra mal escrita. Comprueba las cifras una a una contra el original.

Vale la pena leer esto antes de empezar

Las tres cosas que la gente más suele lamentar no haber sabido antes de un trabajo de este tipo.

Todos los artículos de la base de conocimientos

Categorías relacionadas