Cómo sacar el texto y las imágenes de un PDF
¿Cuál es la mejor forma de sacar contenido de un PDF?
Guarda tus herramientas favoritas
Crea una cuenta gratuita de iBuildPDF para guardar tus herramientas favoritas y encontrarlas rápido cuando quieras.
Cuenta gratuita. Las herramientas PDF nunca necesitan una.
Respuesta breve
Depende de qué quieras hacer con él después. Para las palabras, extrae el texto. Para las páginas como imágenes, renderízalas. Para un escaneado, reconoce primero el texto: no hay nada que extraer hasta que lo hagas. Para algo que vayas a seguir editando, convierte a Word. Cada opción da algo genuinamente distinto, y elegir según lo que necesites a continuación te ahorra deshacer la equivocada.
Conseguir las palabras
Extraer el texto de un PDF lee la capa de texto y te da texto plano. Sin formato, sin imágenes, sin diseño: solo las palabras, que es justo lo que quieres cuando vas a citar, buscar, traducir o pegar en otra cosa.
Lo que recibes de vuelta lo determina cómo se hizo el PDF, y hay dos cosas con las que conviene contar:
- El orden de lectura es el orden en que se dibujó el texto, lo que en una página de varias columnas puede intercalarlas. Esto es una propiedad del archivo y no un fallo de la extracción; consulta qué hace que un PDF sea accesible, donde el mismo asunto decide si un lector de pantalla puede leer un documento.
- Un resultado vacío significa que no hay texto. No que la extracción haya fallado, sino que la página es una imagen. Esta es la forma más rápida de averiguar si un documento es un escaneado.
Conseguir imágenes de las páginas
PDF a JPG y PDF a PNG renderizan cada página tal como aparece y te dan una imagen por página. Eso es lo que quieres para una miniatura, una vista previa, una diapositiva o cualquier sitio donde sea más fácil colocar una imagen que un PDF.
Elige el formato según lo que haya en la página: JPG para escaneados y fotografías, PNG para texto, diagramas y dibujo lineal, donde los artefactos de JPG caen justo sobre la forma de las letras. JPG o PNG para un PDF entra en el porqué.
Ten claro el intercambio antes de nada: renderizar una página destruye su texto. El resultado son píxeles: no se puede buscar, no se puede seleccionar, un lector de pantalla no lo puede leer, normalmente ocupa más y no se puede revertir. Correcto para una imagen de una página; equivocado para un documento que alguien necesita leer o reutilizar.
Una pregunta relacionada que esto no responde: estas herramientas renderizan páginas enteras, no las fotografías individuales incrustadas dentro de ellas. Si necesitas las imágenes originales tal como estaban guardadas, esa es otra operación y la respuesta suele ser una herramienta de escritorio.
Elegir, y el caso del escaneado
Si el PDF es un escaneado, empieza por el OCR. Una página escaneada no tiene texto dentro, así que extraer texto no devuelve nada y convertir a Word devuelve fotografías. El OCR reconoce los caracteres y añade una capa de texto real; todo lo demás se vuelve posible después. El reconocimiento nunca es perfecto y hay que revisarlo, y recupera las palabras, no el diseño.
Cuatro salidas, y qué te da cada una
- Texto sin formato. Rápido y exacto, y no conserva nada del diseño.
- Imágenes de las páginas. Se conserva todo y nada se puede seleccionar.
- OCR, para un escaneado. Texto reconocido, con los errores de reconocimiento que eso implica.
- Un documento editable. El más útil y el menos fiel, porque la estructura hay que inferirla.
Por lo demás, elige según el destino:
- Quiero citarlo o buscar en él → extraer texto.
- Quiero seguir editándolo → PDF a Word, y lee antes convertir sin perder el formato, porque el diseño va a requerir atención.
- Quiero la tabla como datos → PDF a Excel, que extrae tablas en lugar de texto. Necesita una tabla de verdad con celdas trazadas para poder trabajar.
- Quiero una imagen de la página → PDF a JPG o PDF a PNG.
- Solo quiero una parte del documento → extraer páginas primero. Menos que convertir, menos que revisar.
La extracción de texto y el renderizado de páginas se ejecutan los dos en tu navegador. Las conversiones a Word y a Excel se ejecutan en nuestro servidor: el archivo se envía por una conexión cifrada, se conserva solo mientras se convierte y se elimina después.
Herramientas que cubre este artículo
Fuentes
Documentación primaria de las afirmaciones anteriores.