Extraer el texto de un PDF

Obtén todo lo que dice un PDF como texto plano que puedes buscar, pegar o editar.

Seleccionar un archivo PDF

o arrástralos y suéltalos aquí

Formatos admitidos: PDF

Privado: se procesa en tu dispositivoTu archivo nunca sale de tu navegador.

Datos rápidos

Qué hace
Extrae la capa de texto de un PDF y la devuelve como un archivo de texto plano.
Entrada
PDF
Salida
TXT
Procesamiento
En tu navegador
¿Se suben los archivos?
No
¿Hace falta cuenta?
No
Ideal para
Sacar las palabras de un informe para citarlas, buscarlas o pegarlas en otro sitio.
Limitación principal
Lee el texto que ya está guardado en el archivo. Un PDF escaneado que solo son imágenes de las páginas no tiene capa de texto, y esta herramienta no puede crearla: para eso hace falta OCR.

Cómo usar esta herramienta

  1. Sube tu PDF.
  2. Elige si quieres conservar los saltos de página y los marcadores de página.
  3. Previsualiza el texto extraído.
  4. Descárgalo como archivo .txt, o cópialo.

Por qué usar iBuildPDF

Copiar el texto de un PDF a mano produce saltos de línea rotos, espacios que faltan y párrafos perdidos. Leer bien la capa de texto te da algo con lo que de verdad puedes trabajar.

Cómo funciona

Se lee directamente la capa de texto de cada página, usando las posiciones de palabras y líneas para reconstruir el espaciado y los saltos de línea. No se reescribe ni se adivina nada: si el documento tiene capa de texto, esto es lo que dice.

Preguntas frecuentes

No ha salido nada, ¿por qué?

Tu PDF es casi con seguridad un escaneado: una imagen de una página sin ninguna capa de texto. No hay nada que extraer hasta que la página pase por un reconocimiento de texto. Eso es lo que hace el OCR, y es otra herramienta.

¿Conserva el diseño?

Conserva el orden de lectura, los párrafos y los saltos de línea. No conserva las columnas, las tablas ni los estilos: el texto plano no tiene forma de expresar eso. Si necesitas el diseño, la conversión adecuada es PDF a Word.

¿Por qué extraer el texto de mi escaneado no devolvió nada?

Porque no hay texto que extraer. Una página escaneada o una foto guardada como PDF es una imagen, y la extracción lee objetos de texto reales, no reconoce letras dentro de una imagen. Convertir una imagen de palabras en texto de verdad requiere OCR, que es otra tecnología y que este sitio no ofrece por ahora. Tu archivo no está roto: simplemente no tiene capa de texto.

¿El texto extraído conserva el diseño original?

No de forma fiable, y esto pilla desprevenida a la gente. Un PDF coloca el texto por coordenadas en lugar de guardar los párrafos, columnas o tablas como estructuras, así que la extracción tiene que deducir el orden de lectura a partir de la posición. Los diseños a dos columnas se pueden entremezclar, y las celdas de una tabla pueden acabar juntas en una misma línea. La extracción es la herramienta adecuada para conseguir las palabras; es la herramienta equivocada para conservar el aspecto de la página.

¿Cómo sé si mi PDF tiene texto real?

Ábrelo en cualquier lector de PDF e intenta seleccionar unas palabras con el cursor. Si se resaltan letras sueltas y puedes copiarlas, el texto es real y la extracción funcionará. Si al arrastrar se selecciona la página entera como un bloque, o no se resalta nada, es una imagen y estás ante un escaneado: ninguna herramienta de extracción encontrará texto ahí sin pasar antes por OCR.

Más información sobre esto