PDF a Excel

Saca las tablas de un PDF y llévalas a Excel.

Seleccionar un archivo PDF

o arrástralos y suéltalos aquí

Formatos admitidos: PDF

Procesamiento seguro en servidor: se elimina automáticamenteEsta herramienta requiere procesamiento en el servidor. Tu archivo se envía por una conexión cifrada al servidor de procesamiento de iBuildPDF, se conserva solo mientras dura la conversión y se elimina automáticamente después.

Datos rápidos

Qué hace
Encuentra las tablas que hay dentro de un PDF y las escribe en una hoja de cálculo como celdas de verdad, una hoja por documento.
Entrada
PDF
Salida
XLSX
Procesamiento
En nuestro servidor
¿Se suben los archivos?
Sí, temporalmente
¿Hace falta cuenta?
No
Ideal para
Recuperar cifras de un extracto, una factura o un informe para poder sumarlas en lugar de copiarlas a mano.
Limitación principal
Extrae tablas, no páginas. Un PDF de prosa corrida no produce nada, porque no hay nada con forma de tabla dentro: esa es una respuesta correcta, no un fallo. Las tablas dibujadas sin líneas son el caso más difícil y pueden volver con columnas fusionadas.

Cómo usar esta herramienta

  1. Elige un PDF que contenga una tabla.
  2. Haz clic en "Aplicar" para enviarlo a extraer por una conexión cifrada.
  3. Espera mientras se analizan las páginas en busca de estructura de tabla.
  4. Descarga el .xlsx y comprueba que las columnas han quedado donde esperas.

Por qué usar iBuildPDF

Esta es la conversión menos predecible del sitio y conviene saber por qué antes de intentarla. Los PDF no contienen tablas. Contienen texto colocado en una página, y una tabla es algo que el ojo humano deduce de esa colocación. El extractor tiene que hacer la misma deducción, y lo bien que le salga depende por completo de cómo se construyó el PDF: una tabla exportada desde una hoja de cálculo se extrae casi a la perfección, mientras que una dibujada a mano con tabulaciones puede no reconocerse en absoluto.

Cómo funciona

Cada página se examina en busca de texto dispuesto en filas y columnas alineadas. Donde se encuentra esa estructura, se escribe en el libro como celdas; donde no, no se escribe nada. El archivo se procesa en nuestro servidor por una conexión cifrada y se elimina después.

Preguntas frecuentes

He obtenido un archivo vacío o un error que dice que no había nada que extraer.

Eso significa que no se reconoció ninguna tabla. Normalmente tiene una de dos causas: el PDF es un escaneado, así que no hay ningún texto que alinear en columnas —aplícale OCR primero—; o el contenido es prosa en lugar de datos tabulares, en cuyo caso Extraer el texto de un PDF es la herramienta que quieres.

Las columnas están fusionadas o divididas en los sitios equivocados.

Eso pasa con las tablas que no tienen líneas y tienen un espaciado irregular, donde el límite entre dos columnas es genuinamente ambiguo. Los datos están todos ahí: es más rápido dividir la columna en Excel que volver a teclear la página.

¿Funciona con una tabla que se extiende por varias páginas?

Cada página se extrae por separado, así que una tabla larga llega como bloques consecutivos en lugar de como un rango continuo. Quitar después las filas de encabezado repetidas suele ser la única limpieza necesaria.

¿Puede extraer de un extracto bancario escaneado?

Tal cual no: un escaneado no tiene capa de texto. Aplícale OCR primero y después extrae. La precisión después del OCR depende de lo limpio que estuviera el escaneado, así que comprueba las cifras contra el original.

Más información sobre esto