Por qué una tabla de un PDF sale mal en Excel
¿Por qué mi tabla sale hecha un desastre al convertir un PDF a Excel?
Guarda tus herramientas favoritas
Crea una cuenta gratuita de iBuildPDF para guardar tus herramientas favoritas y encontrarlas rápido cuando quieras.
Cuenta gratuita. Las herramientas PDF nunca necesitan una.
Respuesta breve
Porque la tabla nunca estuvo en el archivo. Un PDF registra cada fragmento de texto en una posición de la página, y las líneas de trazado como instrucciones de dibujo independientes que no están unidas a nada. No se guarda ninguna fila, ninguna columna ni ninguna celda. Un conversor tiene que deducir dónde estaban las columnas a partir de cómo se alinean los valores, así que un encabezado combinado, un valor que se ha partido en dos líneas o una tabla sin líneas alrededor pueden mover los límites y desplazar los datos a las celdas equivocadas. Cuando eso pasa no hay nada corrupto: la información que el conversor necesitaba no se registró en ningún momento.
En el archivo no hay ninguna tabla
Esta es la parte que conviene creer antes que ninguna otra, porque todas las demás sorpresas salen de ella.
La misma página, como la ve quien lee y como la guarda el archivo
- Lo que ves: filas, columnas y celdas, con líneas que hacen evidente la estructura.
- Lo que registra el archivo: cada valor como su propio fragmento de texto en su propia posición de la página. Nada une entre sí los tres valores de una fila.
- Las líneas de trazado son instrucciones de dibujo, como cualquier otra marca de la página. No están unidas al texto, y una tabla dibujada sin ellas se guarda igual.
Cuando un procesador de textos o una hoja de cálculo exporta un PDF, dibuja la tabla. Escribe INV-1001 en una posición, 2026-01-04 en otra, 1,240.00 en una tercera, y después dibuja unas líneas. Las líneas son instrucciones de dibujo como cualquier otra: la misma maquinaria que dibujó un logotipo o un subrayado. Nada en el archivo dice que esos tres valores pertenezcan a una misma fila, ni que la línea que hay entre dos de ellos sea el límite de una columna y no un filete decorativo.
Es fácil de comprobar. Toma una página con dos tablas, una con líneas de trazado y otra sin ellas, y pregúntale a cualquier extractor de texto qué hay en la página. Las dos vuelven como lo mismo: una lista de valores, uno detrás de otro, más o menos en el orden en que se dibujaron. La tabla trazada y la que no lo está son indistinguibles en la salida, porque las líneas nunca formaron parte de los datos.
Un PDF puede llevar estructura de verdad: el PDF etiquetado registra qué marcas son una tabla, una fila y una celda, sobre todo para los lectores de pantalla. Es opcional, la mayoría de las exportaciones no la producen, y la mayoría de las que sí lo hacen la producen de forma imperfecta. Qué hace accesible a un PDF explica qué es el etiquetado y por qué hay tan poco en circulación.
Así que, cuando un conversor te entrega una hoja de cálculo, no ha leído una tabla del documento. Ha mirado dónde cayó el texto y ha propuesto una interpretación.
Qué está adivinando el conversor en realidad
Dos cosas, y la segunda es mucho más difícil que la primera.
De dónde salen los límites de columna y qué los mueve
- Los límites se deducen, no se leen: una franja de blanco que recorre la tabla de arriba abajo se toma por el borde de una columna.
- Un valor lo bastante largo para cruzar esa franja la cierra, y el límite que dependía de ella se mueve o desaparece.
- El texto que se ha partido dentro de su celda se apoya en una línea base nueva, así que se lee como una fila nueva con todas las demás celdas vacías.
Las filas suelen ser fáciles: el texto que se apoya aproximadamente en la misma línea base es una fila. Esto funciona casi siempre, y es la razón de que una tabla sencilla se convierta bien.
Las columnas hay que deducirlas de los huecos verticales: los canales de blanco que recorren la página de arriba abajo y por donde nunca pasa texto. Encuentra una franja de blanco que esté despejada desde la parte de arriba de la tabla hasta la de abajo y ese es el límite de una columna. Es una buena heurística. Esto es lo que la rompe:
- Un valor lo bastante largo para cerrar el canal. Una descripción larga o un número grande con separadores pueden cruzar la franja que definía el límite, y todas las filas de debajo pueden leerse como si tuvieran una columna menos.
- Texto que se ha partido dentro de una celda. La segunda línea se apoya en su propia línea base, así que se lee como una fila aparte, y las celdas que tiene al lado están vacías: así es como una tabla de 40 filas llega con 60 dentro.
- Encabezados combinados o que abarcan varias columnas. Un título centrado sobre tres columnas no se alinea con ninguna de ellas, y puede arrastrar la fila de encabezado fuera de la alineación de todo lo que hay debajo.
- Números alineados a la derecha junto a texto alineado a la izquierda. El canal no es recto, así que sus bordes son difusos y el límite acaba en un sitio distinto según qué filas se tomen como muestra.
- Una tabla que continúa en la página siguiente. Cada página se reconstruye con sus propias pruebas, así que un encabezado repetido se convierte en una fila de datos en medio, y los límites de columna encontrados en la página dos no tienen por qué coincidir con los de la página uno.
Nada de esto es un defecto de un conversor concreto. Es un problema de reconstrucción, y las reconstrucciones a veces se equivocan.
Qué hace PDF a Excel en este sitio
PDF a Excel es un extractor de tablas. Eso no es un detalle de cómo está construido, es lo que la herramienta es, y saberlo ahorra mucha confusión:
- Busca estructura tabular y escribe lo que encuentra en un libro de Excel. No intenta reproducir la página.
- La prosa no es una tabla, así que la prosa no sale. Una página de párrafos no produce nada, y esa es la respuesta correcta, no un fallo.
- Se ejecuta en el servidor de procesamiento de este sitio, no en tu navegador: es uno de los trabajos que un navegador realmente no puede hacer. El archivo se sube, se convierte y se elimina al terminar; la nota de la página de la herramienta dice qué pasa con él.
Dos herramientas relacionadas son a menudo la mejor opción:
- PDF a Word intenta reconstruir la página: el diseño, los títulos y las tablas como tablas de Word. Si lo que quieres es el documento y no los números, empieza por ahí. Convertir un PDF a Word sin perder el formato explica qué sobrevive.
- Extraer texto se ejecuta en tu navegador y te da el texto en bruto, sin ninguna reconstrucción. Para una tabla pequeña, pegar eso en una hoja de cálculo y separarlo tú mismo suele ser más rápido que discutir con un conversor, y ves exactamente con qué estás trabajando.
Cuando dice que no había nada que extraer
Este mensaje significa que el conversor se ejecutó, leyó las páginas y no encontró estructura tabular. Es una respuesta real, y suele tener tres motivos.
La página es una imagen. Un escaneado, una fotografía o una captura de pantalla pegada en un documento no tienen texto dentro: solo píxeles con aspecto de texto. No hay nada que un extractor pueda situar, así que no hay nada que encontrar. Pasa primero el OCR para añadir una capa de texto y después convierte. ¿Este PDF está escaneado o es texto? enseña a distinguirlo en unos segundos, y ¿OCR o PDF a Word? explica cuál necesitas.
Lo que estás mirando no es una tabla. Una lista con números alineados, un formulario o un diseño a dos columnas pueden parecerle una tabla a quien lee y no presentarle ninguna estructura de tabla a un extractor. Extraer texto es la herramienta adecuada para eso.
La tabla está maquetada de forma holgada. Un espaciado ancho e irregular, sin canales constantes, no le da a la heurística nada a lo que agarrarse. Convertir solo esa página a veces funciona cuando convertir el documento entero no funcionó, porque las pruebas ya no se promedian entre páginas que no se ponen de acuerdo.
Conseguir un mejor resultado
- Vuelve al origen si existe. Si el PDF salió de una hoja de cálculo, esa hoja de cálculo todavía tiene las filas y las columnas de verdad. Toda conversión es una reconstrucción; el original no lo es.
- Convierte las páginas que tienen la tabla, no el documento entero. Usa primero extraer páginas. Menos páginas significan menos pruebas en conflicto, y averiguas enseguida si el problema es una sola página incómoda.
- Comprueba el resultado contra el PDF antes de usarlo. Compara el número de filas y suma una columna. Los errores silenciosos —una columna desplazada, una fila que se ha fundido con la de arriba— son los que hacen daño, porque nada parece roto.
- Si el diseño no tiene remedio, extrae el texto. Extraer texto más el «texto en columnas» de Excel te da el control del reparto, y para una tabla de menos de unas docenas de filas suele ser más rápido.
- Las páginas escaneadas necesitan OCR, y el OCR de una tabla es doblemente una conjetura: primero qué es cada carácter y después dónde estaban las columnas. Comprueba las cifras una por una; un 6 leído como un 8 no parece mal en ninguna parte.
- Comprueba antes el número de páginas. Contar páginas e información del archivo también indica si el documento tiene capa de texto, lo que responde a la pregunta del escaneado antes de convertir nada.
Herramientas que cubre este artículo
Fuentes
Documentación primaria de las afirmaciones anteriores.