Cómo funciona

Por qué el texto copiado de un PDF sale ilegible

¿Por qué el texto que copio de un PDF se pega como un sinsentido?

Respuesta breve

Porque lo que un PDF muestra y lo que te puede entregar son dos mapas distintos. La página dibuja códigos numerados a través de una fuente, que es lo que hace que se vea bien; copiar necesita una segunda tabla que diga qué carácter representa cada código, y esa tabla es opcional. Cuando falta o está mal, la página es impecable y el portapapeles es galimatías, y por mucho que lo reintentes no cambia.

Un PDF dibuja glifos, no caracteres

El flujo de contenido de una página no contiene tu texto. Contiene números.

01 02 03 041A a B b23? ? ? ?4

Dos mapas, y solo uno de ellos es obligatorio

  1. La página guarda códigos, no letras. Por sí solos, estos números no significan nada.
  2. La fuente convierte cada código en un contorno. Este es el mapa que un PDF tiene que tener, y el que hace que la página se vea bien.
  3. Copiar necesita el otro mapa —de código a carácter Unicode— y un archivo se puede escribir sin él. Entonces no hay nada que entregar.
  4. Así que la página puede ser impecable y el portapapeles un sinsentido al mismo tiempo. No hay nada roto: una tabla nunca se escribió.

Cada número es un código. El recurso de fuente adjunto a la página corresponde ese código con un contorno: una forma que dibujar. Ese es el único mapa que un PDF está obligado a tener, porque es el único que hace falta para poner marcas en una página, y es la razón de que el documento se vea perfecto.

Copiar necesita el mapa en el otro sentido: este código significa el carácter U+0041, la A mayúscula. ISO 32000-1 prevé exactamente eso, como un CMap ToUnicode adjunto a la fuente. Es opcional. Un productor al que solo le importaba que el documento se imprimiera bien no tenía motivo para escribir uno, y nada en el archivo se queja de su ausencia.

Los subconjuntos empeoran el fallo. Cuando un productor incrusta solo los glifos que el documento usa de verdad, es libre de numerarlos como le apetezca, normalmente 1, 2, 3 en el orden en que fue encontrando los caracteres. Sin un mapa ToUnicode esos números no significan absolutamente nada; con uno, significan lo que diga. Por qué un PDF se ve distinto en otro ordenador trata los subconjuntos y las demás sorpresas que causan.

La consecuencia que conviene asimilar: esto es una propiedad del archivo, no de tu ordenador. Cambiar de lector, de sistema operativo, de ajustes de fuente o de destino al pegar no ayudará, porque todos ellos consultan la misma tabla que falta. También es la razón de que buscar dentro del documento no encuentre nada: el lector está comparando lo que escribiste contra ese mismo mapa roto.

Cuál de estos es el tuyo

El síntoma identifica la causa con bastante fiabilidad, y la causa decide si se puede hacer algo.

Lo que obtienesQué es¿Tiene arreglo?
No se selecciona nada; el cursor no se engancha a ninguna palabraNo hay texto. La página es una imagen.Sí, reconociéndolo: OCR
Todos los caracteres mal, de forma consistente: un alfabeto desplazado, o filas de recuadrosMapa ToUnicode ausente o incorrectoNo sobre el archivo. OCR, o volver a teclear
Casi todo bien, pero fi, fl y ffi desaparecen o se vuelven un carácter raroGlifos de ligadura sin correspondencia de caracteresSí: buscar y reemplazar después
Caracteres correctos, sin espacios: elzorrorápidoEl archivo no contiene ningún carácter de espacioA menudo, con otro extractor
Caracteres correctos, con espacios dentro de las palabras: z o r r oUn espaciado amplio entre letras en la maquetación que se lee como huecosA menudo, con otro extractor
Palabras correctas, orden equivocado: dos columnas entrelazadas, una nota al pie en mitad de una fraseLa extracción sigue el orden en que se escribieron las marcasA veces. Depende del archivo
Acentos despegados, o letras que se parten en dos caracteresSignos combinantes guardados aparte de sus letras baseSí: normalización Unicode

La primera fila es la que hay que descartar antes que nada, porque es común y no es el problema de este artículo. Si no se resalta nada cuando arrastras por la página, tienes un escaneado, y no hay texto que pueda salir ilegible.

1T e x t54 65 78 74234

La misma página, con y sin texto

  1. Un PDF digital. En pantalla, indistinguible del de la derecha.
  2. Por debajo: códigos de carácter, cada uno con una fuente y una posición. Buscable, seleccionable, convertible.
  3. Un PDF escaneado. La misma página, y la misma apariencia.
  4. Por debajo: una cuadrícula de muestras claras y oscuras. Sin letras, sin palabras, nada que buscar.

¿Este PDF está escaneado o es texto? cuenta cómo distinguirlos en un par de segundos.

Los espacios y el orden son otro problema

Estos dos producen una ruina de aspecto legible en lugar de un sinsentido, y tienen una causa distinta de la del mapa que falta.

Puede que no haya espacios en el archivo

Nada obliga a un PDF a contener caracteres de espacio. Una línea de texto se dibuja normalmente como una serie de cadenas con desplazamientos numéricos entre ellas, y el desplazamiento es lo que hace el hueco entre dos palabras. Si ese hueco es un espacio o no es un juicio que hace el extractor a partir de la anchura: demasiado generoso y las palabras se pegan, demasiado ansioso y las palabras se parten por la mitad. Esto es una heurística, y por eso dos herramientas discrepan sobre el mismo archivo sin que ninguna se equivoque.

El orden es el orden en que se dibujó

12345678123

Por qué dos columnas salen entrelazadas

  1. Dos columnas, dibujadas correctamente. Ves columnas por dónde están las marcas, no porque el archivo lo diga.
  2. El orden en que las marcas se escribieron realmente. Un motor de maquetación alterna a menudo entre marcos, y nada registra que esto eran columnas.
  3. Un extractor sigue ese orden, así que las columnas salen entrelazadas línea a línea. Un PDF etiquetado declara el orden de lectura real; uno sin etiquetar no tiene nada que consultar.

El flujo de contenido está en el orden en que la aplicación que lo produjo emitió las marcas. Un motor de maquetación que va recorriendo marcos de texto puede alternar entre dos columnas; una plantilla puede colocar el pie antes que el cuerpo; una tabla puede dibujarse celda a celda bajando por las columnas en vez de recorriendo las filas. Nada en un PDF corriente registra que estas marcas eran una columna, una nota al pie o una tabla: las columnas existen en tu lectura de la página, no en el archivo.

Los extractores lo compensan ordenando las marcas por posición, lo que resuelve bien las páginas sencillas a dos columnas y mal las maquetaciones complicadas. Un PDF etiquetado es la excepción: lleva un árbol de estructura que declara el orden de lectura real, y un extractor que lo respete acierta sin adivinar. Ese es uno de los beneficios prácticos de verdad del etiquetado, al margen del requisito de accesibilidad para el que suele existir; consulta qué hace accesible a un PDF.

Qué ayuda de verdad, por orden

  1. Prueba otro extractor antes que nada. PDF a texto se ejecuta en tu navegador sobre PDF.js y respeta los mapas ToUnicode allí donde existen. Si devuelve texto correcto, el archivo nunca fue el problema y sí lo era el comportamiento de copia de tu lector, que es un descubrimiento de dos minutos que merece la pena hacer antes que uno de dos horas.
  2. Si el mapa está roto, ninguna herramienta de capa de texto ayudará. Todos los extractores leen la misma tabla. Convertir a Word, a una hoja de cálculo o a texto plano la consultan todos, así que todos producen el mismo sinsentido en envoltorios distintos. Este es el punto en el que hay que dejar de probar herramientas.
  3. Ignora la capa de texto y lee la página como una imagen. Eso es el OCR: representar la página, reconocer las formas y escribir una capa de texto nueva. Es la única vía fiable para salir de un mapa roto, y tiene dos costes: el reconocimiento comete sus propios errores, y la herramienta se ejecuta en un servidor, así que el documento se sube. Para un archivo confidencial eso es una decisión, no un clic.
  4. Si es cuestión de espaciado o de orden, extrae y arregla. Una pasada de buscar y reemplazar sobre el texto extraído normalmente arregla las ligaduras y las palabras pegadas más rápido que cualquier herramienta. Para un documento en el que tengas que seguir trabajando, PDF a Word te da algo editable que reparar; también es del lado del servidor, y qué puede y qué no puede recuperar merece una lectura antes.
  5. Si el que produce el archivo eres tú, arréglalo en el origen. Exporta en lugar de imprimir a PDF, incrusta las fuentes y etiqueta el documento. Un archivo exportado desde un procesador de textos actual casi siempre se copia bien, y los que no, suelen ser los que pasaron por un controlador de impresión por el camino.

Y la nada glamurosa: para una página o dos, volver a teclear suele ser más rápido que cualquiera de las anteriores. Merece la pena decirlo en voz alta, porque hay quien se pasa una hora en un trabajo de cinco minutos por la sensación de que el ordenador debería poder hacerlo.

Lo que ninguna herramienta puede hacer

  • No puede reconstruir un mapa que nunca se escribió. La información no está oculta ni cifrada, no está. Cualquier cosa que diga arreglar un mapa ToUnicode roto está infiriendo caracteres a partir de las formas de los glifos, que es reconocimiento óptico de caracteres con otra etiqueta.
  • El OCR te da una nueva mejor conjetura, no el original. Sus errores se concentran justo en lo que menos te puedes permitir que salga mal: cifras, números de referencia, apellidos, cualquier cosa que no puedas comprobar leyendo con sentido. Revisa todo aquello sobre lo que vayas a actuar.
  • Una extracción correcta sigue sin ser el documento. Las tablas vuelven como líneas, las notas al pie vuelven en medio, los pies de figura vuelven sueltos de sus figuras. Acertar todos los caracteres no dice nada sobre la estructura, y ninguna cantidad de exactitud a nivel de carácter lo dirá nunca.
  • Las escrituras de derecha a izquierda y las complejas tienen un segundo fallo por encima de este. Algunos productores escriben el árabe o el hebreo en orden visual, usando formas de presentación en lugar de las letras subyacentes. Un mapa de caracteres correcto da entonces un texto que es técnicamente correcto y se lee al revés, y devolverlo al orden lógico es un trabajo aparte.

La costumbre útil es probar antes de comprometerse: coge una página, extráela y lee lo que sale. Dos minutos al principio deciden si este documento es un trabajo de copiar y pegar o un trabajo de volver a teclear, y esa es la única decisión que aquí importa de verdad.

Herramientas que cubre este artículo

Fuentes

Documentación primaria de las afirmaciones anteriores.

Última revisión: 28 de septiembre de 2026

Publicado por iBuildPDF.

Más de la base de conocimientos

Explorar la base de conocimientos