Cómo leer la capa de texto y los metadatos de un PDF

Abre un PDF, indica las páginas que necesitas y pulsa el botón de ejecución: la salida muestra el Título, Autor, Asunto, Creador, Productor y el número de páginas que declara el archivo y, después, la capa de texto de cada página elegida bajo su propio encabezado --- Page N ---. El archivo no sale del navegador y la lectura la hacen las bibliotecas pdf-lib y pdf.js incluidas.

Un documento de tres páginas con capa de texto real respondió en unos 0,3 s, y un archivo de 52 páginas contestó al límite de 30 con un mensaje escrito hasta acotar el rango a 1-30. Una página sin capa de texto —un escaneo, por ejemplo— no devuelve ningún carácter, y la herramienta lo dice en lugar de mostrar un resultado vacío.

  1. Elige el PDF con el selector o arrástralo a la zona de carga. Se inspecciona un archivo a la vez: una segunda elección reemplaza a la primera, y un archivo que no sea PDF se rechaza con Ese tipo de archivo no es compatible aquí.
  2. Escribe las páginas en el campo Páginas a inspeccionar: 1,3,5 para páginas sueltas, 1-5 para un rango, 3-1 para recorrerlo al revés, o nada para todo el documento. Se inspeccionan como máximo 30 páginas por ejecución.
  3. Pulsa Procesar archivos. La barra de progreso avanza mientras se lee la capa de texto de las páginas elegidas.
  4. Lee la salida: los seis campos de metadatos —una raya marca lo que el PDF no trae— y una sección por página en el orden que hayas pedido.
  5. Lleva el resultado con Copiar: todo el bloque va al portapapeles y la línea de estado lo confirma. Limpiar vacía la lista de archivos, la salida y las métricas, y deja el campo de páginas tal como lo escribiste.

Qué significan el resultado y los límites

Qué lee el inspector

Metadatos: las entradas Título, Autor, Asunto, Creador y Productor más el número de páginas, tal como los declara el archivo. Un documento generado con pdf-lib pone pdf-lib como productor aunque no tenga autor, y cada campo que el archivo omite se imprime como una raya.

Texto: la capa de texto de las páginas seleccionadas, leída con pdf.js. La extracción conserva los saltos de línea de la página, une con un solo espacio los fragmentos que comparten línea e imprime las páginas en el orden indicado, así que 3-1 muestra la página 3 antes de la 2. No se interpreta nada más: las imágenes, los campos de formulario y las anotaciones quedan intactos.

Cómo se cuentan los números

Páginas es el total del documento, mientras que Páginas a inspeccionar cuenta solo esta ejecución: el archivo de 52 páginas con 1-30 muestra 52 y 30. Tamaño de entrada es el tamaño del archivo que abriste.

El límite de 30 páginas existe porque cada página se analiza en el navegador. La primera ejecución de una sesión carga además el motor de PDF, lo que tarda unos segundos con la caché fría; la ejecución de 30 páginas terminó en unos 0,3-0,4 s, y el campo vacío en un documento más largo se detiene con el aviso del límite: acota el rango y vuelve a ejecutar.

Límites y compatibilidad

Un PDF por ejecución, hasta 250 MB y sin OCR: una página escaneada contiene una imagen del texto, no el texto, así que la herramienta avisa de que no encontró capa de texto. Los archivos cifrados o protegidos con contraseña se rechazan, y un archivo dañado responde No se pudo leer este archivo como PDF. Comprueba que no esté dañado. en lugar de un error del analizador.

Todo ocurre en la página: el PDF no se sube, la herramienta sigue funcionando sin conexión una vez cargada y el resultado es texto plano que puedes pegar donde quieras. El inspector solo lee y copia: los metadatos y las páginas nunca se reescriben en el archivo.

Herramientas recientes: