Texto y metadatos de PDF
Elige las páginas cuyo texto necesitas y consulta los metadatos que declara el archivo. Se leen hasta 30 páginas por ejecución en el navegador y el resultado se copia como texto plano.
Se ejecuta localmente en tu navegadorElige las páginas cuyo texto necesitas y consulta los metadatos que declara el archivo. Se leen hasta 30 páginas por ejecución en el navegador y el resultado se copia como texto plano.
Se ejecuta localmente en tu navegadorAbre un PDF, indica las páginas que necesitas y pulsa el botón de ejecución: la salida muestra el Título, Autor, Asunto, Creador, Productor y el número de páginas que declara el archivo y, después, la capa de texto de cada página elegida bajo su propio encabezado --- Page N ---. El archivo no sale del navegador y la lectura la hacen las bibliotecas pdf-lib y pdf.js incluidas.
Un documento de tres páginas con capa de texto real respondió en unos 0,3 s, y un archivo de 52 páginas contestó al límite de 30 con un mensaje escrito hasta acotar el rango a 1-30. Una página sin capa de texto —un escaneo, por ejemplo— no devuelve ningún carácter, y la herramienta lo dice en lugar de mostrar un resultado vacío.
Metadatos: las entradas Título, Autor, Asunto, Creador y Productor más el número de páginas, tal como los declara el archivo. Un documento generado con pdf-lib pone pdf-lib como productor aunque no tenga autor, y cada campo que el archivo omite se imprime como una raya.
Texto: la capa de texto de las páginas seleccionadas, leída con pdf.js. La extracción conserva los saltos de línea de la página, une con un solo espacio los fragmentos que comparten línea e imprime las páginas en el orden indicado, así que 3-1 muestra la página 3 antes de la 2. No se interpreta nada más: las imágenes, los campos de formulario y las anotaciones quedan intactos.
Páginas es el total del documento, mientras que Páginas a inspeccionar cuenta solo esta ejecución: el archivo de 52 páginas con 1-30 muestra 52 y 30. Tamaño de entrada es el tamaño del archivo que abriste.
El límite de 30 páginas existe porque cada página se analiza en el navegador. La primera ejecución de una sesión carga además el motor de PDF, lo que tarda unos segundos con la caché fría; la ejecución de 30 páginas terminó en unos 0,3-0,4 s, y el campo vacío en un documento más largo se detiene con el aviso del límite: acota el rango y vuelve a ejecutar.
Un PDF por ejecución, hasta 250 MB y sin OCR: una página escaneada contiene una imagen del texto, no el texto, así que la herramienta avisa de que no encontró capa de texto. Los archivos cifrados o protegidos con contraseña se rechazan, y un archivo dañado responde No se pudo leer este archivo como PDF. Comprueba que no esté dañado. en lugar de un error del analizador.
Todo ocurre en la página: el PDF no se sube, la herramienta sigue funcionando sin conexión una vez cargada y el resultado es texto plano que puedes pegar donde quieras. El inspector solo lee y copia: los metadatos y las páginas nunca se reescriben en el archivo.