Cómo revisar y borrar la información del documento, los datos del software y los metadatos XMP

Suelta un PDF y la página lee los valores que lleva el archivo: Title, Author, Subject, Keywords, Creator, Producer, las fechas de creación y modificación y si incluye un paquete XMP o una entrada PieceInfo. Cualquier otra clave del diccionario de información aparece con su nombre PDF: un archivo escrito como actualización incremental mostró una fila Custom junto a las nueve estándar.

Marca los grupos que quieras borrar y pulsa Eliminar metadatos seleccionados: la tabla pasa a ser una comparación antes/después, el contador indica los valores que desaparecieron y la copia se descarga como nombre-metadata-clean.pdf. pdf-lib trabaja dentro de esta pestaña, así que el archivo no sale del navegador.

  1. Suelta un PDF en la zona de entrada o haz clic para elegir un archivo; la tabla se rellena con el archivo local.
  2. Revisa las filas: cuatro campos descriptivos, cinco técnicos, cualquier clave extra del diccionario Info y la fila XMP, que muestra Presente cuando hay un paquete XMP o una entrada PieceInfo.
  3. Desmarca los grupos que quieras conservar. Los tres vienen marcados: Información del documento, Software y fechas, Metadatos XMP incrustados.
  4. Pulsa Eliminar metadatos seleccionados. La tabla pasa a Campo / Antes / Después, el contador indica cuántos valores se borraron y la copia se descarga como <nombre>-metadata-clean.pdf.
  5. Pulsa Limpiar para vaciar la lista de archivos, la tabla y los contadores antes de abrir el siguiente documento.

Qué lee la tabla, qué borra cada grupo y qué conserva la copia

Qué borra cada grupo

Información del documento borra Title, Author, Subject, Keywords y cualquier otra clave del diccionario Info, incluida una clave propia como /Custom. Software y fechas borra Creator, Producer, CreationDate, ModDate y Trapped. Metadatos XMP incrustados borra el paquete XMP y su entrada PieceInfo. Las dos listas no se solapan: si solo marcas Software y fechas, el título y el autor permanecen en la copia.

El paquete XMP se elimina como objeto, no solo se desvincula: la copia se revisó byte a byte y la marca que llevaba el paquete ya no estaba en ella. Borrar solo la referencia del catálogo dejaba el paquete legible dentro del archivo.

Qué conserva la copia

El número de páginas, el contenido, las anotaciones y los campos de formulario viajan sin cambios: un archivo de 40 páginas volvió con 40 páginas y un documento con formulario volvió con su AcroForm, sus tres anotaciones, el texto rellenado y la casilla marcada.

El tráiler conserva su par de identificadores, así que un archivo que llega con un ID sale con el mismo. Borrar metadatos no oculta nada que siga visible en una página o guardado en otra parte del archivo.

Qué rechaza la herramienta y qué acepta

Un archivo que no es PDF, un archivo vacío y un archivo cortado terminan con la misma frase y sin descarga: el motor PDF presenta un archivo truncado como un documento de cero páginas y la página rechaza ese resultado en lugar de escribir una copia con el árbol de páginas incompleto. Un PDF cifrado se avisa aparte, porque el motor no puede descifrarlo y la página nunca pide contraseña.

Los archivos editados con actualizaciones incrementales se leen en su revisión más reciente y las revisiones anteriores no vuelven en la copia: un archivo cuyo diccionario Info solo existía en la primera revisión perdió su título y su autor como cualquier otro. Las cadenas guardadas en UTF-16BE (un título en chino, un autor en cirílico) y los dos formatos de fecha PDF (D:2024, D:20230101120000-05'30') se leen, y las fechas se muestran como marcas ISO 8601 en UTC.

Herramientas recientes: