Como revisar e apagar as informações do documento, os dados do software e os metadados XMP

Solte um PDF e a página lê os valores que o arquivo traz: Title, Author, Subject, Keywords, Creator, Producer, as datas de criação e modificação e se há um pacote XMP ou uma entrada PieceInfo. Qualquer outra chave do dicionário de informações aparece com o seu nome PDF: um arquivo gravado como atualização incremental mostrou uma linha Custom ao lado das nove padrão.

Marque os grupos que deseja apagar e clique em Remover metadados selecionados: a tabela vira uma comparação antes/depois, o contador mostra os valores que desapareceram e a cópia é baixada como nome-metadata-clean.pdf. O pdf-lib trabalha dentro desta aba, então o arquivo não sai do navegador.

  1. Solte um PDF na área de entrada ou clique para escolher um arquivo; a tabela é preenchida a partir do arquivo local.
  2. Confira as linhas: quatro campos descritivos, cinco técnicos, qualquer chave extra do dicionário Info e a linha XMP, que mostra Presente quando há um pacote XMP ou uma entrada PieceInfo.
  3. Desmarque os grupos que quiser manter. Os três vêm marcados: Informações do documento, Software e datas, Metadados XMP incorporados.
  4. Clique em Remover metadados selecionados. A tabela passa a Campo / Antes / Depois, o contador mostra quantos valores foram apagados e a cópia é baixada como <nome>-metadata-clean.pdf.
  5. Clique em Limpar para esvaziar a lista de arquivos, a tabela e os contadores antes de abrir o próximo documento.

O que a tabela lê, o que cada grupo apaga e o que a cópia mantém

O que cada grupo apaga

Informações do documento apaga Title, Author, Subject, Keywords e qualquer outra chave do dicionário Info, inclusive uma chave própria como /Custom. Software e datas apaga Creator, Producer, CreationDate, ModDate e Trapped. Metadados XMP incorporados apaga o pacote XMP e a sua entrada PieceInfo. As duas listas não se sobrepõem: marcando apenas Software e datas, o título e o autor permanecem na cópia.

O pacote XMP é removido como objeto, não apenas desvinculado: a cópia foi verificada byte a byte e a marca que o pacote continha não estava mais nela. Apagar somente a referência do catálogo deixava o pacote legível dentro do arquivo.

O que a cópia mantém

Número de páginas, conteúdo, anotações e campos de formulário seguem sem alteração: um arquivo de 40 páginas voltou com 40 páginas e um documento com formulário voltou com o seu AcroForm, as suas três anotações, o texto preenchido e a caixa marcada.

O trailer mantém o seu par de identificadores, então um arquivo que chega com um ID sai com o mesmo. Apagar metadados não esconde nada que continue visível na página ou guardado em outra parte do arquivo.

O que a ferramenta recusa e o que aceita

Um arquivo que não é PDF, um arquivo vazio e um arquivo cortado terminam com a mesma frase e sem download: o motor de PDF apresenta um arquivo truncado como um documento de zero páginas e a página recusa esse resultado em vez de gravar uma cópia com a árvore de páginas incompleta. Um PDF criptografado é avisado à parte, porque o motor não consegue descriptografar e a página nunca pede senha.

Arquivos editados com atualizações incrementais são lidos na revisão mais recente e as revisões anteriores não voltam na cópia: um arquivo cujo dicionário Info existia apenas na primeira revisão perdeu o título e o autor como qualquer outro. Textos gravados em UTF-16BE (um título em chinês, um autor em cirílico) e os dois formatos de data do PDF (D:2024, D:20230101120000-05'30') são lidos, e as datas aparecem como marcas ISO 8601 em UTC.

Ferramentas recentes: