文書情報・ソフトウェア情報・XMP メタデータを確認して削除する方法

PDF をドロップすると、ページがファイル内の値を読み取ります。Title、Author、Subject、Keywords、Creator、Producer、作成日と変更日、さらに XMP パケットや PieceInfo エントリの有無です。情報辞書のその他のキーは PDF の名前のまま表示されます。増分更新で書き込まれたファイルでは、標準の 9 行に加えて Custom 行が表示されました。

削除するグループにチェックを入れて「選択したメタデータを削除」を押すと、表が変更前・変更後の比較に変わり、カウンターが消えた値の数を示し、整理されたコピーが name-metadata-clean.pdf としてダウンロードされます。処理は pdf-lib がこのタブ内で行うため、ファイルがブラウザーの外に出ることはありません。

  1. 入力エリアに PDF を 1 つドロップするか、クリックしてファイルを選択します。表はローカルのファイルから作成されます。
  2. 行を確認します。説明系 4 項目、技術系 5 項目、Info 辞書の追加キー、そして XMP パケットまたは PieceInfo がある場合に「あり」と表示される XMP 行です。
  3. 残したいグループのチェックを外します。既定では「文書情報」「ソフトウェアと日付」「埋め込み XMP メタデータ」の 3 つが選択されています。
  4. 「選択したメタデータを削除」を押します。表は 項目 / 変更前 / 変更後 に変わり、カウンターが削除された値の数を示し、コピーが <名前>-metadata-clean.pdf としてダウンロードされます。
  5. 「クリア」を押して、ファイル一覧・表・カウンターを空にしてから次の文書を開きます。

表が読み取る値、グループごとに消える値、コピーに残るもの

グループごとに消える値

文書情報は Title、Author、Subject、Keywords と、Info 辞書にあるその他のキー(/Custom のような独自キーを含む)を削除します。ソフトウェアと日付は Creator、Producer、CreationDate、ModDate、Trapped を削除します。埋め込み XMP メタデータは XMP パケットと PieceInfo エントリを削除します。2 つの一覧は重ならないため、「ソフトウェアと日付」だけを選んだ場合はタイトルと作成者がコピーに残ります。

XMP パケットは参照を外すだけでなく、オブジェクトとして削除します。コピーを 1 バイトずつ調べても、パケットが持っていた目印は見つかりませんでした。カタログの参照だけを消す方法では、パケットがファイル内に読める形で残っていました。

コピーに残るもの

ページ数、ページ内容、注釈、フォームフィールドはそのまま引き継がれます。40 ページのファイルは 40 ページのまま戻り、フォームのある文書は AcroForm、3 つの注釈、入力済みのテキストとチェック済みのボックスを持ったまま戻りました。

トレーラー(trailer)の ID ペアはそのまま残るため、ID 付きで届いたファイルは同じ ID で出力されます。メタデータを消しても、ページに表示されている内容やファイル内の別の場所に保存された内容は隠れません。

受け付けない入力と受け付ける入力

PDF でないファイル、空のファイル、途中で切れたファイルは同じメッセージで終わり、ダウンロードも行われません。PDF エンジンは切り詰められたファイルを 0 ページの文書として扱いますが、ページ側は不完全なページツリーのコピーを書き出さずに拒否します。暗号化された PDF は別のメッセージになります。エンジンが復号できず、ページがパスワードを求めることもないためです。

増分更新で編集されたファイルは最新のリビジョンで読み取られ、古いリビジョンはコピーに戻りません。Info 辞書が最初のリビジョンにしかなかったファイルでも、タイトルと作成者は他のファイルと同様に削除されました。UTF-16BE で保存された文字列(中国語のタイトル、キリル文字の作成者)と PDF の 2 つの日付形式(D:2024、D:20230101120000-05'30')も読み取られ、日付は UTC の ISO 8601 形式で表示されます。

最近使ったツール: