PDF テキストとメタデータの抽出
必要なページを指定すると、ファイルが宣言しているメタデータと選択ページのテキスト レイヤーを表示します。1 回につき最大 30 ページまで、結果はプレーン テキストとしてコピーできます。
ブラウザ内でローカルに実行必要なページを指定すると、ファイルが宣言しているメタデータと選択ページのテキスト レイヤーを表示します。1 回につき最大 30 ページまで、結果はプレーン テキストとしてコピーできます。
ブラウザ内でローカルに実行PDF を開き、必要なページを指定して実行ボタンを押すと、ファイルが宣言しているタイトル・作成者・件名・作成ソフト・生成ソフト・ページ数が表示され、続けて選択した各ページのテキスト レイヤーが --- Page N --- の見出しごとに並びます。ファイルはブラウザー内にとどまり、読み取りは同梱の pdf-lib と pdf.js が行います。
実際のテキスト レイヤーを持つ 3 ページの文書は約 0.3 秒で返り、52 ページのファイルは 1-30 に絞るまで 30 ページの上限を文章で知らせました。テキスト レイヤーのないページ(スキャンなど)は文字を返さないため、空の結果を出す代わりにその旨を表示します。
メタデータ:タイトル、作成者、件名、作成ソフト、生成ソフトの各項目とページ数で、いずれもファイルの宣言どおりです。pdf-lib で作られた文書は作成者が未設定でも生成ソフトに pdf-lib と書かれ、ファイルにない項目はダッシュで表示されます。
テキスト:選択したページのテキスト レイヤーを pdf.js で読みます。抽出はページの改行を保ち、同じ行にある断片は半角スペース 1 つでつなぎ、指定した順序で出力するため、3-1 ならページ 3 がページ 2 より先に並びます。それ以外は解釈しません。画像・フォーム フィールド・注釈はそのままです。
ページは文書全体のページ数、検査するページはこの実行で選んだページ数だけを数えます。52 ページのファイルで 1-30 を指定しても 52 と 30 の両方が表示されます。入力サイズは開いたファイルの大きさです。
30 ページの上限は、1 ページずつブラウザー内で解析するために設けています。セッションの初回は PDF エンジンの読み込みも加わるためキャッシュが冷えていると数秒かかりますが、30 ページの実行そのものは約 0.3〜0.4 秒で終わりました。長い文書で空欄にすると上限のメッセージで停止するので、範囲を絞って再実行してください。
1 回につき 1 つの PDF、最大 250 MB、OCR は行いません。スキャンしたページには文字ではなく画像が入っているため、テキスト レイヤーが見つからないと表示します。暗号化またはパスワード保護されたファイルは拒否され、破損したファイルは解析器の生のエラーではなく「このファイルを PDF として読み取れませんでした。破損していないか確認してください。」と答えます。
処理はすべてページ内で完結します。PDF はアップロードされず、読み込み後はオフラインでも動作し、結果はどこにでも貼り付けられるプレーン テキストです。検査とコピーのみで、メタデータやページをファイルへ書き戻すことはありません。