Lire la couche de texte et les métadonnées d’un PDF

Ouvrez un PDF, indiquez les pages voulues et lancez le traitement : la sortie affiche le titre, l’auteur, le sujet, le créateur, le producteur et le nombre de pages déclarés par le fichier, puis la couche de texte de chaque page choisie sous son propre en-tête --- Page N ---. Le fichier ne quitte pas le navigateur et la lecture est faite par les bibliothèques pdf-lib et pdf.js embarquées.

Un document de trois pages avec une vraie couche de texte a répondu en 0,3 s environ, et un fichier de 52 pages a répondu à la limite de 30 par un message écrit jusqu’à ce que la plage soit ramenée à 1-30. Une page sans couche de texte — un scan, par exemple — ne renvoie aucun caractère, et l’outil le dit au lieu d’afficher un résultat vide.

  1. Choisissez le PDF dans le sélecteur ou déposez-le sur la zone de dépôt. Un seul fichier est inspecté à la fois : un second choix remplace le premier, et un fichier qui n’est pas un PDF est refusé avec Ce type de fichier n’est pas pris en charge ici.
  2. Écrivez les pages dans le champ Pages à inspecter : 1,3,5 pour des pages isolées, 1-5 pour une plage, 3-1 pour remonter la plage, ou rien du tout pour tout le document. Au maximum 30 pages sont inspectées par exécution.
  3. Cliquez sur Traiter les fichiers. La barre de progression se remplit pendant la lecture de la couche de texte des pages choisies.
  4. Lisez la sortie : les six champs de métadonnées — un tiret marque ce que le PDF ne contient pas — puis une section par page dans l’ordre demandé.
  5. Reprenez le résultat avec Copier : le bloc entier part dans le presse-papiers et la ligne d’état le confirme. Effacer vide la liste des fichiers, la sortie et les métriques, et laisse le champ des pages tel que vous l’avez saisi.

Ce que disent le résultat et les limites

Ce que l’outil lit

Métadonnées : les entrées titre, auteur, sujet, créateur et producteur, plus le nombre de pages, exactement comme le fichier les déclare. Un document produit par pdf-lib annonce pdf-lib comme producteur même sans auteur, et chaque champ absent est affiché sous forme de tiret.

Texte : la couche de texte des pages sélectionnées, lue avec pdf.js. L’extraction conserve les retours à la ligne de la page, joint par une seule espace les fragments d’une même ligne et affiche les pages dans l’ordre demandé : 3-1 montre donc la page 3 avant la page 2. Rien d’autre n’est interprété : images, champs de formulaire et annotations restent intacts.

Comment les nombres sont comptés

Pages est le nombre de pages du document entier, tandis que Pages à inspecter ne compte que cette exécution : le fichier de 52 pages avec 1-30 annonce 52 et 30. Taille d’entrée est la taille du fichier ouvert.

La limite de 30 pages existe parce que chaque page est analysée dans le navigateur. La première exécution d’une session charge en plus le moteur PDF, ce qui prend quelques secondes à froid ; l’exécution de 30 pages a demandé environ 0,3-0,4 s, et un champ vide sur un document plus long s’arrête avec le message de limite : réduisez la plage et relancez.

Limites et compatibilité

Un PDF par exécution, jusqu’à 250 Mo, sans OCR : une page scannée contient une image du texte, pas le texte, et l’outil signale donc qu’aucune couche de texte n’a été trouvée. Les fichiers cryptés ou protégés par mot de passe sont refusés, et un fichier endommagé répond Ce fichier n’a pas pu être lu comme PDF. Vérifiez qu’il n’est pas endommagé. au lieu d’une erreur brute de l’analyseur.

Tout se passe dans la page : le PDF n’est pas téléversé, l’outil continue de fonctionner hors ligne une fois chargé, et le résultat est du texte brut que vous pouvez coller n’importe où. L’outil ne fait que lire et copier : les métadonnées et les pages ne sont jamais réécrites dans le fichier.

Outils récents :