Textebene und Metadaten einer PDF lesen

PDF öffnen, die gewünschten Seiten angeben, Schaltfläche drücken: die Ausgabe zeigt Titel, Autor, Thema, Ersteller, Produzent und Seitenzahl, wie die Datei sie angibt, danach die Textebene jeder gewählten Seite unter ihrer eigenen Überschrift --- Page N ---. Die Datei verlässt den Browser nicht; gelesen wird mit den mitgelieferten Bibliotheken pdf-lib und pdf.js.

Ein dreiseitiges Dokument mit echter Textebene antwortete in etwa 0,3 s, und eine Datei mit 52 Seiten beantwortete die 30-Seiten-Grenze mit einer geschriebenen Meldung, bis der Bereich auf 1-30 eingegrenzt war. Eine Seite ohne Textebene - etwa ein Scan - liefert keine Zeichen, und das Werkzeug sagt das, statt ein leeres Ergebnis zu zeigen.

  1. PDF über die Dateiauswahl wählen oder in die Ablagefläche ziehen. Es wird eine Datei pro Durchlauf geprüft: eine zweite Auswahl ersetzt die erste, und eine Datei, die keine PDF ist, wird mit Dieser Dateityp wird hier nicht unterstützt. abgelehnt.
  2. Im Feld Zu prüfende Seiten die Seiten eintragen: 1,3,5 für einzelne Seiten, 1-5 für einen Bereich, 3-1 für die Rückwärtsrichtung, oder nichts für das ganze Dokument. Pro Durchlauf werden höchstens 30 Seiten geprüft.
  3. Dateien verarbeiten drücken. Der Fortschrittsbalken füllt sich, während die Textebene der gewählten Seiten gelesen wird.
  4. Die Ausgabe lesen: die sechs Metadatenfelder - ein Gedankenstrich markiert, was die PDF nicht mitbringt - und danach ein Abschnitt je Seite in der angegebenen Reihenfolge.
  5. Das Ergebnis mit Kopieren übernehmen: der ganze Block landet in der Zwischenablage, die Statuszeile bestätigt es. Leeren räumt Dateiliste, Ausgabe und Kennzahlen und lässt das Seitenfeld so stehen, wie Sie es eingegeben haben.

Was Ausgabe und Grenzen bedeuten

Was die Prüfung liest

Metadaten: die Einträge Titel, Autor, Thema, Ersteller und Produzent sowie die Seitenzahl, genau so, wie die Datei sie angibt. Ein mit pdf-lib erzeugtes Dokument nennt pdf-lib als Produzenten, auch wenn kein Autor gesetzt ist, und jedes fehlende Feld erscheint als Gedankenstrich.

Text: die Textebene der gewählten Seiten, gelesen mit pdf.js. Die Extraktion behält die Zeilenumbrüche der Seite, verbindet die Fragmente einer Zeile mit einem einzelnen Leerzeichen und gibt die Seiten in der angegebenen Reihenfolge aus, sodass 3-1 die Seite 3 vor der Seite 2 zeigt. Mehr wird nicht ausgewertet: Bilder, Formularfelder und Anmerkungen bleiben unberührt.

Wie die Zahlen gezählt werden

Seiten ist die Seitenzahl des ganzen Dokuments, Zu prüfende Seiten zählt nur diesen Durchlauf: die Datei mit 52 Seiten meldet bei 1-30 trotzdem 52 und 30. Eingabegröße ist die Größe der geöffneten Datei.

Die 30-Seiten-Grenze existiert, weil jede Seite im Browser ausgewertet wird. Der erste Durchlauf einer Sitzung lädt zusätzlich die PDF-Engine, was bei kaltem Cache einige Sekunden dauert; der Durchlauf über 30 Seiten brauchte etwa 0,3-0,4 s, und ein leeres Feld bei einem längeren Dokument endet mit der Grenzmeldung - Bereich eingrenzen und erneut starten.

Grenzen und Kompatibilität

Eine PDF pro Durchlauf, bis 250 MB, ohne OCR: eine eingescannte Seite trägt ein Bild des Textes, nicht den Text, deshalb meldet das Werkzeug, dass keine Textebene gefunden wurde. Verschlüsselte oder passwortgeschützte Dateien werden abgelehnt, und eine beschädigte Datei antwortet Diese Datei konnte nicht als PDF gelesen werden. Prüfen Sie, ob sie beschädigt ist. statt eines rohen Parserfehlers.

Alles geschieht in der Seite: die PDF wird nicht hochgeladen, das Werkzeug arbeitet nach dem Laden offline weiter, und das Ergebnis ist reiner Text, den Sie überall einfügen können. Die Prüfung liest und kopiert nur - Metadaten und Seiten werden nie in die Datei zurückgeschrieben.

Zuletzt verwendet: