PDF-Text und Metadaten
Wählen Sie die Seiten, deren Text Sie brauchen, und lesen Sie die Metadaten der Datei. Pro Durchlauf werden bis zu 30 Seiten im Browser gelesen; das Ergebnis kommt als reiner Text.
Läuft lokal in deinem BrowserWählen Sie die Seiten, deren Text Sie brauchen, und lesen Sie die Metadaten der Datei. Pro Durchlauf werden bis zu 30 Seiten im Browser gelesen; das Ergebnis kommt als reiner Text.
Läuft lokal in deinem BrowserPDF öffnen, die gewünschten Seiten angeben, Schaltfläche drücken: die Ausgabe zeigt Titel, Autor, Thema, Ersteller, Produzent und Seitenzahl, wie die Datei sie angibt, danach die Textebene jeder gewählten Seite unter ihrer eigenen Überschrift --- Page N ---. Die Datei verlässt den Browser nicht; gelesen wird mit den mitgelieferten Bibliotheken pdf-lib und pdf.js.
Ein dreiseitiges Dokument mit echter Textebene antwortete in etwa 0,3 s, und eine Datei mit 52 Seiten beantwortete die 30-Seiten-Grenze mit einer geschriebenen Meldung, bis der Bereich auf 1-30 eingegrenzt war. Eine Seite ohne Textebene - etwa ein Scan - liefert keine Zeichen, und das Werkzeug sagt das, statt ein leeres Ergebnis zu zeigen.
Metadaten: die Einträge Titel, Autor, Thema, Ersteller und Produzent sowie die Seitenzahl, genau so, wie die Datei sie angibt. Ein mit pdf-lib erzeugtes Dokument nennt pdf-lib als Produzenten, auch wenn kein Autor gesetzt ist, und jedes fehlende Feld erscheint als Gedankenstrich.
Text: die Textebene der gewählten Seiten, gelesen mit pdf.js. Die Extraktion behält die Zeilenumbrüche der Seite, verbindet die Fragmente einer Zeile mit einem einzelnen Leerzeichen und gibt die Seiten in der angegebenen Reihenfolge aus, sodass 3-1 die Seite 3 vor der Seite 2 zeigt. Mehr wird nicht ausgewertet: Bilder, Formularfelder und Anmerkungen bleiben unberührt.
Seiten ist die Seitenzahl des ganzen Dokuments, Zu prüfende Seiten zählt nur diesen Durchlauf: die Datei mit 52 Seiten meldet bei 1-30 trotzdem 52 und 30. Eingabegröße ist die Größe der geöffneten Datei.
Die 30-Seiten-Grenze existiert, weil jede Seite im Browser ausgewertet wird. Der erste Durchlauf einer Sitzung lädt zusätzlich die PDF-Engine, was bei kaltem Cache einige Sekunden dauert; der Durchlauf über 30 Seiten brauchte etwa 0,3-0,4 s, und ein leeres Feld bei einem längeren Dokument endet mit der Grenzmeldung - Bereich eingrenzen und erneut starten.
Eine PDF pro Durchlauf, bis 250 MB, ohne OCR: eine eingescannte Seite trägt ein Bild des Textes, nicht den Text, deshalb meldet das Werkzeug, dass keine Textebene gefunden wurde. Verschlüsselte oder passwortgeschützte Dateien werden abgelehnt, und eine beschädigte Datei antwortet Diese Datei konnte nicht als PDF gelesen werden. Prüfen Sie, ob sie beschädigt ist. statt eines rohen Parserfehlers.
Alles geschieht in der Seite: die PDF wird nicht hochgeladen, das Werkzeug arbeitet nach dem Laden offline weiter, und das Ergebnis ist reiner Text, den Sie überall einfügen können. Die Prüfung liest und kopiert nur - Metadaten und Seiten werden nie in die Datei zurückgeschrieben.