Texto e metadados de PDF
Escolha as páginas cujo texto você precisa e veja os metadados que o arquivo declara. Até 30 páginas são lidas por execução no navegador, e o resultado sai como texto simples.
Funciona localmente no seu navegadorEscolha as páginas cujo texto você precisa e veja os metadados que o arquivo declara. Até 30 páginas são lidas por execução no navegador, e o resultado sai como texto simples.
Funciona localmente no seu navegadorAbra um PDF, informe as páginas necessárias e clique no botão de execução: a saída mostra Título, Autor, Assunto, Criador, Produtor e o número de páginas declarados pelo arquivo e, em seguida, a camada de texto de cada página escolhida sob o próprio cabeçalho --- Page N ---. O arquivo não sai do navegador, e a leitura é feita pelas bibliotecas pdf-lib e pdf.js incluídas.
Um documento de três páginas com camada de texto real respondeu em cerca de 0,3 s, e um arquivo de 52 páginas respondeu ao limite de 30 com uma mensagem escrita até o intervalo ser reduzido para 1-30. Uma página sem camada de texto — uma digitalização, por exemplo — não devolve caractere algum, e a ferramenta avisa isso em vez de mostrar um resultado vazio.
Metadados: as entradas Título, Autor, Assunto, Criador e Produtor, além do número de páginas, exatamente como o arquivo as declara. Um documento gerado com pdf-lib registra pdf-lib como produtor mesmo sem autor, e todo campo ausente é impresso como travessão.
Texto: a camada de texto das páginas selecionadas, lida com pdf.js. A extração mantém as quebras de linha da página, une com um único espaço os trechos que dividem a mesma linha e imprime as páginas na ordem informada, então 3-1 mostra a página 3 antes da 2. Nada além disso é interpretado: imagens, campos de formulário e anotações ficam intactos.
Páginas é o total do documento, enquanto Páginas para inspecionar conta apenas esta execução: o arquivo de 52 páginas com 1-30 mostra 52 e 30. Tamanho de entrada é o tamanho do arquivo aberto.
O limite de 30 páginas existe porque cada página é analisada no navegador. A primeira execução de uma sessão ainda carrega o motor de PDF, o que leva alguns segundos com o cache frio; a execução de 30 páginas terminou em cerca de 0,3-0,4 s, e o campo em branco em um documento maior para com o aviso do limite: reduza o intervalo e execute de novo.
Um PDF por execução, até 250 MB e sem OCR: uma página digitalizada carrega uma imagem do texto, não o texto, então a ferramenta avisa que nenhuma camada de texto foi encontrada. Arquivos criptografados ou protegidos por senha são recusados, e um arquivo corrompido responde Não foi possível ler este arquivo como PDF. Verifique se ele não está corrompido. em vez de um erro bruto do analisador.
Tudo acontece na página: o PDF não é enviado, a ferramenta continua funcionando offline depois de carregada e o resultado é texto simples que você pode colar em qualquer lugar. O inspetor apenas lê e copia: metadados e páginas nunca são gravados de volta no arquivo.