Como ler a camada de texto e os metadados de um PDF

Abra um PDF, informe as páginas necessárias e clique no botão de execução: a saída mostra Título, Autor, Assunto, Criador, Produtor e o número de páginas declarados pelo arquivo e, em seguida, a camada de texto de cada página escolhida sob o próprio cabeçalho --- Page N ---. O arquivo não sai do navegador, e a leitura é feita pelas bibliotecas pdf-lib e pdf.js incluídas.

Um documento de três páginas com camada de texto real respondeu em cerca de 0,3 s, e um arquivo de 52 páginas respondeu ao limite de 30 com uma mensagem escrita até o intervalo ser reduzido para 1-30. Uma página sem camada de texto — uma digitalização, por exemplo — não devolve caractere algum, e a ferramenta avisa isso em vez de mostrar um resultado vazio.

  1. Escolha o PDF no seletor ou arraste-o para a área de envio. Um arquivo é inspecionado por vez: uma segunda escolha substitui a primeira, e um arquivo que não seja PDF é recusado com Esse tipo de arquivo não é compatível aqui.
  2. Escreva as páginas no campo Páginas para inspecionar: 1,3,5 para páginas soltas, 1-5 para um intervalo, 3-1 para percorrer de trás para frente, ou nada para o documento inteiro. No máximo 30 páginas são inspecionadas por execução.
  3. Clique em Processar arquivos. A barra de progresso avança enquanto a camada de texto das páginas escolhidas é lida.
  4. Leia a saída: os seis campos de metadados — um travessão marca o que o PDF não traz — e uma seção por página na ordem pedida.
  5. Leve o resultado com Copiar: o bloco inteiro vai para a área de transferência e a linha de status confirma. Limpar esvazia a lista de arquivos, a saída e as métricas, e mantém o campo de páginas como você digitou.

O que significam o resultado e os limites

O que o inspetor lê

Metadados: as entradas Título, Autor, Assunto, Criador e Produtor, além do número de páginas, exatamente como o arquivo as declara. Um documento gerado com pdf-lib registra pdf-lib como produtor mesmo sem autor, e todo campo ausente é impresso como travessão.

Texto: a camada de texto das páginas selecionadas, lida com pdf.js. A extração mantém as quebras de linha da página, une com um único espaço os trechos que dividem a mesma linha e imprime as páginas na ordem informada, então 3-1 mostra a página 3 antes da 2. Nada além disso é interpretado: imagens, campos de formulário e anotações ficam intactos.

Como os números são contados

Páginas é o total do documento, enquanto Páginas para inspecionar conta apenas esta execução: o arquivo de 52 páginas com 1-30 mostra 52 e 30. Tamanho de entrada é o tamanho do arquivo aberto.

O limite de 30 páginas existe porque cada página é analisada no navegador. A primeira execução de uma sessão ainda carrega o motor de PDF, o que leva alguns segundos com o cache frio; a execução de 30 páginas terminou em cerca de 0,3-0,4 s, e o campo em branco em um documento maior para com o aviso do limite: reduza o intervalo e execute de novo.

Limites e compatibilidade

Um PDF por execução, até 250 MB e sem OCR: uma página digitalizada carrega uma imagem do texto, não o texto, então a ferramenta avisa que nenhuma camada de texto foi encontrada. Arquivos criptografados ou protegidos por senha são recusados, e um arquivo corrompido responde Não foi possível ler este arquivo como PDF. Verifique se ele não está corrompido. em vez de um erro bruto do analisador.

Tudo acontece na página: o PDF não é enviado, a ferramenta continua funcionando offline depois de carregada e o resultado é texto simples que você pode colar em qualquer lugar. O inspetor apenas lê e copia: metadados e páginas nunca são gravados de volta no arquivo.

Ferramentas recentes: