Guias

Como fazer OCR de jornais em PDF e transformá-los em resumos

Para transformar um jornal em PDF em notícias resumidas são precisos quatro passos: separar o ficheiro em páginas, aplicar OCR a cada página (quando o PDF é imagem digitalizada), segmentar o texto em artigos distintos e resumir cada artigo. Um PDF digital com texto embutido dispensa o OCR.

PDF de texto ou PDF de imagem?

Se conseguir selecionar texto no PDF, o conteúdo já está embutido e basta extraí-lo. Se o ficheiro é uma digitalização — o caso da maioria das edições de jornal em papel — as páginas são imagens e é obrigatório reconhecimento ótico de caracteres (OCR).

O passo difícil não é o OCR: é a segmentação

Uma página de jornal tem várias notícias, colunas, caixas, legendas e publicidade. O OCR devolve tudo misturado, muitas vezes com as colunas intercaladas. Sem uma etapa que perceba onde começa e acaba cada peça, o resultado é um bloco de texto ilegível.

Modelos de IA multimodais leem a página como imagem e conseguem devolver artigos separados, com título, texto e secção — é isso que torna o resultado utilizável.

Qualidade da digitalização

  • 300 DPI é o mínimo razoável para texto de jornal
  • Páginas direitas: inclinação degrada muito o reconhecimento
  • Contraste alto e sem sombras de dobra
  • Uma página por imagem, sem duas páginas na mesma fotografia

Do texto ao resumo

Depois de cada artigo estar isolado, o resumo é a parte simples: duas ou três frases, pontos-chave factuais, tema e etiquetas. O que decide a qualidade final é sempre a limpeza do texto que entra.

Fazer isto sem montar um pipeline

A Gazeta liga-se a uma pasta do Google Drive, deteta ficheiros novos, aplica OCR quando necessário, separa as notícias de cada página e publica-as no jornal pessoal com resumo e tema — sem intervenção manual entre a digitalização e a leitura.

Experimentar a Gazeta

Adicione as suas fontes e receba, todos os dias, uma edição resumida e filtrada pelos seus interesses. Grátis para começar, sem cartão.