Como fazer OCR de jornais em PDF e transformá-los em resumos
Para transformar um jornal em PDF em notícias resumidas são precisos quatro passos: separar o ficheiro em páginas, aplicar OCR a cada página (quando o PDF é imagem digitalizada), segmentar o texto em artigos distintos e resumir cada artigo. Um PDF digital com texto embutido dispensa o OCR.
PDF de texto ou PDF de imagem?
Se conseguir selecionar texto no PDF, o conteúdo já está embutido e basta extraí-lo. Se o ficheiro é uma digitalização — o caso da maioria das edições de jornal em papel — as páginas são imagens e é obrigatório reconhecimento ótico de caracteres (OCR).
O passo difícil não é o OCR: é a segmentação
Uma página de jornal tem várias notícias, colunas, caixas, legendas e publicidade. O OCR devolve tudo misturado, muitas vezes com as colunas intercaladas. Sem uma etapa que perceba onde começa e acaba cada peça, o resultado é um bloco de texto ilegível.
Modelos de IA multimodais leem a página como imagem e conseguem devolver artigos separados, com título, texto e secção — é isso que torna o resultado utilizável.
Qualidade da digitalização
- 300 DPI é o mínimo razoável para texto de jornal
- Páginas direitas: inclinação degrada muito o reconhecimento
- Contraste alto e sem sombras de dobra
- Uma página por imagem, sem duas páginas na mesma fotografia
Do texto ao resumo
Depois de cada artigo estar isolado, o resumo é a parte simples: duas ou três frases, pontos-chave factuais, tema e etiquetas. O que decide a qualidade final é sempre a limpeza do texto que entra.
Fazer isto sem montar um pipeline
A Gazeta liga-se a uma pasta do Google Drive, deteta ficheiros novos, aplica OCR quando necessário, separa as notícias de cada página e publica-as no jornal pessoal com resumo e tema — sem intervenção manual entre a digitalização e a leitura.
Experimentar a Gazeta
Adicione as suas fontes e receba, todos os dias, uma edição resumida e filtrada pelos seus interesses. Grátis para começar, sem cartão.

