Guia prático: como recuperar e organizar um cemitério dos livros esquecidos
A maioria dos livros que saem de catálogo nunca é digitalizada por nenhuma editora ou instituição. Ficam esperando em porões, caixas de papelão e brechós até que o papel amarelou de vez. O cemitério dos livros esquecidos é basicamente um projeto de preservação bibliográfica offline que reúne edições esgotadas, manuscritos, zines, relatórios técnicos e material que simplesmente deixou de existir no mercado formal. A ideia é criar um repositório acessível, mesmo sem internet. O problema mais comum que eu vejo todo dia é que pessoas tentam escanear tudo com o scanner do celular, acham que vão resolver. A resolução varia, a iluminação quebra a cor de cada página e depois você gasta três horas só procurando os arquivos espalhados entre fotos tortas. O resultado é um arquivo praticamente inutilizável. Eu cheguei a montar uma coleção assim e precisei refazer tudo do zero porque a maioria das páginas tinha vinheta e distorção de perspectiva em 70% dos casos.
Regras básicas do cemitério dos livros esquecidos
O cemitério dos livros esquecidos funciona com uma estrutura simples, mas precisa ser seguida com disciplina. Você pega o livro, faz a digitalização, extrai o texto se possível, adiciona metadados completos e armazena em pelo menos dois locais diferentes. A ordem importa. O que muitos iniciantes ignoram é que a qualidade do arquivo final depende muito da etapa de metadatação, não da digitalização em si. Um PDF com OCR ruim mas metadados corretos é mais útil do que uma imagem perfeita sem identificação.
Fluxo de trabalho completo
Comece pela triagem. Separe os livros que valem o esforço. Um romance comercial em edição recente raramente tem valor preservacionista. Já um relatório técnico de 1987 sobre um tema específico ou um folheto de poesia publicado em tiragem de 50 exemplares tem. Eu costumo dar nota de prioridade de um a dez baseada na raridade, no estado de conservação e no interesse acadêmico ou cultural do conteúdo. Livros com nota menor do que sete eu nem começo a digitalizar. Depois vem a parte de hardware. Se você tem acesso a um scanner de mesa profissional, use. Um Epson Perfection V600 ou algo similar funciona bem para a maioria dos casos. Para livros que não abrem totalmente e podem sofrer dano, um suporte de fotografia com braço em L e luz difusa resolve. Eu já usei uma câmera mirrorless com lente de 50mm em f/8 e flash com difusor caseiro e consegui resultados superiores a scanners baratos, principalmente para livros encadernados em relevo ou com capas grossas que emperram no scanner.
A digitalização precisa seguir um padrão. Resolução mínima de 300 DPI para texto padrão, 600 DPI para livros com detalhes gráficos, mapas ou ilustrações que precisam ser legíveis. Formato TIFF para o arquivo master e PDF/A ou JPEG para distribuição. Nomeie os arquivos sempre no padrão nome_do_livro_pagina_001.tif. Sem exceção. Eu já vi gente salvar como escaneado_final_v2_com_correcao.tif e perder horas procurando um arquivo específico.
👉 Clique no botão abaixo para saber mais sobre o assunto!
Extração de texto e metadados
OCR é onde a maioria das pessoas trava. Tesseract é gratuito e funciona razoavelmente bem para português, mas ele precisa de calibração. Use o modelo pt e configure o parâmetro tessedit_pageseg_mode para 3 na maioria dos livros, ou 4 se o texto tiver colunas. Para livros antigos com fontes góticas ou impressas de forma irregular, o Tesseract simplesmente falha. Nesse caso, eu recomendo o OCRmyPDF como wrapper porque ele tenta correções automáticas de viés e alinhamento antes de processar. Metadados precisam incluir autor, título, editora, ano, ISBN quando existir, língua, número de páginas, assunto e palavra-chave. Use o padrão Dublin Core. Eu costumo manter uma planilha no Google Sheets com todas essas colunas e depois exporto em CSV para alimentar o repositório. Isso economiza um tempo enorme comparado a preencher campo por campo manualmente.
cemitério dos livros esquecidos na prática
O cemitério dos livros esquecidos é mais do que uma pasta cheia de PDFs. É uma infraestrutura mínima que permite recuperação. Eu montei meu repositório usando uma estrutura de pastas baseada no sistema DPLA: /acervo/autor/obra/anodigitalizacao/pagina. Dentro de cada obra existe um arquivo metadata.json com todas as informações estruturadas. Eu também gasto um arquivo checksum.md5 em cada pasta para verificar integridade dos arquivos ao longo do tempo. Uma limitação real que poucas pessoas mencionam é que a maioria dos livros antigos em português usa ortografia pré-AO 1943 ou ortografia pré-AO 1990, e os modelos de OCR padrão são treinados majoritariamente em português contemporâneo. Isso gera taxas de erro altíssimas em textos do início do século XX. A solução prática é misturar OCR automático com revisão manual das primeiras cinco páginas de cada livro para calibrar o reconhecedor, e então deixar o resto processar. Mesmo assim, conte com uma taxa de erro de 3 a 5 por cento nas páginas mais antigas.
Armazenamento e redundância
Guarde o arquivo master em pelo menos dois dispositivos físicos separados e um backup em nuvem. Eu uso um HD externo de 4TB como primário, outro HD de 4TB como secundário em local diferente, e um terceiro HD em cofre ou casa de familiar. A nuvem entra como quarta camada com Backblaze ou similar. O custo de armazenamento atual torna isso viável, mas a ideia não é depender de um único serviço. Se o objetivo é disponibilizar publicamente, considere usar um repositório estático. Eu montei o meu com Pelican, gerando HTML simples a partir dos arquivos JSON de metadata. Não precisa ser sofisticado. Links funcionais, busca por título e autor, e download direto. Isso evita dependência de plataformas que podem desaparecer. GitHub Pages funciona bem para projetos menores, mas tem limite de largura de banda. Para acervos maiores, um VPS barato ou um serviço como Netlify resolve sem complicação.
Erros comuns que eu vejo todo dia
O primeiro erro é fazer digitalização sem plano de metadatação beforehand. As pessoas escaneiam centenas de páginas e depois não conseguem associar nada a nada. O segundo é confiar cegamente no OCR sem revisar amostras. O terceiro é não documentar a procedência do livro: de onde veio, quem doou, qual o estado físico original. Isso é crucial para pesquisadores que precisam rastrear a fonte. Outro problema frequente é a falta de padronização na numeração de páginas. Muitos livros antigos têm numeração romana na frente e arábica no corpo, mais inserções laterais, anexos sem numeração. Se você numerar de forma linear sem marcar as seções, o leitor perde referências. Use um schema tipo paginacao_romanada_inicial, paginacao_arabica_principal, suplementos_sem_numeracao.
Herramental recomendado
Para digitalização: Tesseract, OCRmyPDF, gImageReader para interface gráfica, Resvgu para ajustes de cor e contraste. Para gestão: Zotero para referência rápida, uma planilha em CSV, e scripts Python básicos para batch renaming e geração de checksums. Para armazenamento: Rsync entre discos, verificadores de integridade semanais. Para publicação estática: Pelican ou Hugo, dependendo da preferência por Python ou Go. O cemitério dos livros esquecidos não é perfeito e tem limitações sérias. Não resolve a questão dos direitos autorais de livros ainda protegidos. Ele serve para obras que já caíram em domínio público ou para fins de preservação acadêmica sob fair use. Também não substitui instituições formais como bibliotecas nacionais, mas pode preencher lacunas que elas não cobrem por falta de recursos. Se o seu objetivo é realmente preservar, foque no que ainda está acessível fisicamente antes que o material se degrade irreversivelmente.