Detective Basil - Detective, Basil of Baker Street, Dr. David Q. Dawson, Movie, The Great ...
Detective, Basil of Baker Street, Dr. David Q. Dawson, Movie, The Great ...

Como extrair texto de imagens no Mac sem pagar licença

Você já abriu um PDF escaneado, um print de uma conversa ou uma foto de um documento e percebeu que não consegue nem selecionar uma palavra. Isso acontece o tempo todo. O Detective Basil resolve isso rodando OCR localmente no seu Mac, sem enviar nada para a nuvem. Ele usa o sistema de visão do macOS (Vision framework) junto com o Tesseract para reconhecer texto em imagens coladas na área de transferência.

O que o detective basil realmente faz

Não é um software de edição de imagem e não é um leitor de PDF convencional. É uma ferramenta que observa sua área de transferência e, quando detecta uma imagem contendo texto impresso, extrai esse texto e o disponibiliza numa janela pequena. Você clica num ícone na barra de menus, vê o resultado, copia e colá onde quiser. Tudo local. Tudo offline depois da instalação inicial dos idiomas. O fluxo real funciona assim: você seleciona um texto numa imagem, clica Copiar (ou simplesmente Ctrl+C numa seleção de imagem), o ícone do Detective Basil pisca e aparece a janela com o texto extraído. A partir daí, você seleciona o que precisa e joga num documento, planilha ou email. Leva cerca de 2 a 5 segundos dependendo do tamanho da imagem e do idioma configurado.

Dica prática que ninguém menciona: não use ele para reconhecer texto manuscrito. O Tesseract no modo padrão simplesmente não lida bem com escrita à mão. Ele foi feito para fonte tipográfica: documentos digitalizados, telas, prints de sites, livros escaneados. Quando você manda um caderno rabiscado pra frente, o resultado é basicamente ilegível e você perde mais tempo corrigindo do que digitando manualmente.

Instalação e configuração básica

A versão oficial hoje está disponível diretamente do repositório no GitHub do projeto. Você baixa o arquivo .dmg mais recente, arrasta para Applications e abre. Na primeira execução, o macOS vai pedir permissão para acessório a captura de tela e a assistibilidade. Sem essas duas, o app não consegue ler sua área de transferência visualmente. Vá em Ajustes do Sistema > Privacidade e Segurança > Captura de Tela e Liberar, e faça o mesmo para Assistibilidade. Marque o Detective Basil em ambas as listas. Depois disso, abra o ícone na barra de menus e vá em Preferences. A seção mais importante é Languages. O app vem com inglês padrão instalado. Se você precisa de português brasileiro, precisa baixar o pacote de dados do Tesseract separadamente. Baixe o arquivo .traineddata de ptb ou por do site do projeto Tesseract no GitHub e coloque-o na pasta ~/Library/Application Support/DetectiveBasil/languages. Se essa pasta não existir, crie ela. Reinicie o app e selecione Português nas configurações de idioma.

O tempo de reconhecimento varia muito entre idiomas. Inglês e português levam em média 2 segundos para uma imagem de 1920x1080. Espanhol e francês ficam perto disso. Línguas com acentuação pesada como turco ou finlandês podem levar até 40% mais tempo porque o motor precisa fazer mais processamento de caracter spotting.

👉 Clique no botão abaixo para saber mais sobre o assunto!

Problemas reais que eu encontrei e como resolvi

Num projeto meu, precisei extrair tabelas de um relatório PDF em português que tinha sido escaneado como imagem única, sem camada de texto. O Detective Basil padrão reconheceu o texto, mas misturou colunas inteiras. Linhas que pertenciam a colunas diferentes ficavam embaralhadas porque o motor de OCR trata a página como um bloco contínuo, sem entender estrutura tabular. A solução foi dividir a imagem antes de processar. Eu abri a imagem no Preview, recortava cada coluna individualmente, copiava cada uma pra área de transferência e deixava o Basil extrair separado. Depois era só colar cada bloco numa célula da planilha. Esse passo extra dobrava o tempo gasto, mas o resultado era muito mais limpo do que tentar corrigir o texto embaralhado manualmente. Se você lida com tabelas com frequência, considere usar o recurso de múltiplas regiões do app se ele estiver habilitado na versão que você possui, ou mapear colunas diferentes para álbuns separados na aba Regions das preferências.

Outro problema comum: textos em fundos com textura. Papel timbrado, fundo bege de documento antigo, marca d'água diagonal. O Tesseract tende a interpretar texturas como letras falsas. Nesses casos, a função de pré-processamento de imagem ajuda. Vá em Preferences > Image Processing e ative Threshold e Noise Removal. Othreshold converte a imagem para preto e branco antes do reconhecimento, eliminando ruído de fundo. Isso costuma melhorar a precisão em 15 a 20% em documentos envelhecidos, mas pode destruir texto muito leve em papel escuro. Teste com uma amostra antes de processar o arquivo inteiro.

O que o Detective Basil não consegue fazer

Ele não abre PDFs diretamente. Você precisa transformar o PDF em imagem primeiro. A forma mais rápida é abrir no Preview, exportar como imagem PNG ou JPEG, e então copiar a imagem para a área de transferência. PDFs com várias páginas viram uma imagem por página, então você processa página por página. Não há batch automático nativo. Também não há suporte nativo para OCR de alta resolução além do padrão do sistema. Se você tem documentos em resolução muito alta, o app pode ficar lento ou travar em máquinas com menos de 8GB de RAM. O processo consome memória proporcional ao tamanho da imagem. Uma imagem de 4000x3000 pixels em MACs mais antigos pode levar 10 segundos ou mais e travar temporariamente a interface.

O maior limitador mesmo é a qualidade do scan. Textos muito pequenos, abaixo de 8pt, ou imagens com baixa DPI (menos de 150), vão ter taxa de erro alta independentemente da configuração. Nesse cenário, o melhor caminho é aumentar a resolução da imagem com upscaling antes de processar, usando uma ferramenta como o GraphicConverter ou até o próprio Preview com redimensionamento para 300 DPI. Isso dobra o tempo de processamento mas melhora drasticamente a precisão.

Links e versão atual

O repositório oficial com a última versão está em github.com/sindresorhus/detective-basil. Sempre baixe da versão release mais recente, porque as builds antigas têm bugs conhecidos de permissão no macOS Sequoia que impedem a leitura da área de transferência. A versão 2.x+ resolve a maioria desses problemas. Se você trabalha com documentos escaneados e precisa de algo mais robusto, existem alternativas pagas como o Adobe Acrobat Pro ou o ABBYY FineReader que oferecem OCR batch, reconhecimento de tabelas e layouts. Mas para uso esporádico, local e gratuito, o Detective Basil entrega o resultado em poucos segundos sem depender de assinatura ou upload para servidores externos. Isso já basta para a maioria das pessoas.

O único ponto que vale anotar: se você precisar processar centenas de imagens por dia, vai perceber que o fluxo manual de copiar-colar-voltar-coletar cansa rápido. Nesse caso, vale investigar scripts automatizados que usem o mesmo motor Vision do macOS via linha de comando, que processam pastas inteiras em lote sem intervenção humana.