O que é mona lisa releitura e por que todo mundo tá fazendo
A maioria das pessoas vai até o Midjourney ou Stable Diffusion, digita "mona lisa no estilo cyberpunk" e fica impressionada com o resultado. O problema é que o resultado costuma ser mediano se você não souber ajustar os parâmetros. A técnica em si é simples, mas os detalhes fazem diferença entre uma imagem que parece gerada por IA e uma que realmente funciona. O conceito de mona lisa releitura envolve pegar a composição original da Mona Lisa de Leonardo da Vinci e reaplicá-la através de modelos generativos. Você pode mudar o estilo artístico, o contexto, a paleta de cores, ou até a pose mantendo a estrutura visual. O segredo não é apenas chamar uma ferramenta e torcer.
mona lisa releitura com resultados profissionais
Eu comecei a brincar com isso em 2023 quando vi pessoas vendendo impressões de Mona Lisa em estilo anime por centenas de reais. Decidi testar por conta própria e perdi cerca de seis horas tentando entender por que minhas gerações ficavam com a rosto distorto e as mãos com dedos a mais. A solução foi mais simples do que eu imaginava: usar inpainting direcionado ao invés de tentar controlar tudo via prompt.
Passo a passo prático
Vamos começar pelo que realmente funciona. Eu uso principalmente Stable Diffusion XL com o checkpoint Realistic Vision ou Juggernaut XL para fotorealismo, ou o DreamShaper para estilos mais artísticos. Se você não quer instalar nada localmente, o SeaArt.ai ou o Tensor.art são opções gratuitas com interface razoável. O primeiro passo é ter a imagem base. Baixe uma versão de alta resolução da Mona Lisa original. Recomendo pelo menos 1024x1024 pixels. A versão do Louvre disponível no site deles tem resolução suficiente para a maioria dos usos.
Agora vem a parte que as pessoas erram. Não basta jogar o prompt e gerar. Você precisa configurar oimg2img corretamente. No Stable Diffusion, defina o denoising strength entre 0.4 e 0.65. Abaixo de 0.4 a imagem final parece cópia. Acima de 0.7 você perde completamente a estrutura original e a IA faz o que quer. O sweet spot fica em torno de 0.55 para a maioria dos estilos. Os prompts funcionam melhor quando você descreve o estilo que deseja enquanto mantém referências composicionais. Um exemplo: "portrait of a woman with enigmatic smile, Renaissance painting style, sfumato technique, warm earth tones, detailed background with Italian landscape, masterpiece" funciona muito melhor do que simplesmente "mona lisa in cyberpunk style". A IA responde melhor a descrições técnicas do que a referências diretas de nomes próprios, especialmente em modelos mais antigos.
Problemas comuns e como resolver
O maior problema que todo mundo encontra é a face ficar distorcida. Isso acontece porque a IA tenta reinterpretar features faciais específicas sem compreender a estrutura subjacente. Minha solução foi simples: usar um controlnet com o modelo depth ou cdladepth para manter a estrutura da imagem original, combinado com um denoising de 0.5. O controlnet preserva a geometria facial enquanto permite que o estilo seja transformado. Outro problema frequente são as mãos. A IA sempre estraga as mãos na Mona Lisa porque a pose original tem as mãos cruzadas de forma específica. Se o resultado vier com dedos extras ou proporções erradas, use o inpainting. Selecione apenas a região das mãos com uma máscara e regenere com um prompt focado em "hands crossed on lap, anatomically correct hands". Geralmente leva duas ou três tentativas até ficar bom.
👉 Clique no botão abaixo para saber mais sobre o assunto!
Tem gente que reclama que o resultado não se parece com a Mona Lisa original. Isso é esperado se o denoising estiver muito alto. Para manter fidelidade composicional enquanto transforma o estilo, use o IP-Adapter do Stable Diffusion. Ele funciona como um adaptador de estilo que observa a imagem de referência e aplica a transformação de maneira mais coerente do que o img2img puro. Leva uns dez minutos a mais no processo mas o resultado é notoriamente superior.
Alternativas e quando não usar
Se o seu objetivo é arte conceitual para jogos ou ilustrações, o fluxo com ControlNet + IP-Adapter no Stable Diffusion é o que oferece melhor controle. Se você quer algo mais rápido e não se importa com controle fino, o Midjourney com o parâmetro --sref funciona bem. Basta enviar a URL da Mona Lisa como reference e adicionar seu prompt de estilo. Porém tem limitações importantes. Modelos baseados em texto puro como DALL-E 3 não lidam bem com referências composicionais exatas. Eles tendem a criar variações livres demais. E se você precisa de resolução maior que 1024x1024, vai precisar de upscaling pós-geração. O Upscayl gratuito resolve para uso pessoal. Para uso comercial, considere o Topaz Gigapixel ou o plugins de upscale nativos do Stable Diffusion com o modelo Real-ESRGAN.
O tempo médio de geração varia de três a oito minutos dependendo do hardware. No meu setup com RTX 4070, cada passo leva cerca de quarenta segundos comCFG de 7 e 30 passos. Com upscaling incluído, o processo completo gasta cerca de vinte minutos por versão.
Arquitetura técnica recomendada
Se for rodar localmente, o Automatic1111 ou o ComfyUI são as interfaces padrão. O ComfyUI oferece mais controle mas tem curva de aprendizado mais íngreme. Para iniciantes, o Automatic1111 com as extensões ControlNet e IP-Adapter instaladas já cobre 90% do que você precisa. A instalação via Pinokio é a mais prática se você não quiser lidar com dependências manualmente. Os checkpoints listados acima estão disponíveis no Civitai. Baixe diretamente de lá e coloque na pasta models/Stable-diffusion do seu diretório de instalação. As extensões de ControlNet precisam dos models adicionais também baixados separadamente na pasta controlnet.
Um último ponto que poucas pessoas mencionam: o formato de saída importa. Salve em PNG e não JPEG se for usar para impressão. JPEG introduz artefatos de compressão que aparecem claramente em ampliações. O ganho de qualidade visual em relação ao PNG é mínimo mas o prejuízo em resolução é real.