Como fazer moonwalking with einstein funcionar na prática
Achei o moonwalking with einstein num fórum aleatório há uns meses, porque precisava de gerar vozes cantadas em inglês com sotaque credível e não queria pagar por serviços caros. A ideia básica é usar um modelo de voz neural combinado com um sistema de síntese de melodia que tenta replicar a forma como certas vozes famosas soariam em versões cover não autorizadas. Funciona, mas tem os seus problemas.
Instalar e configurar o moonwalking with einstein
Vais precisar de Python 3.9 ou superior, um ficheiro de modelo pesado (cerca de 2GB) e uma GPU com pelo menos 8GB de VRAM se quiseres velocidade razoável. Sem GPU, espera processar 30 segundos de áudio por minuto em média. A instalação corre num terminal com pip install das dependências listadas no repositório, mas atenção que algumas libs dependem de versões específicas do CUDA. Se tiveres Windows, instala o conda primeiro, senão vais perder duas horas a tentar corrigir erros de DLL. Depois de instalado, o primeiro passo é descarregar o modelo base. O repositório oficial indica o link diretamente, mas às vezes o servidor cai. Já me aconteceu esperar 20 minutos para recomeçar o download porque o link expira após três tentativas falhadas. A solução simples é usar um gestor de downloads como o aria2c com flag de retomada.
O processo de geração passo a passo
A estrutura geral funciona assim: forneces o texto da letra, indicas o tom e estilo pretendidos, e o sistema gera primeiro uma melodia base, depois aplica o clone de voz por cima. O output final é um ficheiro WAV ou MP3. Tudo isto acontece em cerca de 3 a 8 minutos para faixas de dois minutos, dependendo da complexidade do arranjo. O comando básico no terminal fica mais ou menos assim:
python generate.py --input letras.txt --voice modelo_base.pt --output resultado.wav --tempo 1.0 O parâmetro tempo controla a velocidade de geração, não a duração da música. Confundi isto nas primeiras vezes e achei que o programa estava lento quando na verdade estava apenas a processar devagar. O valor 1.0 é o padrão. Podes subir para 1.5 se tiveres GPU boa, mas perdes alguma qualidade vocal nos sons sustentados.
👉 Clique no botão abaixo para saber mais sobre o assunto!
Problemas reais que encontrei e como resolvi
O maior transtorno que tive foi com frases que contêm números ou datas. O modelo tende a ler "1985" como "mil novecentos e oitenta e cinco" em vez de enunciar os dígitos individualmente, o que estraga completamente o flow da letra. A solução que encontrei foi colocar entre parênteses a forma como cada número deve ser pronunciado. Em vez de escrever "nasci em 1990", escrevi "nasci em (um nove nove zero)". Funciona na maioria dos casos, nem sempre perfeito mas passável. Outro problema: quando o texto original tem muitas vogais abertas seguidas, o modelo cria um efeito de "vocal fry" indesejado no final de cada frase. Isso acontece especialmente em português e espanhol. A correção que descobri foi adicionar pausas marcadas com pipe (|) entre palavras com vogais idênticas adjacentes. Não é bonito, mas resolve.
Limitações que ninguém menciona
O sistema não lida bem com duplo sentido ou ironia no texto. Se escreves algo sarcástico, a voz vai cantar como se fosse literal. Isso é uma limitação arquitectónica do modelo, não um bug. Também não consegue manter consistência de timbre em faixas acima de 4 minutos. Depois desse tempo, a voz começa a flutuar entre registos diferentes sem aviso. Se o teu objectivo é criar música comercial, este tool não é recomendado. A qualidade de mastering final é sempre inferior ao padrão da indústria. Para projetos caseiros, demos ou curiosidade, funciona adequadamente.
Alternativas ao moonwalking with einstein
Se precisas de algo mais profissional, existem soluções pagas como o ElevenLabs ou o Kits.ai que oferecem vozes mais consistentes e melhor qualidade de mastering. São caros, mas se trabalhas com frequência com áudio gerado por IA, compensam o investimento. Para uso ocasional ou experimentação, o moonwalking with einstein continua a ser uma opção válida e gratuita. A comunidade mantém-se activa no Discord oficial, onde publicam actualizações regulares. As versões mais recentes melhoraram significativamente a pronúncia de consoantes finais, um problema que existia nas primeiras builds. Vale a pena actualizarem regularmente.
O tempo médio de resposta no canal de suporte é de cerca de 48 horas. Não esperem ajuda imediata. Os mantenedores trabalham voluntariamente e o projecto cresce mais rápido do que conseguem dar resposta a todos os bugs reportados.