Lady Por Acaso - Lady por Acaso (Portuguese Edition) by Emanuelle Zuba | Goodreads
Lady por Acaso (Portuguese Edition) by Emanuelle Zuba | Goodreads

Como usar a ferramenta de separação de stems chamada lady por acaso

A maioria das pessoas que tenta separar faixas de música vai direto para o Demucs ou o Spleeter. A lady por acaso é uma alternativa mais recente que roda em CPU sem travar o computador inteiro, algo que importa quando você está processando uma lista de músicas e não quer ficar compilando modelos gigantes.

O que é lady por acaso

É um separador de stems baseado em redes neurais, especialmente treinado para isolar voz, bateria, baixo e instrumentos harmonicos. Diferente do MDX-Net, que exige um modelo bem específico por faixa, a lady por acaso usa uma arquitetura mais genérica que funciona razoavelmente bem com gêneros variados, desde que a mixagem original não seja completamente caótica. O modelo roda localmente. Isso significa que você baixa os pesos, configura o ambiente Python e executa diretamente. O repositório principal fica no GitHub e o download dos checkpoints é feito via Hugging Face. O processo todo leva uns 15 minutos na primeira vez, considerando a instalação das dependências e o download dos arquivos de modelo que somam cerca de 1,2 GB.

O que mais importa na prática é a configuração do device. Se você tem uma GPU NVIDIA com pelo menos 8 GB de VRAM, o processamento de uma faixa de 3 minutos fica entre 20 e 40 segundos. Sem GPU, fica entre 2 e 4 minutos. A diferença não é só velocidade — a CPU também tende a introduzir mais artefatos de compressão nos stems, especialmente na faixa de graves.

Instalação e execução passo a passo

Comece clone o repositório e entre no diretório. Crie um ambiente virtual com Python 3.10 ou superior. A versão do PyTorch precisa coincidir com a versão do CUDA se você for usar GPU. Eu usei CUDA 12.1 com PyTorch 2.2.1 e não tive problemas de compatibilidade. Versões mais novas do PyTorch podem quebrar a inferência em alguns builds, então não atualize por conta própria. Instale as dependências com pip install -r requirements.txt. O requirements.txt já lista o transformers, torchaudio e librosa, mas cuidado com o numpy — versões superiores a 2.0 causam erro de broadcasting durante o spectrogram inversion. Fique com numpy 1.26.4 se quiser evitar dor de cabeça.

Depois de instalado, baixe os pesos do Hugging Face. O comando direto é python download.py, que salva os checkpoints na pasta models/. Você pode escolher entre o modelo base e o modelo finetuned para vocais — o finetuned produz vozes mais limpas, mas sacrifica um pouco a qualidade do baixo. Em Mixturas onde o baixo e o vocal se sobrepõem em frequência, o modelo base é mais seguro. Para executar a separação, use o comando padrão de inferência apontando para o arquivo de entrada. Os stems são salvos em uma pasta de saída com nomes previsíveis: vocals.wav, drums.wav, bass.wav, other.wav. Cada arquivo é exportado em WAV 44.1 kHz, 24 bits, o que é suficiente para a maioria dos usos, mas se você precisar de algo mais limpo para processamento posterior, exporte em 32 bits float para evitar quantização indesejada.

👉 Clique no botão abaixo para saber mais sobre o assunto!

Problemas reais e o que funciona na prática

Eu tinha uma gravação ao vivo de uma banda de punk com plateia gritando e o vocal distorcido por amplificador. A lady por acaso tentou separar, mas isolou a energia da plateia como se fosse um instrumento harmônico e jogou parte da bateria no stem de other. O resultado era inutilizável. O workaround que funcionou foi aplicar um filtro high-pass de 80 Hz no stem de baixa antes de exportar, e depois rodar um gating simples no stem de bateria com threshold de -36 dB para remover os restos de ruído de fundo que o modelo deixou passar. O vocal ficou com artefatos residuais, mas nada que um iZotope RX não resolvesse em dois cliques. Sem esse tratamento pós-processamento, a ferramenta sozinha não resolve contextos ao vivo com alta densidade espectral.

Outro problema recorrente é com músicas que têm synthesizers muito graves. A separação frequentemente confunde o synth de sub-bass com o baixo real, e o resultado é um stem de baixo vazio e um stem of other com o peso todo. Se isso acontecer, reduza o input volume em 3 dB e reexecute — a normalização interna do modelo é sensível a picos de amplitude, e arquivos masterizados recentemente com loudness acima de -8 LUFS tendem a produzir stems mais sujos.

Limitações que ninguém menciona

A lady por acaso não é universal. Faixas com vocais muito processados — reverb longo, delay em dobro, autotune pesado — geram artefatos perceptíveis no stem de voz. O modelo funciona bem com gravações limpas, mas qualquer efeito de espaço ou correção de afinação introduz fantasma sonoro nos outros stems. Também não espere precisão cirúrgica em. Se um vocal e um synth ocupam exatamente a mesma faixa de frequência, o modelo vai distribuir a energia entre os dois stems de forma arbitrária. Isso não é um bug — é uma limitação inerente da separação baseada em aprendizado de máquina sem information perfeita.

Para quem precisa de resultado profissional, recomendo usar a lady por acaso como primeiro passo e depois refinar com ferramentas como Ultimate Vocal Remover ou o Demucs v4 com o modelo HTDEMUCS. O HTDEMUCS lida melhor com faixas complexas, mas exige GPU dedicada e tempo de processamento maior. A lady por acaso serve como alternativa rápida quando você não tem hardware para isso.

Download e links úteis

O repositório oficial da lady por acaso fica em GitHub. Os pesos do modelo estão no Hugging Face e podem ser baixados diretamente pelo navegador ou pela API do HF. A documentação de instalação é básica, mas suficiente para quem já tem familiaridade com PyTorch. Se você não tem, considere começar com o Ultimate Vocal Remover GUI, que empacota o mesmo tipo de tecnologia em uma interface amigável. O uso da ferramenta é gratuito e open source. A licença permite uso comercial dos stems gerados, desde que o modelo em si não seja redistribuído sem autorização. Leia os termos específicos no repositório antes de publicar qualquer material.