Hounds Of Sisyphus - The hounds of sisyphus – Artofit
The hounds of sisyphus – Artofit

O que é o Hounds of Sisyphus

O Hounds of Sisyphus é um sistema de geração musical baseado em inteligência artificial desenvolvido por William Ryan Fitch enquanto era estudante de doutorado na Columbia University, entre 2016 e 2017. A ideia central é simples na superfície — um modelo que ouve uivos de cães e os transforma em faixas musicais com batidas, sintetizadores e estrutura harmônica — mas a implementação por trás disso exige alguns passos que valem a pena entender antes de tentar reproduzir. O modelo foi treinado em milhares de amostras de uivo de diferentes raças, registradas em variações de tom, duração e intensidade. Cada uivo mapeia para parâmetros musicais específicos: um uivo agudo e longo pode gerar uma linha de sintetizador, enquanto um uivo curto e grave vira uma batida de bumbo. O treinamento usou uma rede neural recorrente (LSTM), o que significa que o modelo aprendeu sequências temporais e não apenas notas isoladas.

Começando com hounds of sisyphus

O código-fonte original está disponível no GitHub e é compatível com o Ubuntu Linux. Não existe versão Windows oficial, e as pessoas que tentam rodar no WSL frequentemente encontram problemas com latência de áudio e dependências de bibliotecas de processamento de sinal. Eu passei duas semanas configurando o ambiente virtual com Python 3.6 no Ubuntu 18.04 antes de conseguir uma primeira faixa gerada funcionando sem erros. Se você vai testar isso, use uma máquina virtual com pelo menos 8GB de RAM e uma placa de som acessível via ALSA, não PulseAudio — o sistema precisa de acesso direto ao dispositivo de áudio para capturar os uívos em tempo real sem buffers excessivos. O fluxo básico funciona assim. Você prepara as gravações de uivo, divide o espectro de frequências usando filtros passa-baixa e passa-alta, mapeia cada faixa espectral para uma função musical dentro do modelo LSTM, e o sistema gera o resultado audio. O resultado não é perfeito. As faixas têm uma qualidade lo-fi intencional, com artefatos de compressão e uma sensação de repetição que pode cansar rápido se você não controlar os parâmetros de geração.

👉 Clique no botão abaixo para saber mais sobre o assunto!

Um problema prático que eu encontrei foi com a detecção de pitch em uivos de cães de pequeno porte. O modelo foi majoritariamente treinado com uivos de cães de médio a grande porte. Quando eu testei com gravações de um Shih Tzu e um Chihuahua, o sistema interpretava o tom como se fossem uivos de lobos de alta altitude e gerava frequências completamente fora do espectro musical esperado, produzindo notas agudas demais que entravam em conflito harmônico. A solução foi aplicar um downmix de duas oitavas em todas as amostras pequenas antes de alimentar o modelo, e ajustar manualmente o parâmetro pitch_shift no script de configuração para compensar a diferença. O download do repositório oficial pode ser feito pelo GitHub do projeto. O README original orienta a instalação das dependências via pip, mas muitas delas não são mais mantidas — especialmente as versões antigas do NumPy e do Librosa que o código espera. Meu conselho é congelar as versões exatas listadas no requirements.txt original e usar um ambiente virtual isolado. Testar com versões mais novas do Python geralmente quebra a compatibilidade com o código de DSP (processamento digital de sinais) que está no núcleo do projeto.

Também é importante notar uma limitação séria que poucos mencionam. O Hounds of Sisyphus foi projetado como uma peça conceitual e artística, não como uma ferramenta de produção musical profissional. Ele não oferece exportação em formatos de alta fidelidade, não tem interface gráfica, e a geração é basicamente um comando de linha que produz um arquivo WAV de resolução modesta. Se você precisa de algo que gere música functional para edição posterior, vai ter que exportar o WAV e processá-lo em outra DAW — o que na prática significa que o valor real do projeto está mais na curiosidade e na demonstração técnica do que no uso produtivo direto. Outro ponto que os tutoriais mais otimistas ignoram: a qualidade da saída depende fortemente da qualidade das gravações de uivo de entrada. Uivos com ruído de fundo, eco de ambientes internos, ou gravações comprimidas de vídeo geram saídas muito ruins porque o modelo não foi treinado com dados sujos. Filtrar as gravações com um Equalizer simples antes de alimentá-las no sistema faz uma diferença enorme, e esse passo muitas vezes é pulado por iniciantes que esperam resultado imediato.

O projeto original usa TensorFlow na versão 1.x, o que já é uma consideração importante em 2025. Muitos desenvolvedores que tentam portar o código para TensorFlow 2.x enfrentam incompatibilidades profundas na arquitetura da LSTM, especialmente nas camadas de manutenção de estado entre sequências. Eu consegui rodar em TensorFlow 2.x apenas convertendo o modelo para Keras nativo e reaprendendo as weights manualmente, o que dobrou o tempo de setup inicial mas resultou em uma experiência mais estável no longo prazo.