Entendendo os mecanismos práticos da seleção natural
Pessoas que realmente trabalham com dados evolutivos ou ensino de biologia sabem que o conceito de vida e evolução parece simples na superfície, mas quando você vai colocar a mão na massa, as coisas complicam rápido. A maioria dos tutoriais pela internet para de falar em "os bichos mudam com o tempo" e pronto, mas a prática é bem mais suja do que isso.
O que acontece no campo e nos laboratórios
Vida e evolução não é um conceito que se estuda só lendo livros. No meu caso, eu precisei lidar com uma situação bem específica há alguns anos: montar uma análise filogenética para um projeto de conservação de anfíbios da Mata Atlântica usando sequências de DNA mitocondrial. O problema foi que as árvores geradas inicialmente mostravam topologias completamente contraditórias dependendo do método de reconstrução. Maxima verossimilhança dava uma coisa, distância genética dava outra, e parsimônia nem entrava na conversa. A solução prática foi mais chata do que brilhante. Eu fiz rodadas de bootstrap com 1000 replicatas, testei modelos de substituição nucleotídica diferentes com o jModelTest, e no final combinei as melhores árvores de cada método num consensus estrito. Levou uns três dias de processamento, mas resolveu. O detalhe que ninguém conta é que o software FreeBayes ou o SNPhylo podem automatizar muita coisa, mas exige que você entenda o quê está automatizando.
Como construir sua própria análise passo a passo
Você começa alinhando as sequências. O MAFFT funciona muito bem para a maioria dos casos, mas se tiver muitos genes ou variantes, o PRANK pode ser mais preciso evolutivamente, ainda que seja mais lento. Depois disso, você escolhe o modelo de substituição que melhor se adapta ao seu alinhamento. Isso não é burocracia, é literalmente o que diferencia uma árvore que faz sentido de uma que não faz. Na hora de construir a árvore filogenética, o IQ-TREE é hoje uma das opções mais equilibradas entre velocidade e robustez. Ele roda em paralelo, aceita seus arquivos de alinhamento direto e já faz a seleção automática do modelo. Uma coisa que muita gente erra é pular a avaliação estatística dos nós. Sem bootstrap, você não sabe se o agrupamento que apareceu é confiável ou só ruído estatístico. Eu vejo gente presenting árvore sem bootstrap em apresentação acadêmica e é constrangedor.
👉 Clique no botão abaixo para saber mais sobre o assunto!
Recursos e ferramentas acessíveis
Se você quer algo mais didático, o EvoSuite e o PhyloTree-Con são interfaces web que rodaram árvores sem precisar instalar nada no computador. Para quem prefere algo local, oMEGA ainda é funcional e tem uma curva de aprendizado baixa. O problema é que ele não escala bem para conjuntos grandes com mais de 500 sequências, então depende do seu objetivo. Para quem não tem formação em biologia molecular mas quer entender o tema de verdade, existem cursos abertos como os da Coursera e do edX que cobrem fundamentos de genética populacional com exercícios práticos. Não subestime isso. A base teórica explica por que certas decisões metodológicas importam.
Erros comuns que vou listar porque alguém precisa falar
O primeiro erro é usar apenas um gene para construir uma árvore e tratar o resultado como se fosse definitivo. Um único locus pode ter sua história diferente da história da espécie inteira por causa de introgressão,Incomplete lineage sorting, ou deriva genética. O ideal é usar múltiplos loci ou dados genômicos completos quando possível. O segundo erro grave é interpretar ramo longo como ancestralidade. Um ramo comprido numa árvore filogenética significa apenas mais mudanças acumuladas, não que aquele organismo é "mais evoluído" ou "mais primitivo". Essa confusão é tão frequente que dói ver em material didático ainda hoje.
Há também o viés de confirmar o que você já espera ver. Se você tem uma hipótese filogenética baseada em morfologia, não sele o método de reconstrução que mais combina com ela. Isso é ciência ruim, e os revisores geralmente pegam isso.
Quando o método não funciona
É honesto admitir que em certos grupos a reconstrução filogenética falha porque a diversidade é muito recente, com hibridização constante, ou porque as amostras disponíveis são muito poucas e mal distribuídas geograficamente. Nesse cenário, métodos baseados em espécies-gene versus métodos baseados em coalescência (como o ASTRAL) podem dar resultados completamente diferentes. Eu passei duas semanas travado num projeto assim até conseguir resolver reduzindo o conjunto de dados e focando em espécies-chave com boa cobertura geográfica. Não existe ferramenta que resolva dados ruins. Se a coleta de campo foi mal feita, se o DNA degradou, ou se as amostras estão contaminadas, nenhuma análise computacional salva o resultado. O trabalho prático começa muito antes do computador ligar.