Construindo filogenias animais do jeito que funciona na prática
A primeira vez que eu montei uma árvore filogenética de metazoários, levei três semanas para perceber que a topologia estava errada porque o gene que eu escolhi tinha sido introduzido horizontalmente em um dos táxons. Isso não é teoria de livro. Acontece quando você trabalha com dados reais e não valida os ortólogos antes de rodar anything.
Construindo a árvore filogenética dos animais passo a passo
O fluxo que eu uso atualmente começa com a escolha da unidade analítica. Se for um estudo de relações entre filos, recomendo conjuntos filogenômicos — pelo menos 50 a 100 genes ortólogos únicos. Dados ribossômicos ou COI isolado resolvem questões intragênericas, mas para níveis mais profundos eles saturam rápido e produzem artífatos de atração de longos ramos, aquele problema clássico onde ctenóforos e poríferos brigam pela base da árvore dependendo do método e do conjunto de dados. O pipeline operacional que eu sigo é esse:
Identificar orthólogos com OrthoFinder ou BUSCO como filtro de qualidade. Ambos detectam cópias múltiplas e genes ausentes de forma sistemática. Genes duplicados incluídos sem cuidado viram parálogos disfarçados, e a árvore vai refletir história de gene, não história de espécie. Eu corro o BUSCO no grupo antes de qualquer coisa só para ver a completude. Alinhar com MAFFT no modo L-INS-i para conjuntos pequenos e precisos, ou EZAssembly/ExaML para datasets filogenômicos maiores. Depois, trimming com trimAl ou Gblocks, mas com parcimônia — eu prefiro o critério automated1 do trimAl porque Gblocks padrão muitas vezes descarta informação filogenética útil, especialmente em regiões conservadas mas informativas para nós profundos.
Seleção de modelo por particionamento com ModelFinder no IQ-TREE. Um erro comum é aplicar um único modelo para todo o alinhamento. Diferentes genes e códons têm dinâmicas substitucionais distintas. O IQ-TREE permite partição por gene e por posição sinônima/não sinônima, e isso melhora a verossimilhança de forma mensurável. Inferência com IQ-TREE (ML com 1000 replicações de ultrafast bootstrap) ou PhyloBayes (cadeias bayesianas com modelo CAT-GTR para lidar com heterogeneidade composicional). Para relações profundos entre filos, eu confio mais no Phylobayes porque o modelo CAT captura variação de perfil de aminoácidos entre sítios de forma que modelos fixos não capturam. O Ultrafast Bootstrap do IQ-TREE é rápido e geralmente confiável para nós bem suportados, mas ele tende a superestimar suporte em presença de artefato sistemático.
👉 Clique no botão abaixo para saber mais sobre o assunto!
Teste de hipóteses com SH-aLRT ou AU test do IQ-TREE para comparar topologias alternativas. Não adianta montar a árvore e aceitar o melhor score sem testar se a diferença entre configurações é estatisticamente significativa. Eu costumo forçar topologias competitoras como Porifera-sister, Ctenophora-sister e Coelenterata para ver se os dados realmente rejeitam alguma delas.
O problema que ninguém conta sobre alinhamento
Eu passei semanas travado em uma análise de Bilateria com dados transcriptômicos porque a árvore sempre agrupava Nematoda com Arthropoda de forma artificial. O problema era viés composicional — nematódeos têm conteúdo AT altíssimo, e algoritmos de ML padrão interpretavam similaridade composicional como similaridade filogenética. A solução foi rodar uma análise com PhyloBayes CAT e também aplicar recodificação dos aminoácidos em grupos bioquímicos (Dayhoff-6) como teste de robustez. Quando a topologia se mantinha independente do método, aí sim eu confiava no nó. Isso é importante: suporte alto não é sinônimo de correto. Suporte alto com modelo inadequado é o cenário perfeito para artefato bem resolvido. Sempre cross-check com pelo menos dois métodos e, se possível, com dados independentes — genes diferentes, tipos de dado diferentes (nuuclear vs. mitocondrial), ou abordagens distintas de tratamento de missing data.
Fontes de dados e referências práticas
O Open Tree of Life disponibiliza uma árvore sintetizada gratuita em formato Newick, com mais de 2 milhões de espécies. Útil para consulta rápida e para montar trees de referência, mas não substitui análise primária. O repositório BOW (Tree of Life Web Project) e o NCBI Taxonomy são bons para nomes e hierarquia, mas o NCBI ainda tem problemas de sinonímia que passam direto para suas análises se você não validar. Para dados brutos, Bgee e Expression Atlas ajudam a escolher genes com expressão conservada entre táxons, o que reduz ruído. O OrthoDB é excelente para orthólogos em nível de metazoários com curadoria razoável.
O que funciona e onde a coisa quebra
O método funciona bem quando você tem dados de qualidade, ortólogos validados, modelo adequado e teste de hipóteses. Ele quebra completamente em três cenários que eu vejo todo dia: primeiro, dados com missing data assimétrico extremo — quando alguns táxons têm 80% dos genes e outros têm 20%, a atração de ramos longos volta com força. Segundo, radiações rápidas — grupos como Platyhelminthes ou os filos de Annelida com eventos de diversificação comprimidos no tempo geológico geram sinais filogenéticos fracos que métodos diferentes resolvem de formas incompatíveis. Terceiro, híbridos e introgressão — árvores bifurcantes simplesmente não representam a realidade de linhagens com fluxo gênico pós-especiação. Nesses casos, em vez de insistir na árvore única, eu uso PhyloNet ou métodos de rede filogenética, oureporto o conflicto como resultado em si. Às vezes a resposta honesta é que os dados não conseguem resolver aquele nó, e forçar uma topologia com suporte Artificialmente alto é pior do que deixar em polotomia.
O que eu aprendi depois de anos fazendo isso é que a árvore filogenética dos animais não é um objeto que se descobre pronto nos dados. É uma hipótese model-dependente, sensível a escolha de orthólogos, tratamento de alinhamento, modelo substitucional e estratégia de partição. O importante é ser transparente sobre essas escolhas e testar sensibilidade. O campo avançou muito nos últimos dez anos, mas os problemas fundamentais — heterogeneidade composicional, radiações rápidas, seleção inadequada de modelo — continuam exigindo atenção cuidadosa em cada análise nova que se faz.