Entendendo o que realmente acontece quando você modela variabilidade genética
Genética de população não é só calcular F_ST e chorar. É um campo onde as suposições quebram com frequência, e a maioria dos tutoriais online te dá a versão limpa do modelo de Wright-Fisher sem mencionar que, na prática, você quase nunca vai ter dados que se encaixam nesse ideal.
genetica de população: conceitos que importam de verdade
A genética de população estuda como as frequências alélicas e genotípicas mudam ao longo do tempo sob a ação de forças evolutivas. As quatro forças básicas são seleção natural, deriva genética, migração (fluxo gênico) e mutação. A equação de Hardy-Weinberg serve como nulidade, mas ninguém no mundo real trabalha em equilíbrio perfeito. Populações naturais têm estrutura, size variável, e históricos demográficos complicados. O parâmetro Ne — efetivo size da população — é onde a maioria das pessoas tropeça. O tamanho censitário não é o mesmo que o tamanho efetivo. Em muitos vertebrados terrestres, Ne é 10 a 20% do N censitário. Em espécies com sobreposição de gerações e sistema de acasalamento não aleatório, essa proporção pode cair ainda mais. Quando eu estava analisando dados de populações de peixes de água doce isoladas em lagoas de montanha, descobri que o Ne estimado pelos métodos baseados em linkage disequilibrium dava valores absurdamente altos porque os lotes de desova eram concentrados em janelas temporais estreitas. O workaround foi usar o método temporal com amostras de duas gerações separadas e ajustar pelo viés de amostragem desigual nos recrudescimentos.
Uma coisa que poucos explicam bem: o coeficiente de consanguinidade (F) mede a probabilidade de identidade por descendência, não apenas "parentesco". Quando você vê F_IS positivo em dados reais, isso pode indicar efeito Wahlund — subestrutura não detectada —, não necessariamente endogamia dentro do lote. Eu perdi duas semanas perseguindo um sinal de endogamia que na verdade era simplesmente dois grupos genéticos misturados na mesma amostra. A solução foi rodar uma análise de estrutura (ADMIXTURE ou STRUCTURE) antes de qualquer cálculo de F.
Ferramentas e o que elas fazem (e não fazem)
Para estimativas de diversidade, o program GENEPOP ainda é útil para testes exatos de equilíbrio panmítico, embora seja lento para datasets grandes. Para dados de SNPs em larga escala, o PLINK com a flag --het e --genome é o padrão da indústria para identificar parentesco e amostras duplicadas. O vcftools com as opções --weir-fst e --site-freq-stats calcula F_ST por locus e frequências alélicas de forma eficiente. Para inferência demográfica, o MSMC e o PSMC são úteis para histórias de Ne ao longo do tempo a partir de genomas diploides, mas exigem cobertura sequencing de pelo menos 15x para resultados confiáveis. Abaixo disso, os padrões de heterozigose ficam muito ruidosos. O fastsimcoal2 permite modelar cenários demográficos complexos com múltiplas populações e migração, mas o tempo de computação escala mal — um modelo simples com três populações e fluxo gênico bidirecional pode levar de 6 a 12 horas em um cluster, dependendo do número de réplicas.
Para análise de estructura populacional, o ADMIXTURE é mais rápido que o STRUCTURE e dá resultados comparáveis para a maioria dos casos. O número ótimo de clusters (K) é sempre — o cross-validation do ADMIXTURE ajuda, mas K biológico e K estatístico raramente são a mesma coisa. Em meus dados de mamíferos selvagens, o K=3 dava o menor CV error, mas a interpretação ecológica só fazia sentido com K=4, onde um subgrupo era claramente diferenciado por uma barreira geográfica documentada.
👉 Clique no botão abaixo para saber mais sobre o assunto!
Diversidade genética: métricas que valem a pena
Nucleotide diversity (Pi) é a medida mais direta de variabilidade, mas exige alinhamento de sequências completas ou Region de interesse bem definida. Para SNPs, a heterozigosidade esperada (He) é mais prática. A diferença entre He e Ho pode revelar depressão endogâmica: se Ho está consistentemente abaixo de He em múltiplos loci, há um déficit de heterozigotos que não se explica por deriva alone. O F_ST de Weir & Cockerham é preferível ao F_ST de Wright original quando as sizes amostrais são desiguais entre populações. A diferença pode ser significativa em datasets com amostragem irregular. Para comparações entre estudos, o F'_ST de Standardised pode ajudar, mas ele tende a subestimar divergência quando a diversidade interna é alta.
Seleção natural detectada por genética de população
O método de Tajima's D é sensível a desvios do neutral expectation, mas não discrimina bem entre seleção e mudança demográfica. Um Tajima's D negativo pode significar seleção positiva recente OU expansão populacional. Para isolar o sinal de seleção, você precisa de um baseline demográfico conhecido. Eu usei PSMC primeiro para reconstruir a história demográfica, depois comparei os D observados com D simulados sob o modelo demográfico inferido. Só assim consegui identificar candidatos a seleção em genes ligados ao metabolismo de lipídios em uma população de roedores alpinos. Outra armadilha comum: usar F_ST outliers como proxy direto para seleção sem considerar que gargalos e fundadores também geram outliers. O método de Beaumont & Nichols (1996) com simulações coalescentes condicionais ao histórico demográfico é mais rigoroso. Software como OutFLANK e pcadapt implementam abordagens mais robustas que os testes clássicos de Hudson et al.
Limitações que ninguém menciona
O maior problema prático é que a maioria dos programas assume panmixia dentro de cada grupo definido, o que é raramente verdade. Subestrutura dentro de supostas "populações" gera falso sinal de deriva e infla estimativas de diversificação. Sempre faça um PCA ou uma análise de clustering antes de rodar qualquer modelo demográfico. Outro problema: dados de baixa profundidade de sequencing introduzem viés sistemático nas estimativas de frequência alélica. Leragens abaixo de 5x tendem a superestimar homozigoses e subestimar heterozigoses. Se você não tem controle de qualidade rigoroso nos variantes chamados, toda análise posterior fica comprometida. Recomendo usar o GATK com o pipeline de melhor prática e aplicar filtros de QD < 2.0 e FS > 60.0 pelo menos.
A inferência de fluxo gênico usando D-statistics (ABBA-BABA tests) funciona bem para verificar introgressão, mas requer pelo menos três populações bem definidas e um outgroup. Se o outgroup estiver muito distante filogeneticamente, a assimetria de substituições pode produzir falsos positivos. No meu caso, testando introgressão entre duas espécies de aves com um outgroup baseado em outra família, os resultados eram ambíguos porque o outgroup tinha acumulado muitas substitutions autapomórficas. Troquei por um outgroup intrafamília e o sinal ficou claro.
Onde encontrar os dados e ferramentas
Para dados de referência, o 1000 Genomes Project tem genomas inteiros de populações mundo afora. O Lab Tools de Masatoshi Nei reúne scripts para cálculos clássicos de genética de população. Para dados de SNPs de plantas e animais, o Figshare e o Zenodo têm repositórios crescentes com datasets prontos para análise. O POPGEN oferece pacotes R como o adegenet e o hierfstat que cobrem a maioria das análises padrão. O vg package do VCF Tools é indispensável para manipulação de arquivos VCF em batch.
O campo avança rápido demais para qualquer tutorial ficar atualizado por muito tempo. O mais importante é entender os pressupostos por trás de cada teste e saber quando seus dados violam esses pressupostos. O resto é rotina.