Interacao Genica - Pleiotropia E Interação Gênica - RETOEDU
Pleiotropia E Interação Gênica - RETOEDU

Por que seu modelo de interação gênica está falhando (e como corrigir)

Interagir com dados de fenótipos que dependem de epistasia é frustrante quando você começa. A primeira coisa que acontece é o modelo linear padrão apresentar resíduos estruturados, variância não explicada que parece aleatória mas na verdade é sinal biológico que seu ANOVA simples não consegue capturar. Meu primeiro projeto de mapeamento assim custou oito meses porque eu insistia em ajustar QTLs individuais antes de considerar que dois loci trabalhando juntos explicavam mais variância do que qualquer um isoladamente.

O que realmente significa interacao genica na pratica

Interação gênica acontece quando o efeito fenotípico de um alelo em um locus depende do genótipo em outro locus. Isso é diferente de pleiotropia, que é um único gene afetando múltipros fenótipos. A confusão é comum e gera erro analítico logo de cara. Na prática, você tem dois loci, cada um com dois alelos, e o fenótipo não segue a soma dos efeitos individuais. O efeito do alelo A no locus 1 pode ser positivo quando o locus 2 carrega BB, mas neutro ou até negativo quando o locus 2 é AA. Esse desenho é o que chamamos de epistasia aditiva por aditiva, a forma mais básica, mas existem variações como dominância por dominância e aditiva por dominância que aparecem com frequência em dados reais de melhoramento vegetal e animal. A terminologia técnica importa aqui porque define qual termo você inclui no modelo. Se você roda um GWAS padrão sem o termo de interação, esses efeitos simplesmente somem para a variância residual. Em estudos com populações recombinantes ou linhas endogâmicas, o problema é ainda mais silencioso. Os efeitos epistáticos têm potência estatística muito menor para detecção do que os efeitos aditivos principais. A literatura estima que você precisa de duas a três vezes mais marcadores ou uma amostra consideravelmente maior para ter poder similar de detecção. Isso explica por que tantos artigos reportam QTLs principais consistentes mas deixam a maior parte da variância genética não explicada na conta do "missing heritability". Parte substancial desse missing é epistasia que ninguém estava olhando corretamente.

O que pouca gente explica é que a escala de medição do fenótipo altera completamente a aparência da interação. Um traço medido em escala logarítmica pode parecer puramente aditivo, enquanto a mesma genética em escala aritmética exibe epistasia forte. Isso não é artefato estatístico, é propriedade matemática da transformação. Se você trabalha com rendimento grão, área foliar ou qualquer traço com crescimento exponencial, testar a interação em múltiplas escalas não é luxo, é necessidade. Eu passei um ano tentando reproduzir um QTL de resistência a fungo que aparecia só em interações até perceber que a escore de infecção precisava ser transformada com arcseno quadrado da raiz porcentual. Depois da transformação, os dois loci entraram no modelo e o R² subiu de 0,12 para 0,41.

Como montar o modelo de forma que funcione

Você começa definindo a população e o desenho experimental. Populações F2 e DILs (linhas descendentes de sementes únicas) são as mais comuns em estudos de interação. Em F2, a proporção genotípica em dois loci independentes segue 9:3:3:1 para dois genes com dominância completa, mas esse desenho introduce correlação de linkage desequilíbrio que complica a interpretação. DILs resolvem parte disso porque cada linha é essencialmente homozigota em todo o genoma, então a interação entre dois loci se traduz em quatro classes fenotípicas discretas e fáceis de codificar no modelo. O trade-off é que você perde heterozigose e efeitos de dominância ficam invisíveis. Depende do seu objetivo biológico escolher o que vale a pena sacrificar. Na codificação dos genótipos, a escolha entre codificação 0/1/2 e dummy variables muda os coeficientes mas não a qualidade do ajuste. O que muda é a interpretação. Com codificação numérica, o coeficiente da interação representa a mudança no efeito por unidade de alelo substituído no segundo locus. Com dummies, cada combinação genotípica recebe seu próprio parâmetro. Para testes de significância de interação, ambas as abordagens produzem o mesmo F-test, mas se seu objetivo é estimar efeitos específicos para uso em seleção, dummies são mais transparentes. Eu uso dummies quase sempre exceto em modelos mixed de grande escala onde o custo computacional de muitos parâmetros fica proibitivo.

👉 Clique no botão abaixo para saber mais sobre o assunto!

Para ajuste prático, R com o pacoteqqmle ou o método de Haley-Knott regressão adaptado para interações funciona bem para populações pequenas e médias. Para GWAS com milhares de indivíduos, GEMMA ou TASSEL com teste de interação par-a-par são as opções mais usadas. O custo computacional cresce quadraticamente com o número de marcadores. Um GWAS de interação com 50 mil SNPs em 2 mil amostras leva horas em máquina padrão. Fatorar o modelo em blocos ou usar aproximação de baixa rank reduz o tempo para minutos, mas introduz viés nos p-values que você precisa calibrar com permutação. Três mil permutações são o mínimo que eu recomendo para estabelecer thresholds significativos confiáveis em dados com estrutura populacional.

Um problema real que eu enfrentei e como resolvi

Em um experimento com soja, monitorando interação entre dois QTLs de tolerância a alumínio, o modelo com termos aditivos mais interação selecionou o par errado de loci. O threshold por permutação estava baixo demais porque a estrutura de parentesco nos clones não estava corretamente modelada. A matriz G que eu construí a partir dos marcadores neutros tinha autovalores degenerados e o modelo misto confundia parentesco próximo com interação verdadeira. O resultado eram picos de interação espúrios em cromossomos inteiros que não faziam sentido biológico. A correção foi dupla. Primeiro, eu refiz a matriz de parentesco usando apenas SNPs em linkage equilibrium, filtrando por desequilíbrio com limiar D prime menor que 0,8 e recálculo iterativo. Segundo, em vez de testar interação par-a-par cega, eu restri o escaneamento aos pares de regiões que já tinham efeito aditivo marginal significativo. Isso reduziu o número de testes de milhões para algumas centenas e eliminou quase todo o ruído. O par de QTLs correto ganhou significância clara e a interação explicou 8% da variância adicional que o modelo aditivo puro não capturava. Levei duas semanas para refazer toda a análise, mas evitei meses de validação infrutífera em campo.

Armadilhas que você provavelmente vai encontrar

A primeira é overfitting em populações pequenas. Com menos de duzentos genótipos e centenas de possíveis pares de interação, o número de parâmetros compete com o número de observações. O modelo parece explicar tudo no treino e falha completamente na validação. Cross-validation estratificada por população ou hold-out com linha independente é obrigatório, não opcional. Sem validação, você está apenas memorizando ruído. A segunda é ignorar o linkage desequilíbrio de longa distância. Interações detectadas entre marcadores próximos no mesmo cromossomo podem ser artefato de LD com um único locus causal que afeta ambos os SNPs. A forma de descartar isso é verificar se o sinal de interação persiste em populações com LD mais rompido, como panels de accessões diversificadas, ou fazer condicionamento no QTL mais forte e ver se o pico de interação desaparece. Se desaparecer, era LD, não interação.

A terceira, e a mais importante, é confiar em métricas de ajuste sem contexto biológico. Um modelo com R² alto de interação pode simplesmente estar capturando efeitos ambientais correlacionados com genótipos. Anotação funcional dos genes nas regiões de interação, expressão diferencial em tecidos relevantes e dados de redes regulatórias são o que separam uma descoberta sólida de um achado estatístico vazio. Sem essa camada, a interação gênica continua sendo um exercício de correlação disfarçado de causalidade.

Quando interacao genica não vale a pena modelar

Existem cenários onde o esforço não compensa. Se seu painel tem menos de cinquenta genótipos e o traço é controlado por um único locus majoritário, adicionar termos de interação infla a variância residual sem ganho preditivo. Modelos de melhoramento preditivo para seleção massal em ciclos curtos também geralmente se saem melhor com efeitos aditivos saja, porque o custo de captura epistática supera o benefício em horizonte de seleção curto. A epistasia contribui mais para variância de longo prazo e para cruzamentos específicos entre linhagens, não para resposta média a seleção dentro de uma população homogênea. Reconhecer esses limites economiza tempo e evita modelos que parecem sofisticados mas entregam poco. O campo avança rápido com métodos como double HBLUP e redes Bayesianas que tentam capturar epistasia de ordem superior em escala genômica, mas esses métodos ainda exigem poder computacional expressivo e validação independente robusta antes de serem confiáveis para decisões de manejo ou seleção. Até lá, o caminho mais sólido continua sendo: modelo bem especificado, população adequada, validação rigorosa e confirmação biológica antes de declarar interação como fato estabelecido.