O Regressor Da Familia Caida - Ler O Regressor da Família Caída
Ler O Regressor da Família Caída

Regressão com dados de famílias: o que funciona e onde você vai tropeçar

Usei cerca de três horas no último projeto tentando entender por que os coeficientes do meu modelo haviam mudado drasticamente entre a rodada um e a quatro de uma pesquisa longitudinal. O problema não estava na programação. Estava em algo que todo mundo conhece superficialmente mas pouco respeita na prática: famílias que saem do painel ao longo do tempo, e a maneira como elas saem.

Entendendo o regressor da familia caida na prática

O termo que você está procurando se refere, basicamente, aos problemas que surgem quando famílias deixam de responder ou desaparecem de uma base de dados longitudinal depois que o modelo já foi estimado com os dados disponíveis. Não é um método novo. É um sintoma. E sintoma ele gera viés se você tratar a queda como aleatória quando não é. Na prática, isso aparece quando o seu regressor principal — seja renda, acesso a crédito, escolaridade ou qualquer variável explicativa de interesse — tem sua relação com o desfecho distorcida porque as famílias que saem do estudo sistematicamente diferem das que permanecem. Um pesquisador novato olha para a tabela e vê um coeficiente bonito, significativo, com intervalo de confiança apertado. O problema é que aquele coeficiente estimou a relação para um subconjunto selecionado de famílias, não para a população original.

Como lidar com isso passo a passo

A primeira coisa que eu faço sempre, antes de qualquer estimativa séria, é comparar as características das famílias que permaneceram com as que saíram. Isso parece óbvio até tentar estimar um modelo com duzentas variáveis e se perder nos resultados. Eu costumo rodar uma tabela debalança simples — teste t ou qui-quadrado para cada variável disponível na linha de base — para ver se há diferenças sistemáticas entre quem ficou e quem saiu. Se houver diferenças significativas em variáveis que também predizem seu desfecho, você tem um problema de seleção não aleatória. Nesse ponto, tem três caminhos que realmente funcionam. O primeiro é o mais barato em tempo mas o mais ingênuo em termos de suposições: peso de inversa de probabilidade de retenção. Você estima uma probabilidade de cada família permanecer no painel usando características observadas na linha de base, inverte essa probabilidade e usa como peso na regressão principal. Funciona razoavelmente bem quando a queda é explicável por variáveis que você já tem na base.

O segundo caminho, mais robusto mas também mais caro, é usar modelos de seleção de Heckman ou versões modernas como o método de reweighting por propensity score aplicado ao painel. A lógica é a mesma: modelar explicitamente o processo de queda e corrigir o viés dele. O detalhe importante aqui é que o modelo de seleção precisa de variáveis que predigam a saída mas não o desfecho diretamente — variáveis instrumentos, no jargão. Sem isso, a correção não identifica nada de novo. O terceiro caminho é simplesmente não estimar o modelo nos dados completos e usar métodos de imputação múltipla que levem em conta a estrutura de painel. O pacote mice do R, combinado com a estratégia de múltiplos imputations ao longo do tempo, lida razoavelmente bem com isso. O problema é que a imputação assume que os dados faltantes são missing at random, o que raramente é verdade em estudos com famílias de baixa renda que costumam ter maiores taxas de evasão justamente nos períodos de maior dificuldade econômica.

👉 Clique no botão abaixo para saber mais sobre o assunto!

Um caso que achei irritante na prática

Tinha um projeto com dados da PNAD contínua onde a taxa de queda de famílias era de cerca de vinte e dois por cento ao ano, mas não era distribuída uniformemente. As famílias que saíam tinham, em média, renda inicial quatorze por cento menor que as que permaneciam. Isso pareceria um viés gerenciável. Foi quando percebi que a variável que eu mais interessava — acesso a programas de transferência de renda — tinha correlação negativa forte com a probabilidade de permanência. Famílias beneficiárias eram as que mais caíam do painel. O resultado era que meus coeficientes para o programa estavam sistematicamente superestimados, porque eu estava removendo do conjunto analítico justamente as famílias com pior desempenho nos desfechos de interesse. A solução que funcionou foi combinar reweighting por inversa de probabilidade de retenção com uma análise de sensibilidade usando o framework de Rosenbaum. O reweighting corrigiu parte do viés, e a análise de sensibilidade me mostrou que o efeito do programa precisaria ser pelo menos trinta por cento menor para que a conclusão principal deixasse de ser estatisticamente significativa — algo que considerei uma margem de segurança razoável para aquele contexto.

Insights que ninguém conta nos livros

O primeiro insight contraintuitivo é que fixed effects familiares não resolvem o problema de família caída. Eles controlam heterogeneidade não observada constante no tempo, mas não fazem nada para corrigir o fato de que a amostra está sendo selecionada dinamicamente. Na verdade, fixed effects podem piorar a situação porque, ao controlar efeitos Fixos, você implicitamente está analisando apenas variação dentro das famílias que permaneceram, o que pode amplificar o viés de seleção se a queda for diferencial dentro dos grupos. O segundo insight é que a literatura frequentemente trata a queda como um problema técnico de estimação, mas na prática o custo mais alto é conceitual. Quando você perde famílias de um painel, você muitas vezes perde a capacidade de distinguir efeitos de cohorte de efeitos de período. Uma família que cai no ano de uma crise econômica é diferente de uma que cai em ano de estabilidade. Se os anos de queda se concentram em períodos específicos, seu modelo vai confundir efeito de tempo com efeito de seleção, e nenhum ajuste técnico resolve isso completamente.

O que esse método não consegue fazer

É importante ser direto sobre as limitações. Nenhuma correção estatística para família caída funciona se a razão da queda for intrinsicamente ligada ao desfecho de interesse de forma não observável. Se famílias saem porque estão passando por uma dificuldade muito específica que também afeta seu desfecho, e você não tem dados sobre essa dificuldade, o viés persiste. O reweighting ajuda, a imputação ajuda, mas nenhum deles remove o viés de seleção não observada. Seu cenário ideal é quando a queda é predominantemente explicada por variáveis observáveis na linha de base. Nesse caso, as correções mencionadas reduzem o viés em geral entre cinquenta e setenta por cento, dependendo da qualidade dos dados disponíveis. Se a queda for severa — acima de trinta e cinco por cento da amostra — mesmo as correções mais sofisticadas produzem resultados que eu não confiaria para políticas públicas sem várias análises de robustez.

A alternativa honesta nesses casos é abandonar a tentativa de estimar efeitos causais com os dados observados e focar em descrições intencionalmente modestas, com intervalos de confiança amplos, ou redesenhar o estudo para coletar dados de acompanhamento ativo das famílias que saem, mesmo que seja apenas uma onda adicional de contato para entender por que elas saíram.

O regressor da familia caida e a escolha que você precisa fazer

No final, lidar com famílias que saem de um painel não é um problema de código. É um problema de decisão sobre o que você está disposto a assumir. Cada técnica de correção carrega uma suposição diferente sobre a natureza da queda, e nenhuma delas é livre de suposições não testáveis. A resposta mais honesta que já encontrei é: estime com o método que melhor se ajusta às características da sua queda, apresente os resultados com e sem correção lado a lado, e seja transparente sobre qual suposição está fazendovocê decidir qual abordagem adotar.