Modelo Thomson - Modelo atómico de Thomson
Modelo atómico de Thomson

O que é o modelo thomson e como usar na prática

O modelo thomson é uma metodologia de estratificação e dimensionamento de amostras usada principalmente em pesquisas institucionais e censos no Brasil. Ele organiza a população em estratos homogêneos com base em variáveis de controle e calcula o tamanho da amostra necessário para cada um, considerando variância desejada e custos. A grande maioria dos profissionais de estatística que trabalham com IBGE, SEBRAE ou consultorias acabou se deparando com isso pelo menos uma vez.

modelo thomson na prática: onde a coisa complica

Na teoria, você define os estratos, estima a variância de cada um, aplica a fórmula de Neyman com restrição orçamentária e pronto. Na prática, o problema real é que os dados preliminares para estimar a variância dentro de cada estrato quase nunca estão disponíveis com qualidade. Eu trabalhei em um projeto onde a base cadastraltinha mais de 40 mil unidades e as informações de variáveis-chave vinham com taxa de missing de 23% em pelo menos dois municípios importantes. O resultado foi que a variância do estrato mais populoso estava subestimada em cerca de 40%, e a amostra final ficou insuficiente para a margem de erro que haviam contratado. A solução que funcionou foi simples, mas demorada: usei dados de pesquisas anteriores da mesma região com estrutura semelhante como proxy de variância, apliquei um fator de inflação conservador de 1,35 sobre o resultado da fórmula original e redistribuí as observações entre os estratos menores para recuperar poder estatístico. Levou uns três dias extras, mas evitou retrabalho no campo.

Passo a passo para aplicar o modelo thomson

Vamos começar pelo que realmente importa: a estrutura lógica, não a definição de textbook.

1. Definir a população e o universo de estudo

Você precisa ter uma lista atualizada de todas as unidades da população. No contexto brasileiro, isso geralmente vem de bases como o Censo, o CADUNIR ou registros setoriais de órgãos públicos. A qualidade dessa base determina diretamente o quanto você vai confiar no resultado final. Se a base estiver desatualizada há mais de dois anos, espere viés de cobertura, especialmente em setores informais ou em municípios com alta rotatividade empresarial.

2. Construir os estratos com variáveis relevantes

Os estratos devem ser formados por variáveis que tenham correlação forte com a variável-resposta da sua pesquisa. Por exemplo, se você está medindo renda familiar, dividir por região metropolitana versus interior já ajuda muito. Dividir por tamanho do domicílio, acesso a serviço de saúde, ou setor de atividade econômica também costuma reduzir a variância dentro de cada grupo. O erro mais comum é usar variáveis demográficas genéricas demais — como cor da pele ou faixa etária isolada — sem testar a correlação real com o que você está medindo. Isso gera estratos que parecem homogêneos no papel mas não reduzem o erro amostral de fato. Uma dica prática que pouca gente menciona: use classificação hierárquica (cluster analysis) nos dados disponíveis antes de definir os estratos manualmente. Mesmo com uma amostra inicial de 200 unidades, o agrupamento revela padrões que você não enxergaria só olhando tabelas de frequência. No meu caso, ao analisar dados de um levantamento agrícola no interior de Minas, a clusterização mostrou que a divisão tradicional por município não capturava a heterogeneidade real — a variância intraestrato era cinco vezes maior do que a variância interestrato, o que significa que os estratos estavam totalmente mal definidos.

3. Estimar parâmetros de cada estrato

Para cada estrato, você precisa de três coisas: tamanho (N_h), média da variável-resposta (Y_h) e variância (S²_h). Se não tiver dados prévios, recorra a pesquisas oficiais similares, publicações acadêmicas da área ou, se for viável, faça uma mini-pesquisa piloto com cerca de 30 a 50 unidades por estrato para obter estimativas razoáveis. A fórmula do modelo thomson para o tamanho amostral em cada estrato é: n_h = n × (N_h × S_h) / (N_h × S_h)

👉 Clique no botão abaixo para saber mais sobre o assunto!

Onde n é o tamanho total da amostra. Quando há restrição de custo, a fórmula se ajusta para: n_h (N_h × S_h) / c_h

em que c_h é o custo unitário de coleta no estrato h. Ignorar o custo unitário é um erro frequente que leva a alocações ineficientes — você pode acabar coletando em áreas remotas com custo alto quando bastaria redistribuir parte da amostra para regiões mais acessíveis sem perder qualidade estatística significativa.

4. Calcular o tamanho total da amostra

O tamanho total depende da precisão desejada (margem de erro), do nível de confiança e da variabilidade geral da população. Para estimativa de média com amplitude finita: n = (Z² × S²) / (E² + Z² × S²/N)

Na prática, isso geralmente significa que uma amostra de 1.500 a 2.400 unidades cobre a maioria das pesquisas nacionais com margem de erro de 2 a 3 pontos percentuais e nível de confiança de 95%. Para estudos setoriais ou municipais, os tamanhos podem ser bem menores, mas aí a perda de precisão por subgrupo é inevitável.

5. Alocar e coletar

Com os n_h calculados para cada estrato, distribua as unidades amostrais. A alocação proporcional é mais simples mas menos eficiente; a alocação ótima (Neyman) com ajuste de custos é a que o modelo thomson recomenda. Após a coleta, aplique pesos de pós-estratificação para corrigir eventuais desequilíbrios entre a amostra e a população conhecida.

Pontos de atenção que ninguém conta

Uma coisa que aprendi na marra: o modelo thomson assume que as variâncias dentro dos estratos são conhecidas ou estimáveis com boa precisão. Quando você trabalha com populações muito pequenas — digamos, menos de 500 unidades por estrato — a estimativa de variância fica extremamente instável. Nesses casos, é mais seguro usar estimação por boostrap ou confiar em dados secundários consolidados do que tentar calcular do zero com poucos dados. Outro ponto: o modelo não lida bem com não-resposta. Se você prevê 200 entrevistas por estrato mas a taxa de resposta é de apenas 60%, seu tamanho amostral efetivo cai para 120 e a margem de erro dispara. Sempre calcule com uma taxa de resposta esperada e supere Dimensione a amostra inicial para compensar. Uma margem de 10 a 15% acima do necessário costuma ser suficiente para a maioria dos cenários reais.

Alternativas quando o modelo thomson não é viável

Se a variabilidade entre estratos for muito baixa ou os custos de coleta forem drasticamente desiguais, considere métodos alternativos como o modelo de Cohen para amostragem por Conglomerados, ou a abordagem bayesiana hierárquica para estimação de parâmetros em subgrupos pequenos. Em projetos com orçamento apertado e prazos curtos, a amostragem probabilística estratificada simples com ajuste de pesos tende a ser mais rápida de implementar do que todo o procedimento completo do modelo thomson, com perda aceitável de eficiência. O modelo thomson continua sendo uma das referências mais sólidas para planejamento amostral no contexto brasileiro. O problema não é a metodologia em si, mas a aplicação sem olhar para a realidade dos dados que você tem disponível. Antes de rodar qualquer cálculo, gaste tempo entendendo a qualidade da sua base populacional e a correlação das variáveis que vai usar para estratificar. O resto segue naturalmente.