Escala De Medida - Escala Unidades de Medida | PDF
Escala Unidades de Medida | PDF

Quando seus dados mentem por causa da escala errada

A maioria dos problemas em análise de dados não vem de código ruim ou ferramentas fracas. Vem de tratar números como se fossem todos iguais. Eu vi gente calcular média aritmética de variáveis nominais e vender isso como insight pro cliente. O resultado sempre é um gráfico bonito que significa nada. O conceito base é simples. Escala de medida define o que você pode ou não fazer matematicamente com cada tipo de dado. Não é burocracia acadêmica. Se você erra a classificação, qualquer teste estatístico que aplicar vai te dar respostas que parecem válidas mas são completamente inválidas.

Entendendo a escala de medida na prática

São quatro níveis, do mais simples ao mais complexo. Você precisa saber identificar qual se aplica a cada variável no seu conjunto de dados antes de escrever uma linha de código. Nominal é categoria pura. Cor, gênero, tipo de produto, código de cidade. Nenhuma ordem, nenhuma distância mensurável entre os valores. O máximo que você faz é contar frequências e calcular moda. Tentar calcular média aqui é erro grave.

Ordinal tem ordem mas distâncias desiguais entre os patamares. Classificação salarial A/B/C/D, NPS de 1 a 10, níveis de satisfação. Você sabe que D é maior que C, mas não consegue dizer se a diferença entre C e D é a mesma que entre A e B. Mediana e percentis funcionam. Média e desvio padrão são problemáticos porque pressupõem equidistância. Intervalo tem ordem e distâncias iguais entre os pontos, mas zero arbitrário. Temperatura em Celsius ou Fahrenheit é o exemplo clássico. A diferença entre 20 e 30 graus é a mesma que entre 50 e 60. Porém 40 graus não significa "o dobro de quente" que 20. A média e o desvio padrão são perfeitamente válidos aqui. Testes paramétricos como t-teste e ANOVA funcionam sem problema.

Proporção ou razão tem tudo mais o zero absoluto. Zero significa ausência total da grandeza. Peso, altura, receita, tempo de resposta, quantidade de usuários. Aqui você pode fazer divisão significativa. Um servidor com latência de 100ms é exatamente o dobro lento de um com 50ms. Todas as operações estatísticas estão disponíveis. Isso parece óbvio até você se deparar com dados do mundo real. A maior parte dos dados que chegam pra análise não vem etiquetada. Você recebe uma planilha do sistema de RH com colunas como "nivel_de_satisfacao" que vão de 1 a 5, e não tem como saber ao certo se é ordinal puro ou se o desenvolvedor tratou como intervalo quando construiu o banco.

Eu tive esse problema específico num projeto de análise de churn. Tínhamos uma variável "score de risco" que ia de 0 a 100, aparentemente proporcional. Quando fomos modelar com regressão logística, os coeficientes estavam completamente distorcidos. Descobrimos que o score era na verdade uma escala ordinal disfarçada — os pontos não eram distribuídos uniformemente, havia concentrated gaps entre 60 e 75 onde não havia calibração. Tratamos como ordinal e usamos regressão ordinal. O modelo melhorou significativamente, com pseudo-R² subindo de 0,23 pra 0,41. O trabalho mais chato é identificar isso cedo. Sempre pergunte quem coletou os dados e como foram gerados. Se não tiver como saber, faça gráficos de distribuição e procure por agrupamentos ou gaps que revelem a estrutura real por trás dos números.

Método de identificação passo a passo

Na hora de analisar uma nova variável, siga este fluxo. Preencha as questões em ordem. Se travar em alguma, a resposta já indica a escala. Pergunta um: existe ordem? Valores maiores são necessariamente "mais" que valores menores? Se não, é nominal. Se sim, avança.

Pergunta dois: as distâncias entre os valores são conhecidas e iguais? Entre 1 e 2 a diferença é a mesma que entre 8 e 9? Se não conseguir confirmar isso com clareza, é ordinal. Se sim, avança. Pergunta três: existe um zero verdadeiro que significa ausência total? Zero quilos é ausência de peso. Zero graus Celsius não é ausência de temperatura. Se o zero for arbitrário, é intervalo. Se for absoluto, é proporção.

Esse método resolve cerca de 90% dos casos. Os outros 10% são os dados mistos ou construídos artificialmente que exigem consulta ao domínio ou ao criador do dataset.

👉 Clique no botão abaixo para saber mais sobre o assunto!

Erros comuns que destróem sua análise

Tratar ordinal como proporção é o pecado mais frequente. Scoring de satisfação, rankings, níveis de risco — todo mundo quer transformar isso em número proporcional porque é mais fácil rodar modelos. A diferença prática é enorme. Você pode estar inventando precisão que não existe nos dados. O inverso também acontece. Pessoas muito rigorosas tratam tudo como nominal porque não confiam na origem dos dados. Isso não é erro grave, mas gera perda de informação. Variáveis intervalares e proporcionais processadas como nominais perdem capacidade preditiva e força estatística. Em teste de hipótese, o poder do teste cai consideravelmente.

Outro erro comum é usar médias para resumo de dados ordinais. "A satisfação média dos clientes foi 3,7" é uma afirmação que parece legítima mas depende de assumir que a escala é intervalar. Se for ordinal, o correto seria dizer "a mediana foi 4". Na prática muitos analistas preferem relatar média mesmo em escalas ordinais porque é mais comunicável, mas precisam ser transparentes sobre essa escolha e ter justificativa sólida. Testar normalidade em variáveis nominais não faz sentido. Se você está tentando aplicar teste t ou ANOVA em dados categóricos, pare e relembre o que é escala de medida antes de continuar.

Impacto direto na escolha do teste estatístico

Cada escala permite um conjunto diferente de procedimentos. Quanto mais alta a escala, mais opções você tem. Nominal exige testes não paramétricos. Qui-quadrado de Pearson para associação, exato de Fisher para tabelas pequenas, G-test como alternativa. Regressão logística para prever categorias. Nada de correlação de Pearson aqui — ela pressupõe dados contínuos.

Ordinal abre espaço para testes de classificação como Mann-Whitney, Kruskal-Wallis, e Spearman para correlação. Modelos ordinários como regressão ordinal com logística cumulativa são mais adequados que modelos lineares tradicionais. A diferença de poder estatístico entre Mann-Whitney e t-test é geralmente pequena quando as suposições do t-test não são violadas gravemente. Intervalo e proporção permitem praticamente tudo. Pearson para correlação, t-test, ANOVA, regressão linear, correlação de Spearman (que funciona bem como fallback quando há outliers).

Se você está na dúvida entre ordinal e intervalo, a regra prática é: se a escala tem poucos patamares (menos de cinco), trate como ordinal. Escalas com sete ou mais pontos costumam se comportar bem como intervalares na prática, especialmente em ciências sociais onde Likert de cinco a sete pontos é padrão. Mas isso é conveniência analítica, não propriedade intrínseca dos dados.

Ferramentas e atalhos úteis

No Python, a biblioteca pandas não infere escala automaticamente. Você precisa declarar explicitamente usando categorical dtype quando apropriado. Isso evita que funções como mean() sejam aplicadas acidentalmente em colunas nominais e garante que bibliotecas como statsmodels reconheçam a estrutura correta. No R, os fatores fazem esse trabalho automaticamente. Defina a coluna como fator e as funções estatísticas se ajustam sozinhas. O problema é que fatores no R podem criar armadilhas com ordenação default (alfabética) que nem sempre reflete a ordem real dos dados. Sempre verifique o nível com levels().

Para documentação rápida durante a análise, a referência mais direta sobre classificação de variáveis é o manual do pacote haven do tidyverse, que trata conversões entre tipos de dados de forma transparente. Se estiver usando Jupyter com pandas, a extensão ydata-profiling gera um relatório completo incluindo sugeridos automaticamente.

Quando a teoria falha

Nenhum sistema de classificação é perfeito. Dados mistos aparecem o tempo todo. Um campo que é proporcional para uns e ordinal para outros, missing values que introduzem uma categoria extra, respostas que transformam dados contínuos em faixas discretas. Nesses casos, não force encaixe. Documente a limitação e escolha a abordagem mais conservadora que preserva a integridade dos dados. Às vezes o mais honesto é não fazer conta alguma. Dados nominais mal coletados não merecem média. Dados ordinais com escala de três pontos não aguentam regressão. Às vezes a melhor análise é descrever o que você tem e recomendar recolha de dados melhor estruturada.

Identificar corretamente a escala de medida desde o início economiza horas de refatoração depois. Leva dois minutos numa variável e evita um dia inteiro debuggando resultados que não fazem sentido.