O básico de uma vez
Descritiva é a parte da estatística que resume dados sem tentar prever nada. Você tem um conjunto de números e quer saber como eles se comportam de forma prática. Média, mediana, desvio padrão, quartis. Isso é tudo descritiva. Não há inferência, não há testes de hipótese, não há modelo algum rodando por trás.
O que é descritiva no dia a dia
No meu trabalho, eu geralmente começo com o problema real antes de definir qualquer coisa. Há pouco tempo, eu precisei entregar um relatório de performance de vendas para uma equipe que não tinha formação em estatística. Os dados eram meses com valores de vendas, alguns outliers óbvios de promoções e sazonalidade. A primeira coisa que fiz foi rodar média, mediana e desvio padrão. A média disse algo completamente enganoso porque dois meses tiveram picos enormes de promoção. A mediana, por outro lado, mostrou a tendência real. Esse é um exemplo clássico de por que só olhar a média é erro comum. Quando alguém pergunta o que é descritiva, a resposta mais honesta é: é a arte de não mentir com seus próprios números. Você pega o caos e coloca em formas que qualquer pessoa consegue ler. Tabelas, gráficos, medidas de tendência central e dispersão. Pronto. O resto vem depois, se for necessário.
Uma coisa que pouca gente explica direito é a diferença entre medidas de posição e medidas de dispersão. As primeiras te dizem onde os dados estão agrupados. As segundas te dizem o quanto eles espalham ao redor desse grupo. Quando você vê um desvio padrão baixo, os valores estão perto uns dos outros. Quando é alto, há uma variabilidade grande. Isso parece óbvio, mas na prática as pessoas confundem frequência com significado. Um dado pode aparecer muito e ainda assim não representar nada útil se a dispersão for enorme.
Como montar uma análise descritiva completa
Eu costumo seguir um fluxo simples, mas que muita gente pula na pressa. Primeiro, organize os dados. Se estiver usando planilha, verifique se não há linhas em branco, textos onde deveriam existir números, datas fora do padrão. Perdi cerca de 40 minutos numa vez porque uma coluna de valor monetário tinha uma célula com "A combinar" escrita em vez de número. A média saiu errada e ninguém percebeu na primeira olhada. Depois disso, calcule as medidas de tendência central. Média aritmética é a soma dos valores dividida pela quantidade. Mediana é o valor do meio quando os dados estão ordenados. Moda é o valor que mais se repete. Em dados contínuos, a moda muitas vezes não existe ou é instável. Nesse caso, foque na média e na mediana. Se elas forem bem diferentes, os dados provavelmente têm assimetria.
Agora a parte de dispersão. Desvio padrão é a raiz quadrada da variância. Variância é a média dos quadrados das diferenças entre cada valor e a média. Parece complicado na teoria, mas na prática é só somar tudo, tirar a média, subtrair a média de cada valor, elevar ao quadrado e calcular a raiz. No Excel, a função `=DESVPAD()` faz isso em segundos. No Google Sheets é a mesma função. Em Python com pandas, é `.std()`. Ferramenta não é o problema, o problema é interpretar o resultado. Um desvio padrão de 500 reais em vendas médias de 1.000 reais significa algo diferente de um desvio padrão de 500 em vendas médias de 50.000 reais. O coeficiente de variação resolve essa confusão. É o desvio padrão dividido pela média, multiplicado por 100 para dar porcentagem. Se o coeficiente for acima de 30%, os dados são consideravelmente dispersos. Abaixo disso, são relativamente homogêneos. Esse número é mais útil do que o desvio padrão sozinho na maioria das situações do mundo real.
Gráficos que funcionam e os que só atrapalham
Histograma para ver a forma da distribuição. Gráfico de caixa para ver quartis e outliers de uma olhada só. Gráfico de barras para categorias. Gráfico de linha para séries temporais. Box plot é especialmente útil porque mostra de uma vez a mediana, os quartis primeiro e terceiro, e quaisquer valores que fiquem bem fora do padrão. Eu usava box plots para identificar valores atípicos em dados de tempo de resposta de servidores. Um gráfico desses revelou um servidor com latência altíssima que estava poluindo a média geral. O problema não era o servidor lento em si, era que ele não estava sendo excluído das análises anteriores. Evite gráficos de pizza quando tiver mais de três categorias. A leitura visual fica ruim e a informação é entregue de forma ineficiente. Gráfico de colunas funciona muito melhor para comparações. Rosquinha, aquele gráfico que parece pizza mas tem um buraco no meio, não agrega nada e ocupa espaço. Eu já vi relatórios inteiros construídos em torno dele. Ninguém pede por rosquinha. Ninguém precisa de rosquinha.
👉 Clique no botão abaixo para saber mais sobre o assunto!
Erros que eu vejo todo dia
O primeiro erro é tratar dados discretos como contínuos. Por exemplo, calcular média de notas de clientes em uma escala de 1 a 5 e apresentar com quatro casas decimais. Isso dá uma falsa sensação de precisão. Arredonde para uma ou duas casas no máximo. O segundo erro é ignorar a forma da distribuição. Se os dados são fortemente assimétrios, a média não representa nada. Nesses casos, a mediana é muito mais informativa. Eu trabalhei num projeto de análise de tempo de atendimento onde a maioria dos chamados durava cerca de 8 minutos, mas alguns duravam mais de duas horas. A média dava 23 minutos. A mediana, 7 minutos. Quem tivesse lido só a média teria uma visão completamente distorcida da operação.
O terceiro erro, e esse é mais sutil, é não separar variáveis categóricas de numéricas na hora de calcular estatísticas. Calcular média de um campo de estado civil é absurdo. Calcular mediana de um campo de cidade também. O computador não sabe diferenciar, então cabe a você colocar filtros antes de rodar qualquer função.
Ferramentas práticas
Se você está começando, Excel ou Google Sheets já resolvem 90% dos casos. Funções de estatística descritiva já vêm embutidas. `=MÉDIA()`, `=MEDIANA()`, `=MODA()`, `=DESVPAD()`, `=VAR.P()`, `=QUARTIL()`. É rápido e não requer instalação. Para datasets maiores ou análises mais repetitivas, Python com pandas é mais eficiente. Um único comando `.describe()` gera média, desvio padrão, quartis, mínimo e máximo de todas as colunas numéricas de uma vez. Leva menos de um segundo em datasets de até alguns milhões de linhas. Acima disso, começa a ficar lento e você precisa pensar em otimização.
Se preferir algo visual sem escrever código, tools como Tableau Public ou até o Power BI com seu campo de análise automática fazem descrições básicas com clique. A desvantagem é que você tem menos controle sobre os cortes e recortes que quer aplicar.
Quando descritiva não serve
Descritiva não prevê futuro. Ela não diz se suas vendas vão subir no próximo trimestre. Não testa se uma mudança causou um efeito. Não estabelece causalidade. Se alguém pedir para você "analisar os dados" e esperar uma conclusão sobre causa e efeito, está pedindo demais para uma análise puramente descritiva. Nesse caso, o próximo passo seria inferência estatística, regressão ou pelo menos um teste A/B bem desenhado. Também não funciona bem com dados muito pequenos. Se você tem menos de dez observações, qualquer medida de tendência central é instável. Uma única mudança de valor altera tudo. Nesses casos, a melhor descrição às vezes é só listar os valores brutos e deixar claro que o tamanho da amostra não permite generalização.
Por fim, descritiva só é tão boa quanto os dados que alimentam ela. Se a coleta é ruim, a limpeza é negligente, ou os instrumentos de medição são imprecisos, nenhuma análise descritiva elegante vai salvar o resultado. Eu já vi relatórios com tabelas bonitinhas e gráficos coloridos cuja base tinha erro de captura desde o início. A análise foi tecnicamente impecável e completamente inútil. Coleta de dados merece a mesma atenção que a análise em si.