Probabilidade Da Uniao De Dois Eventos - Probabilidade Da União De Dois Eventos - RETOEDU
Probabilidade Da União De Dois Eventos - RETOEDU

A probabilidade da união de dois eventos não é tão simples quanto parece

A gente começa com a fórmula no papel e acha que entendeu o assunto até encontrar um problema real. A probabilidade da uniao de dois eventos segue o princípio básico de que você soma as probabilidades individuais e subtrai a interseção para não contar duas vezes o que acontece nos dois eventos ao mesmo tempo.

Como calcular a probabilidade da uniao de dois eventos na prática

A fórmula é straightforward: P(A B) = P(A) + P(B) - P(A B). Quando os eventos são mutualmente exclusivos, a interseção é zero e a conta vira só uma soma. O problema é que quase ninguém para para verificar se realmente não há interseção antes de aplicar essa simplificação. O que eu vi acontecer com frequência em testes de QA é algo assim: uma equipe tinha um sistema que registrava falhas por tipo de defeito e por módulo do software. Quando precisavam calcular a probabilidade de ocorrer qualquer falha no módulo X ou do tipo Y, alguns simplesmente somavam as probabilidades. O resultado vinha maior que 1 em 30% dos casos porque haviam falhas que estavam em ambos os conjuntos ao mesmo tempo. A interseção não era nula e a simplificação quebrava tudo.

O workaround que adotei foi criar uma camada intermediária onde eu cruzava os datasets antes de rodar qualquer cálculo probabilístico. Em vez de confiar nos números que o relatório já dava, eu gerava uma tabela de contingência com as quatro células: A só, B só, interseção e nenhum dos dois. Aí a conta fica correta e ainda sobra informação útil sobre a relação entre os eventos.

👉 Clique no botão abaixo para saber mais sobre o assunto!

O que as pessoas costumam errar

O erro mais comum é assumir independência quando não há independência. Se você acha que A e B são independentes, pode escrever P(A B) = P(A)·P(B), mas essa suposição precisa ser verificada, não assumida. Em dados reais de produção, a correlação entre eventos quase sempre existe de alguma forma. Eu tive um caso onde dois eventos pareciam independentes à primeira vista porque as probabilidades condicionais mudavam menos de 5% em relação às marginais, mas o produto das probabilidades ainda gerava um erro acumulado de 8% na união quando o volume de amostra era grande. Para uma análise rápida isso pode passar despercebido, mas para modelos que dependem desse valor como input de decisão, 8% de erro é motivo de refazer o cálculo. Outro ponto que causa confusão é a diferença entre mutually exclusive e independent. Eles são coisas opostas na prática. Se dois eventos são mutualmente exclusivos e ambos têm probabilidade positiva, eles não podem ser independentes, porque a ocorrência de um implica a não ocorrência do outro. É um detalhe que todo material introdutório cita, mas que esquece-se de reforçar até as pessoas tropeçarem no problema real.

Quando a fórmula padrão falha

A probabilidade da uniao de dois eventos tal como apresentada funciona perfeitamente dentro dos axiomas de Kolmogorov, com espaços amostrais finitos ou contáveis bem definidos. O problema aparece quando o espaço amostral é contínuo e as densidades se sobrepõem de forma irregular, ou quando você trabalha com eventos definidos de forma operacional em sistemas complexos onde os limites entre"A"e"B"não são nítidos. Nesse cenário, estimar P(A B) com precisão se torna a parte mais difícil do processo, e o erro nessa estimativa se propaga diretamente para o resultado final. Uma alternativa que costumo usar nesses casos é a aproximação por simulação de Monte Carlo. Gero N realizações do processo, conto quantas caem em A, quantas em B, quantas na interseção, e calculo as frequências relativas. Com 100 mil iterações a variância do estimador já fica pequena o suficiente para a maioria das aplicações práticas, e o tempo de execução varia entre 2 e 5 segundos em uma máquina padrão, dependendo da complexidade do modelo subjacente. Isso elimina a necessidade de suposições analíticas sobre independência ou exclusividade mútua.

Se você estiver lidando com dados históricos e quiser aplicar a fórmula direta, o mínimo que eu recomendo é construir a matriz de confusão dos dois eventos no seu dataset e verificar a célula da interseção antes de qualquer coisa. Sem esse veredito preliminar, o número que você vai produzir provavelmente será otimista demais, e em cenários onde a probabilidade da uniao de dois eventos entra como fator de risco, um resultado otimista é pior do que um resultado conservador bem fundamentado.