Calculadora de distribuição binomial
Resultado
Probabilidade de exatamente esta quantidade
- Probabilidade de no máximo esta quantidade
- 17,19%
- Probabilidade de no mínimo esta quantidade
- 94,53%
- Média
- 5,00
- Desvio padrão
- 1,58
- Variância
- 2,50
A Calculadora de distribuição binomial responde a uma pergunta sobre tentativas repetidas de sim ou não: com n tentativas independentes que têm probabilidade p de sucesso cada uma, qual é a chance de obter exatamente k sucessos? Ela informa essa chance junto com as duas versões acumuladas — no máximo k e no mínimo k — e os três números que resumem a distribuição inteira: a média do número de sucessos, a variância e o desvio padrão. O cenário que ela descreve é o de um número fixo de tentativas, uma probabilidade de sucesso constante e independência entre as tentativas, o que cobre desde lançamentos de moeda e arremessos livres até um lote de componentes em que cada um passa na inspeção com a mesma probabilidade. Os valores acumulados costumam ser os que as pessoas realmente precisam, porque uma pergunta de verdade raramente é sobre uma contagem exata — ela é sobre atingir uma meta ou ficar abaixo de um limite.
Fórmula
P(X = k) = C(n, k) · p^k · (1 − p)^(n − k) onde C(n, k) = n! / (k! (n − k)!)
- n
- O número de tentativas, até 1.000 — repetições independentes do mesmo evento de sim ou não. O limite é uma restrição de desempenho e não matemática: a distribuição binomial está perfeitamente definida para n bem maior, mas as contagens desta página crescem com n e uma página que trava é pior do que uma que recusa
- k
- O número de sucessos sobre o qual você está perguntando. Ele não pode passar de n, já que mais sucessos do que tentativas não é um resultado improvável, mas um pedido impossível
- p
- A probabilidade de sucesso de uma única tentativa, informada em porcentagem de 0 a 100. É a mesma em todas as tentativas, e é isso que torna as tentativas intercambiáveis e a contagem binomial
- C(n, k)
- O coeficiente binomial: de quantas maneiras k sucessos podem ser arranjados entre n tentativas. É a razão pela qual as contagens do meio são as prováveis — uma contagem perto do meio pode ser arranjada de muito mais maneiras do que uma extrema
- p^k · (1 − p)^(n − k)
- A chance de um arranjo específico de k sucessos e n − k fracassos. Multiplicar pelo número de arranjos transforma um arranjo em qualquer arranjo
- np
- A média do número de sucessos. A variância é np(1 − p) e o desvio padrão é a raiz quadrada dela, que é o que as três últimas linhas do painel informam
Use quando as tentativas forem contadas em vez de medidas: quantos de 20 componentes passam na inspeção, quantos de 12 arremessos livres entram, qual é a chance de uma sequência de pelo menos 8 caras em 10 lançamentos. As duas linhas acumuladas são as que se usam na prática, porque uma meta é quase sempre um limiar — no mínimo k para passar num portão de qualidade, no máximo k para ficar dentro de um orçamento — e ler um limiar na linha da contagem exata significa somar contagens à mão. Escolha outra ferramenta quando o número de tentativas não for fixado de antemão, quando a probabilidade de sucesso mudar de tentativa para tentativa, ou quando as tentativas influenciarem umas às outras; o terceiro caso é o que mais quebra a hipótese na prática.
Exemplos resolvidos
Dez tentativas, três sucessos, 50% de chance a cada vez
- Há C(10, 3) = 120 maneiras de colocar três sucessos entre dez tentativas
- Um arranjo tem probabilidade 0,5³ × 0,5⁷ = 1/1.024
- 120 / 1.024 = 0,1171875, então exatamente três sucessos acontece em 11,72% das vezes
- Somando as contagens de 0 a 3 chega-se a 17,19% no máximo; a média é np = 10 × 0,5 = 5
A diferença entre as duas linhas acumuladas é o ponto deste exemplo: 17,19% no máximo e 94,53% no mínimo deixam 11,72% entre elas, e essa fatia que falta é exatamente a probabilidade de três — a contagem sobre a qual você perguntou. É essa aritmética que pega o erro comum de ler no mínimo como um menos no máximo, o que daria 82,81% aqui. A média de 5 com desvio padrão de 1,58 também mostra que 3 não tem nada de notável nessa configuração: ele fica um pouco mais de um desvio padrão abaixo da média.
Vinte tentativas com 25% de chance a cada vez
- A média é np = 20 × 0,25 = 5 sucessos
- A variância é np(1 − p) = 20 × 0,25 × 0,75 = 3,75, e a raiz quadrada dela é cerca de 1,94
- Exatamente quatro sucessos tem probabilidade 18,97%, a contagem mais provável aqui
- No máximo quatro é 41,48%, e no mínimo quatro é 77,48%
Quatro sucessos é ao mesmo tempo a contagem vizinha da média e a mais provável, e é por isso que os dois valores acumulados ficam tão assimétricos em volta dela: 41,48% da distribuição está na contagem mais provável ou abaixo dela. Essa assimetria é geral e vale a pena guardar — para qualquer contagem igual ou inferior à média, a chance de estar no máximo nessa contagem é maior do que a intuição sugere, porque a distribuição tem uma cauda superior longa quando p é pequeno. As linhas de resumo são o que permite ver isso sem somar termos: um desvio padrão de 1,94 em torno de uma média de 5 coloca o 4 bem dentro da faixa comum.
Cem tentativas, nenhum sucesso, 2% de chance a cada vez
- Com k = 0 há exatamente um arranjo — nenhum sucesso —, então C(100, 0) = 1
- A probabilidade dele é 0,98¹⁰⁰ ≈ 0,1326, então não obter nenhum é 13,26%
- No máximo zero sucessos é o mesmo evento, então aquela linha coincide exatamente com ele
- No mínimo zero sucessos inclui todos os resultados possíveis, então é 100%
Este é o caso que fixa a linha do no mínimo. No mínimo zero sucessos não é uma borda sem informação, mas uma certeza — todo resultado tem zero ou mais sucessos —, então 100% é a resposta correta e não um preenchimento. Lendo as três linhas juntas, o erro de um fica visível: no máximo 13,26% mais no mínimo 100% passa de 100% porque a contagem de exatamente zero está dentro das duas, e o quanto elas se sobrepõem é justamente esses 13,26%. A outra metade do exemplo é a média: dois sucessos esperados em cem parece seguro, e ainda assim não obter nenhum é cerca de uma rodada em oito.
Mil tentativas com 50% de chance a cada vez
- A média é 1.000 × 0,5 = 500 sucessos e a variância é 250, então o desvio padrão é cerca de 15,81
- Exatamente 500 sucessos — a contagem mais provável — tem probabilidade 2,52%
- No máximo 500 é 51,26%, e no mínimo 500 também é 51,26%, porque 500 é o centro
- As duas linhas acumuladas são iguais aqui, o que só acontece na média
Duas coisas valem a pena neste exemplo. A primeira é que a contagem mais provável não é um evento provável: 500 é o pico da distribuição e ainda assim acontece cerca de uma vez em quarenta, porque há mil contagens diferentes entre as quais repartir a probabilidade. A segunda é que as duas linhas acumuladas são iguais em exatamente 51,26% — uma conferência útil, já que na média a distribuição é simétrica e qualquer desvio da igualdade significa que a contagem está fora do centro. Note também que uma probabilidade de 2,52% aqui é calculada com coeficientes binomiais de centenas de dígitos, e é por isso que a ferramenta limita o número de tentativas em vez de tentar ser corajosa.
Limitações
O modelo binomial se apoia em três hipóteses, e quando uma delas falha os números continuam plausíveis enquanto estão errados. O número de tentativas precisa ser fixado de antemão, e não decidido no meio do caminho; a probabilidade de sucesso precisa ser a mesma em todas as tentativas; e as tentativas precisam ser independentes umas das outras — e a terceira é a que mais falha na prática, porque tentativas tiradas do mesmo lote, da mesma pessoa ou do mesmo dia tendem a se mover juntas. Quando os sucessos se agrupam, a dispersão real é maior do que esta página informa. Mais dois limites merecem ser declarados. O número de tentativas está limitado a 1.000, o que é uma restrição de desempenho e não matemática: o modelo está definido muito além disso, mas as contagens crescem com o número de tentativas e uma página que trava não ajuda ninguém. E não há nesta página uma tabela de probabilidades por contagem: a tabela que as pessoas querem tem uma linha por número possível de sucessos, o que depende das tentativas e da probabilidade que você informa, e uma tabela de referência aqui não consegue ver esses valores — as três linhas do painel são a forma dessa tabela para os números que você escolheu.
Perguntas frequentes
- Por que no mínimo k não é simplesmente 100% menos no máximo k?
- Porque os dois eventos não são complementares. No máximo k significa de zero a k sucessos; no mínimo k significa de k a n. A contagem de exatamente k está dentro dos dois, então subtrair um de 100% deixa de fora essa fatia compartilhada — que é justamente a probabilidade sobre a qual você perguntou. Use a linha de no máximo k − 1 se quiser o complemento de no mínimo k, ou leia as três linhas juntas: exatamente k é sempre a diferença entre as outras duas, e essa diferença é uma conferência útil das três.
- A probabilidade de sucesso pode ser 0% ou 100%?
- Pode, e as duas são significativas em vez de casos extremos. Uma chance de 0% significa que o evento nunca acontece, então a contagem de sucessos é 0 com certeza; uma chance de 100% significa que ele acontece sempre, então a contagem é n com certeza. O painel informa as linhas resultantes de 0% e 100% sem cerimônia. Se você estiver vendo um 0% chapado para uma contagem que esperava pequena mas possível, confira o campo da probabilidade — um 0 digitado onde se queria 10 produz exatamente isso.
- Por que não há uma tabela com a probabilidade de cada número de sucessos?
- Porque uma tabela dessas depende das tentativas e da probabilidade de sucesso que você informa, e uma tabela de referência nesta página não consegue ver esses valores — ela é calculada a partir de constantes, então mostraria os números de outra configuração sob um título parecido com o seu. Em vez disso, as três linhas do painel de resultados dão a forma dessa tabela na contagem sobre a qual você perguntou: a contagem exata, tudo abaixo dela e tudo acima dela. Para ver a distribuição inteira, mude o número de sucessos e leia a linha da contagem exata de novo — aqueles valores são a tabela, uma linha por vez.
- O que a média me diz que a probabilidade não diz?
- Ela diz onde a distribuição está, que é o que torna uma contagem interpretável. Uma média de 5 sucessos com desvio padrão de 1,58 faz de 3 um resultado comum, enquanto a mesma contagem de 3 contra uma média de 12 estaria muito longe. A média é np, a variância é np(1 − p) e o desvio padrão é a raiz quadrada dela — as três linhas de resumo são a distribuição descrita pelo seu centro e pela sua dispersão, em vez de uma probabilidade de cada vez.
- O que acontece se eu pedir mais sucessos do que tentativas?
- O pedido é recusado em vez de respondido com 0%. Mais sucessos do que tentativas não é um resultado improvável — não é resultado nenhum, e informar 0% sugeriria que o modelo o considerou e o descartou. O painel informa um erro, e o mesmo vale para um número de tentativas acima de 1.000, recusado como limite de desempenho e não porque a matemática deixa de funcionar ali.
- As tentativas realmente precisam ser independentes?
- Precisam, e essa é a hipótese que mais falha em dados reais. Se os sucessos se agrupam — componentes do mesmo lote de produção, arremessos do mesmo jogador no mesmo dia, pacientes da mesma clínica —, então as tentativas carregam informação umas sobre as outras, e a dispersão real da contagem é maior do que a distribuição binomial diz. A média continua mais ou menos certa na presença de agrupamento, enquanto o desvio padrão e as probabilidades das caudas não, então as três linhas de resumo são as primeiras a desconfiar. Um modelo com variação extra embutida é a ferramenta certa quando você sabe que as tentativas se agrupam.
Referências
- 1.3.6.6.18. Binomial Distribution — e-Handbook of Statistical Methods (the binomial probability function, its mean np and variance np(1 − p), and the assumptions the model rests on) — National Institute of Standards and Technology (NIST)
- 4.3 Binomial Distribution — Introductory Statistics 2e (the fixed number of independent trials with a constant success probability, and the cumulative form used by the at most and at least rows) — OpenStax, Rice University
- 1.3.6.1. What is a Probability Distribution — e-Handbook of Statistical Methods (what it means for a count to have a distribution, and how probabilities are read off the outcomes it assigns them to) — National Institute of Standards and Technology (NIST)