Calculadora de distribuição de Poisson
Resultado
Probabilidade de exatamente esta quantidade
- Probabilidade de no máximo esta quantidade
- 43,35%
- Probabilidade de no mínimo esta quantidade
- 76,19%
- Média
- 4,00
- Variância
- 4,00
- Desvio padrão
- 2,00
Esta calculadora de distribuição de Poisson responde a uma pergunta sobre eventos que chegam a uma taxa média constante: ao longo de certo intervalo, qual é a chance de que cheguem exatamente k deles? O modelo tem um único parâmetro, normalmente escrito lambda e igual à taxa média de eventos multiplicada pela duração do intervalo — o número esperado de eventos na janela sobre a qual você está perguntando. A página informa a chance de exatamente k junto com as duas formas acumuladas, no máximo k e no mínimo k, e os três números que resumem a distribuição inteira: a média, a variância e o desvio padrão. A situação que ela descreve é um fluxo de eventos raros cujas ocorrências não influenciam umas às outras — chamadas chegando a uma central de atendimento, falhas num lote de componentes, acidentes num trecho de estrada, decaimentos radioativos numa janela de contagem fixa. O traço que define o modelo é que a média é igual à variância: as duas valem lambda, então uma contagem cuja dispersão é muito maior ou muito menor do que a média não foi produzida por este processo, e o desvio padrão é simplesmente a raiz quadrada do número médio de eventos.
Fórmula
P(X = k) = e^(−λ) · λ^k / k! com λ = eventRate × intervalLength, e média = variância = λ
- λ
- O número esperado de eventos no intervalo — a taxa multiplicada pela duração da janela, e o único parâmetro da distribuição. Tudo nesta página é função dele, e é por isso que a taxa e o intervalo são pedidos separadamente, em vez de um número só
- k
- O número de eventos sobre o qual você está perguntando. É uma contagem inteira a partir de 0, e o 0 é uma resposta de verdade, não uma resposta vazia: não aconteceu nada é o resultado mais provável sempre que lambda fica abaixo de mais ou menos 0,7
- e^(−λ)
- O peso de nada acontecer, antes de a contagem entrar na conta. É a razão pela qual a distribuição inteira encolhe conforme lambda cresce: quanto maior o número esperado de eventos, menor a chance de não ver nenhum
- λ^k / k!
- A parte que cresce com k e depois cai: a k-ésima potência da média dividida pelo fatorial da contagem. O pico dela fica em k = λ, e é nesse pico que a distribuição concentra a maior parte da sua massa
- média = variância = λ
- A propriedade que torna esta distribuição reconhecível. O número médio de eventos e a variância dele são o mesmo número, então o desvio padrão é a raiz quadrada da média — √4 = 2 para uma média de quatro eventos, √1.000 ≈ 31,6 para uma média de mil
Use quando você estiver contando quantos eventos chegam por intervalo e as chegadas forem independentes umas das outras: quantas chamadas numa hora, quantos defeitos por metro quadrado de tecido, quantas partículas numa janela de contagem fixa. Duas condições carregam quase todo o peso. Os eventos precisam ser raros em relação à oportunidade de eles acontecerem — uma taxa tão alta que a contagem fica essencialmente limitada por outra coisa deixa de ser Poisson — e eles não podem se agrupar, porque uma rajada de chegadas com uma causa só quebra a independência que dá forma à distribuição. Prefira a binomial quando o número de oportunidades for fixo e contável, já que uma contagem de Poisson não tem teto enquanto uma contagem binomial não passa do número de tentativas; e prefira a aproximação normal quando lambda for grande, faixa em que as duas concordam de perto e as faixas familiares de desvio padrão ficam legíveis. A média igual à variância é também o diagnóstico mais rápido que existe: divida a variância pela média de um conjunto de contagens e, se a razão ficar longe de um, o processo está sobre ou subdisperso e este modelo é a forma errada para ele.
Exemplos resolvidos
Quatro eventos por hora, perguntando sobre três
- A taxa é 4 por hora num intervalo de 1 hora, então lambda é 4
- P(X = 3) = e⁻⁴ × 4³ / 3! = 0,018316 × 64 / 6 = 0,1954, ou seja, 19,54%
- Somando as contagens de 0 a 3 chega-se a 43,35% no máximo; o resto da massa acima de 3 dá 76,19% no mínimo
- A média é lambda = 4 e a variância também, o que faz o desvio padrão ser √4 = 2
As duas linhas acumuladas se sobrepõem aqui, e isso não é erro: 43,35% mais 76,19% dá 119,54%, e o excesso sobre 100% é exatamente os 19,54% de três eventos, que estão nas duas linhas. É o mesmo cuidado que se tem com uma contagem binomial, e ele pega o erro comum de calcular o no mínimo como um menos o no máximo, o que diria 56,65% aqui. Repare também que três eventos não têm nada de extraordinário quando a média é quatro: fica meio desvio padrão abaixo da média.
O centro da distribuição
- Perguntando sobre quatro eventos em vez de três: P(X = 4) = e⁻⁴ × 4⁴ / 4! = 0,018316 × 256 / 24 = 0,1954
- A chance exata é os mesmos 19,54% de três eventos, porque o pico da distribuição fica em k = 4 = lambda e as duas contagens de cada lado dele são igualmente prováveis
- No máximo quatro é 62,88% e no mínimo quatro é 56,65%
- A média, a variância e o desvio padrão não mudam, já que dependem só de lambda
Duas contagens com a mesma probabilidade são o sinal visível mais claro de que a distribuição está centrada em lambda: com uma média de quatro eventos, ver três e ver quatro são igualmente prováveis, e qualquer outra contagem é menos provável que as duas. As linhas acumuladas não são simétricas nem aqui — 62,88% contra 56,65% — porque a linha do no máximo inclui os 4 inteiros e a do no mínimo também, e abaixo do pico a distribuição é mais fina do que acima dele.
A mesma taxa ao longo de três horas
- A taxa continua 4 por hora, mas o intervalo agora é de 3 horas, então lambda = 4 × 3 = 12
- P(X = 3) = e⁻¹² × 12³ / 3! = 0,0000061 × 1.728 / 6 = 0,0018, ou seja, 0,18%
- No máximo três é 0,23% e no mínimo três é 99,95%
- A média é 12 e a variância também, o que faz o desvio padrão ser √12 = 3,46
Este é o exemplo que separa os dois campos de entrada: nada mudou além da duração da janela, e a resposta saiu de 19,54% para 0,18%. Os dois campos são necessários porque o parâmetro é o produto deles, e uma página que aceitasse só a taxa daria a mesma resposta para uma hora e para um dia. As linhas de resumo acompanham: com doze eventos esperados, três está mais de dois desvios padrão abaixo da média, e é por isso que a linha do no mínimo agora é quase certa.
Um evento por hora, e nada acontece
- Com lambda = 1, a chance de exatamente zero eventos é e⁻¹ = 0,3679, ou seja, 36,79%
- Perguntar pelo no máximo zero é a mesma pergunta, então essa linha repete o mesmo número
- No mínimo zero cobre todas as contagens possíveis, então é exatamente 100% — e não 99,99%
- A média e a variância são ambas 1, e o desvio padrão é 1
Lambda igual a um é o ponto de partida dos livros e produz o número mais contraintuitivo da página: em mais de um terço das vezes, um processo que faz um evento por hora em média não faz evento nenhum. Vale ler a linha do no mínimo também — ela é 100% exatamente, porque zero ou mais é a distribuição inteira, e uma página que a calculasse subtraindo de uma soma acumulada poderia facilmente devolver 99,99%. Zero eventos também é uma resposta legítima de se pedir, e é por isso que o campo de contagem começa em zero, e não em um.
Limitações
O modelo de Poisson se apoia em duas suposições que falham em silêncio, e vale conferir as duas antes de confiar nos números. Os eventos precisam ser independentes uns dos outros e precisam chegar a uma taxa que não se desloque dentro do intervalo informado. A independência quebra sempre que as chegadas compartilham uma causa — chamadas disparam durante uma queda do sistema, defeitos se agrupam num rolo de tecido, acidentes se agrupam em tempo ruim — e o sintoma é que as contagens reais ficam mais espalhadas do que a página prevê, com mais intervalos vazios e mais intervalos muito cheios do que o modelo permite. Uma taxa que se desloca falha para o outro lado: uma central com uma noite calma e uma manhã cheia não tem uma taxa horária só, e tirar a média das duas produz um número que não descreve nenhuma delas. Além das suposições, dois limites são impostos em vez de explicados. A duração do intervalo e a taxa podem ser informadas até limites razoáveis, mas o produto das duas é limitado, porque uma contagem média na casa dos milhões faz toda probabilidade do painel arredondar para zero e a página prefere recusar a imprimir uma tabela de zeros. A contagem em si precisa ser um número inteiro. E não há aqui nenhuma tabela de referência de probabilidades de Poisson: a tabela que as pessoas querem tem uma linha por valor da média, e a média depende da taxa e do intervalo que você informou, então uma tabela impressa responderia a uma pergunta diferente da do painel acima.
Perguntas frequentes
- Qual é a diferença entre a distribuição de Poisson e a binomial?
- A binomial conta quantas tentativas deram certo num número fixo de tentativas, então a contagem dela não passa desse número; a de Poisson conta eventos que chegam por conta própria, então não há teto nem número de tentativas a informar. A binomial precisa de duas entradas — quantas tentativas e a chance de cada uma — enquanto esta página precisa de uma taxa e de um intervalo, que se combinam no único número esperado de eventos. As duas concordam no caso estreito em que o número de tentativas é grande e a chance de cada uma é pequena, e é por isso que eventos raros são descritos das duas formas na prática. Use a binomial quando você conseguir nomear as oportunidades, e a de Poisson quando os eventos simplesmente chegam.
- Por que aqui a média é igual à variância?
- Porque essa identidade é aquilo sobre o que o modelo é construído, e não uma coincidência dos exemplos: numa contagem de Poisson a média e a variância são o mesmo número, lambda, então o desvio padrão é sempre a raiz quadrada da média. Isso dá um jeito rápido de testar se o modelo serve: pegue um conjunto de contagens observadas, divida a variância delas pela média e, se a razão ficar bem acima de um, as contagens estão agrupadas em vez de independentes, enquanto uma razão bem abaixo de um significa que elas são mais uniformes do que o acaso faria. Nenhum dos dois casos se resolve informando outros números — significa que o processo não é de Poisson.
- Por que no máximo k e no mínimo k não são complementares?
- Porque as duas linhas incluem a contagem de exatamente k, então somá-las conta esse resultado duas vezes. No exemplo acima, no máximo três é 43,35% e no mínimo três é 76,19%, o que soma 119,54% — o excesso sobre 100% é exatamente os 19,54% de três eventos. É a mesma aritmética da contagem binomial e a mesma armadilha: ler o no mínimo como um menos o no máximo erra justamente pela probabilidade sobre a qual você perguntou. Se você quer um complemento de verdade, use o valor de no máximo k − 1, ou leia as três linhas juntas e confira que exatamente k preenche a diferença entre elas.
- Quando uma contagem é de fato de Poisson?
- Quando os eventos são independentes, a taxa é estável ao longo do intervalo e os eventos são raros em relação às oportunidades de eles acontecerem. A independência é a suposição que faz o trabalho e a que falha com mais frequência, porque o agrupamento é fácil de não ver nos números resumidos: uma fábrica que reporta o mesmo total mensal de defeitos todo mês ainda pode estar tendo dias ruins e dias calmos, e esse agrupamento vai aparecer como contagens mais variáveis do que esta página prevê. A conferência prática é a da resposta anterior — compare a variância de um conjunto de contagens com a média delas. Se estiverem próximas, o modelo descreve bem; se estiverem distantes, nenhuma escolha de taxa resolve.
- O que acontece quando a taxa é zero?
- Nada pode ocorrer no intervalo, então a contagem zero tem probabilidade 100% e qualquer outra contagem tem probabilidade 0%. A página informa isso em vez de falhar: uma taxa de zero, ou um intervalo de duração zero, dão os dois lambda igual a zero e nenhum evento esperado, e perguntar por um ou mais eventos devolve 0% enquanto perguntar por nenhum devolve 100%. Vale saber que isso é tratado de forma explícita, porque a fórmula como está escrita contém um fator de zero elevado a k e um menos infinito vindo do logaritmo, e uma implementação que a avaliasse de forma ingênua produziria um resultado sem sentido em vez da resposta óbvia.
- Por que não há uma tabela de probabilidades de Poisson nesta página?
- Porque cada linha de uma tabela dessas pertence a um valor diferente da média, e a média aqui é o produto dos dois números que você informa. Uma tabela impressa estaria certa para uma taxa e um intervalo e errada para todas as outras combinações, então ela responderia a uma pergunta diferente da do painel — e onde as duas discordassem, o painel é que estaria certo. O painel é a tabela: as três linhas de probabilidade são os valores de exatamente, no máximo e no mínimo para a média que você especificou, e mudar a taxa ou o intervalo as recalcula. Tabelas de referência ganham o seu lugar em páginas cujas linhas não dependem de nenhuma entrada, como uma escala de notas ou um conjunto de faixas de corte.
Referências
- 4.3 Binomial Distribution — Introductory Statistics 2e (the fixed number of independent trials with a constant success probability, which is precisely the constraint a Poisson count does not have) — OpenStax, Rice University
- 1.3.6.6.1. Normal Distribution — e-Handbook of Statistical Methods (the density, the role of the mean and standard deviation, and the standard normal as the reference case a large-mean Poisson count approaches) — National Institute of Standards and Technology (NIST)
- 1.3.6.1. What is a Probability Distribution — e-Handbook of Statistical Methods (what it means for a count to have a distribution, and how probabilities are read off the outcomes it assigns them to) — National Institute of Standards and Technology (NIST)