Calcolatrice distribuzione di Poisson
Risultato
Probabilità di esattamente questo numero
- Probabilità di al massimo questo numero
- 43,35%
- Probabilità di almeno questo numero
- 76,19%
- Media
- 4,00
- Varianza
- 4,00
- Deviazione standard
- 2,00
Una calcolatrice della distribuzione di Poisson risponde a una domanda su eventi che arrivano a un tasso medio costante: su un certo intervallo, qual è la probabilità che ne capitino esattamente k? Il modello ha un solo parametro, di solito scritto lambda e uguale al tasso medio degli eventi moltiplicato per la durata dell'intervallo — il numero atteso di eventi nella finestra su cui stai chiedendo. La pagina riporta la probabilità di esattamente k insieme alle due forme cumulative, al massimo k e almeno k, e i tre numeri che riassumono l'intera distribuzione: la media, la varianza e la deviazione standard. La situazione che descrive è un flusso di eventi rari le cui occorrenze non si influenzano a vicenda — chiamate che arrivano a un servizio clienti, guasti in un lotto di componenti, incidenti su un tratto di strada, decadimenti radioattivi in una finestra di conteggio fissa. Il suo tratto distintivo è che la media è uguale alla varianza: entrambe valgono lambda, quindi un conteggio la cui dispersione è molto più ampia o molto più stretta della sua media non è stato prodotto da questo processo, e la deviazione standard è semplicemente la radice quadrata del numero medio di eventi.
Formula
P(X = k) = e^(−λ) · λ^k / k! con λ = tasso × durata dell'intervallo, e Var(X) = λ
- λ
- Il numero atteso di eventi nell'intervallo — il tasso moltiplicato per la durata della finestra, e l'unico parametro della distribuzione. Tutto su questa pagina è funzione di esso, ed è per questo che un tasso e un intervallo vengono chiesti separatamente invece che come un solo numero
- k
- Il numero di eventi su cui stai chiedendo. È un conteggio intero da 0 in su, e lo 0 è una risposta vera e non una casella vuota: «non è successo niente» è l'esito più probabile ogni volta che lambda sta sotto circa 0,7
- e^(−λ)
- Il peso del non accadere affatto, prima di mettere in conto il numero di eventi. È la ragione per cui l'intera distribuzione si abbassa man mano che lambda cresce: più alto è il numero atteso di eventi, più piccola è la probabilità di non vederne nessuno
- λ^k / k!
- La parte che cresce con k e poi cala: la potenza k-esima della media divisa per il fattoriale del conteggio. Il suo massimo sta a k = λ, ed è lì che la distribuzione concentra la maggior parte della sua massa
- media = varianza = λ
- La proprietà che rende riconoscibile questa distribuzione. Il numero medio di eventi e la sua varianza sono lo stesso numero, quindi la deviazione standard è la radice quadrata della media — √4 = 2 per una media di quattro eventi, √1000 ≈ 31,6 per una media di mille
Usala quando conti quante occorrenze arrivano per intervallo e gli arrivi sono indipendenti l'uno dall'altro: quante chiamate in un'ora, quanti difetti in un metro quadrato di tessuto, quante particelle in una finestra di conteggio fissa. Due condizioni portano quasi tutto il peso. Gli eventi devono essere rari rispetto all'occasione che hanno di capitare — un tasso così alto che il conteggio è di fatto limitato da qualcos'altro smette di essere poissoniano — e non devono raggrupparsi, perché una raffica di arrivi da un'unica causa rompe l'indipendenza che dà alla distribuzione la sua forma. Rivolgiti alla binomiale quando il numero di occasioni è fisso e contabile, dato che un conteggio di Poisson non ha limite superiore mentre uno binomiale non può superare il numero delle sue prove; passa all'approssimazione normale quando lambda è grande, dove le due coincidono da vicino e diventano leggibili le solite fasce di deviazioni standard. La media uguale alla varianza è anche la diagnosi più rapida a disposizione: dividi la varianza per la media di un insieme di conteggi per intervallo e, se il rapporto è lontano da uno, il processo è sovradisperso o sottodisperso e questo modello ha la forma sbagliata per lui.
Esempi svolti
Quattro eventi all'ora, chiedendo di tre
- Il tasso è 4 all'ora su un intervallo di 1 ora, quindi lambda vale 4
- P(X = 3) = e⁻⁴ × 4³ / 3! = 0,018316 × 64 / 6 = 0,1954, cioè 19,54%
- Sommando i conteggi da 0 a 3 si ottiene 43,35% al massimo; il resto della massa sopra 3 dà 76,19% almeno
- La media è lambda = 4 e altrettanto la varianza, il che rende la deviazione standard √4 = 2
Le due righe cumulative qui si sovrappongono e non è un errore: 43,35% più 76,19% fa 119,54%, e l'eccesso oltre il 100% è esattamente il 19,54% di tre eventi, che sta in entrambe le righe. È la stessa avvertenza del conteggio binomiale, e coglie l'errore comune di calcolare almeno come uno meno al massimo, che qui direbbe 56,65%. Nota anche che tre eventi non hanno nulla di notevole quando la media è quattro: sono mezza deviazione standard sotto la media.
Il centro della distribuzione
- Chiedendo di quattro eventi invece di tre: P(X = 4) = e⁻⁴ × 4⁴ / 4! = 0,018316 × 256 / 24 = 0,1954
- La probabilità esatta è lo stesso 19,54% del caso con tre eventi, perché il massimo della distribuzione sta a k = 4 = lambda e i due conteggi ai suoi lati sono ugualmente probabili
- Al massimo quattro è 62,88% e almeno quattro è 56,65%
- Media, varianza e deviazione standard restano invariate, dato che dipendono solo da lambda
Due conteggi con la stessa probabilità sono il segno visibile più chiaro che la distribuzione è centrata su lambda: con una media di quattro eventi, vedere tre e vedere quattro sono esiti ugualmente probabili, e ogni altro conteggio lo è meno. Le righe accumulate non sono simmetriche nemmeno qui — 62,88% contro 56,65% — perché la riga del al massimo include tutto k = 4 e anche quella del almeno lo include, e sotto il massimo la distribuzione è più sottile che sopra.
Lo stesso tasso su tre ore
- Il tasso è ancora 4 all'ora, ma l'intervallo ora è di 3 ore, quindi lambda = 4 × 3 = 12
- P(X = 3) = e⁻¹² × 12³ / 3! = 0,0000061 × 1728 / 6 = 0,0018, cioè 0,18%
- Al massimo tre è 0,23% e almeno tre è 99,95%
- La media è 12 e altrettanto la varianza, il che rende la deviazione standard √12 = 3,46
Questo è l'esempio che separa i due campi di input: non è cambiato nulla tranne la durata della finestra, e la risposta si è spostata dal 19,54% allo 0,18%. Servono entrambi i campi perché il parametro è il loro prodotto, e una pagina che prendesse solo il tasso darebbe la stessa risposta per un'ora e per una giornata. Anche le righe di riepilogo si muovono: con dodici eventi attesi, tre sta più di due deviazioni standard sotto la media, ed è per questo che la riga del almeno è ormai quasi certa.
Un evento all'ora, e non succede nulla
- Con lambda = 1, la probabilità di esattamente zero eventi è e⁻¹ = 0,3679, cioè 36,79%
- Chiedere al massimo zero pone la stessa domanda, quindi quella riga ripete lo stesso numero
- Almeno zero copre ogni conteggio possibile, quindi è esattamente 100% — non 99,99%
- La media e la varianza valgono entrambe 1, e la deviazione standard è 1
Lambda uguale a uno è il punto di partenza dei manuali e produce il numero più controintuitivo della pagina: più di un terzo delle volte, un processo che in media ha un evento all'ora non produce alcun evento. Vale la pena leggere anche la riga del almeno — è esattamente 100%, perché «zero o più» è l'intera distribuzione, e una pagina che la calcolasse sottraendo da una somma cumulativa potrebbe facilmente restituire 99,99%. Zero eventi è anche una risposta legittima da aver chiesto, ed è per questo che il campo del conteggio parte da zero invece che da uno.
Limiti
Il modello di Poisson si regge su due ipotesi che falliscono in silenzio, e vale la pena verificarle entrambe prima di fidarsi dei numeri. Gli eventi devono essere indipendenti l'uno dall'altro, e devono arrivare a un tasso che non deriva all'interno dell'intervallo che specifichi. L'indipendenza viene meno ogni volta che gli arrivi condividono una causa — le chiamate aumentano durante un guasto, i difetti si raggruppano su un rotolo di tessuto, gli incidenti si concentrano con il maltempo — e il sintomo è che i conteggi reali sono più sparsi di quanto la pagina preveda, con più intervalli vuoti e più intervalli affollati di quanti il modello ne ammetta. Un tasso che deriva fallisce nel verso opposto: un servizio clienti con una notte tranquilla e una mattina piena non ha un solo tasso orario, e farne la media produce un numero che non descrive né l'una né l'altra. Oltre alle ipotesi, due limiti vengono fatti rispettare invece che spiegati. La durata dell'intervallo e il tasso si possono inserire entro limiti ragionevoli, ma il loro prodotto è limitato, perché una media di milioni di eventi fa arrotondare a zero ogni probabilità del pannello e la pagina preferisce rifiutare che stampare una tabella di zeri. Il conteggio stesso deve essere un numero intero. E non c'è alcuna tabella di riferimento di probabilità di Poisson: la tabella che si desidera avrebbe una riga per ogni valore della media, e la media dipende dal tasso e dall'intervallo che hai inserito, quindi una tabella stampata risponderebbe a una domanda diversa da quella del pannello sopra di essa.
Domande frequenti
- Che differenza c'è fra la distribuzione di Poisson e quella binomiale?
- La binomiale conta successi in un numero fisso di prove, quindi il suo conteggio non può superare quel numero; la Poisson conta eventi che arrivano da soli, quindi non ha limite superiore né un numero di prove da inserire. La binomiale ha bisogno di due ingressi — quante prove e la probabilità di ciascuna — mentre questa pagina ha bisogno di un tasso e di un intervallo, che si combinano nell'unico numero atteso di eventi. Le due coincidono nel caso stretto in cui il numero di prove è grande e la probabilità di ognuna è piccola, ed è per questo che gli eventi rari vengono descritti in pratica in entrambi i modi. Usa la binomiale quando riesci a nominare le occasioni, e la Poisson quando gli eventi semplicemente arrivano.
- Perché qui la media è uguale alla varianza?
- Perché quell'identità è ciò su cui il modello è costruito e non una coincidenza degli esempi: per un conteggio di Poisson la media e la varianza sono lo stesso numero, lambda, quindi la deviazione standard è sempre la radice quadrata della media. Ne segue un modo rapido di verificare se il modello calza: prendi un insieme di conteggi osservati, dividi la loro varianza per la loro media e, se il rapporto è molto sopra uno, i conteggi sono raggruppati invece che indipendenti, mentre un rapporto ben sotto uno significa che sono più uniformi di quanto il caso farebbe. In nessuno dei due casi il problema si risolve inserendo numeri diversi: significa che il processo non è poissoniano.
- Perché al massimo k e almeno k non sono complementari?
- Perché entrambe le righe includono il conteggio di esattamente k, quindi sommarle conta quell'esito due volte. Nell'esempio qui sopra, al massimo tre è 43,35% e almeno tre è 76,19%, che sommano a 119,54% — e l'eccesso oltre il 100% è esattamente il 19,54% di tre eventi. È la stessa aritmetica del conteggio binomiale e la stessa trappola: leggere almeno come uno meno al massimo sbaglia della probabilità che hai chiesto. Se vuoi un complementare vero, usa il valore di al massimo k − 1, oppure leggi le tre righe insieme e controlla che esattamente k riempia lo spazio fra loro.
- Quando un conteggio è davvero poissoniano?
- Quando gli eventi sono indipendenti, il tasso è stabile per tutto l'intervallo e gli eventi sono rari rispetto alle occasioni che hanno di capitare. L'indipendenza è l'ipotesi che fa il lavoro e quella che viene meno più spesso, perché il raggruppamento è facile da mancare guardando numeri di riepilogo: una fabbrica che dichiara ogni mese lo stesso totale di difetti può comunque avere giornate storte e giornate tranquille, e quel raggruppamento si manifesterà come conteggi più variabili di quanto questa pagina preveda. Il controllo pratico è quello della risposta precedente: confronta la varianza di un insieme di conteggi con la loro media. Se sono vicine, il modello è una buona descrizione; se sono lontane, nessuna scelta del tasso lo aggiusterà.
- Che cosa succede quando il tasso è zero?
- Nell'intervallo non può accadere nulla, quindi il conteggio di zero ha probabilità 100% e ogni altro conteggio ha probabilità 0%. La pagina lo riporta invece di fallire: un tasso di zero, o un intervallo di durata zero, danno entrambi lambda uguale a zero con nessun evento atteso, e chiedere di uno o più eventi restituisce 0% mentre chiedere di nessuno restituisce 100%. Vale la pena sapere che questo caso è gestito esplicitamente, perché la formula così com'è scritta contiene un fattore zero elevato a k e un meno infinito dal logaritmo, e un'implementazione che la valutasse ingenuamente produrrebbe un risultato senza senso invece della risposta ovvia.
- Perché non c'è una tabella di probabilità di Poisson su questa pagina?
- Perché ogni riga di una tabella simile apparterrebbe a un valore diverso della media, e qui la media è il prodotto dei due numeri che inserisci. Una tabella stampata sarebbe giusta per un tasso e un intervallo e sbagliata per ogni altra combinazione, quindi risponderebbe a una domanda diversa da quella del pannello — e dove i due non concordassero, quello corretto sarebbe il pannello. Il pannello è la tabella: le tre righe di probabilità sono i valori di esattamente, al massimo e almeno per la media che hai indicato, e cambiare il tasso o l'intervallo le ricalcola. Le tabelle di riferimento si guadagnano il loro posto sulle pagine le cui righe non dipendono da alcun input, come una scala di valutazione o un insieme di soglie.
Riferimenti
- 4.3 Binomial Distribution — Introductory Statistics 2e (the fixed number of independent trials with a constant success probability, which is precisely the constraint a Poisson count does not have) — OpenStax, Rice University
- 1.3.6.6.1. Normal Distribution — e-Handbook of Statistical Methods (the density, the role of the mean and standard deviation, and the standard normal as the reference case a large-mean Poisson count approaches) — National Institute of Standards and Technology (NIST)
- 1.3.6.1. What is a Probability Distribution — e-Handbook of Statistical Methods (what it means for a count to have a distribution, and how probabilities are read off the outcomes it assigns them to) — National Institute of Standards and Technology (NIST)