Salta al contenuto principale
CalcMax

Calcolatrice della regola empirica

Risultato

68,27%

Quota entro 1σ

1σ sotto la media
85,00
1σ sopra la media
115,00
2σ sotto la media
70,00
2σ sopra la media
130,00
Quota entro 2σ
95,45%
3σ sotto la media
55,00
3σ sopra la media
145,00
Quota entro 3σ
99,73%

La regola empirica — la regola 68-95-99,7 — dice che per una distribuzione normale circa il 68% dei valori sta entro una deviazione standard dalla media, circa il 95% entro due e circa il 99,7% entro tre. Questa pagina trasforma quell'affermazione nei numeri di cui parla: le dai una media e una deviazione standard e stampa i sei estremi di quegli intervalli — i valori a una, due e tre deviazioni standard da entrambi i lati della media — insieme alla quota di distribuzione che ciascun intervallo copre. Le tre quote sono calcolate e non citate, quindi escono come 68,27%, 95,45% e 99,73%, che è la regola empirica senza il suo arrotondamento. Il nome della regola è una scorciatoia; il numero che la pagina stampa è quello di cui la regola è la scorciatoia.

Formula

un sigma: media ± 1σ · due sigma: media ± 2σ · tre sigma: media ± 3σ · quota entro kσ = 2Φ(k) − 1, dove Φ è la funzione di ripartizione della normale standard

media
Il centro della distribuzione. I sei estremi sono simmetrici rispetto a essa, quindi spostarla fa scorrere l'intero insieme degli intervalli senza cambiare nessuna delle tre quote
deviazione standard
Quanto è dispersa la distribuzione, e l'unità in cui la regola si conta — un sigma, due sigma, tre sigma. Deve essere positiva: una distribuzione normale con deviazione standard zero è un singolo punto, e la regola non ha niente da dire su di esso
kσ
Il numero di deviazioni standard — 1, 2 o 3. La quota dentro un intervallo dipende solo da k, ed è per questo che le tre percentuali sono le stesse in ogni pagina di risultati, qualunque siano la media e la deviazione standard
2Φ(k) − 1
La quota esatta fra −kσ e +kσ. La regola empirica la arrotonda a 68 / 95 / 99,7 per poterla ricordare; la pagina stampa il valore non arrotondato, che è ciò di cui quello arrotondato è l'abbreviazione

Usala per trasformare una media e una deviazione standard in intervalli che puoi davvero indicare. La regola empirica si incontra di solito come una frase su delle percentuali, che è difficile da applicare a una misura concreta; la stessa affermazione nella forma «qualunque valore sopra 130 sta a più di due deviazioni standard» non lo è. È anche il controllo rapido di sanità sulla deviazione standard stessa: se una deviazione standard da entrambi i lati copre un intervallo intorno alla media che non può contenere il 68% dei dati — perché va oltre un limite invalicabile, o perché i dati sono visibilmente sbilanciati — allora il modello normale è quello sbagliato per quei dati, e il controllo non costa nulla. La pagina presuppone una distribuzione normale dall'inizio alla fine; non ne adatta una ai tuoi dati e non ti dice se l'ipotesi regge.

Esempi svolti

  1. Una media di 100 e una deviazione standard di 15

    1. Una deviazione standard da entrambi i lati di 100 va da 100 − 15 = 85 a 100 + 15 = 115
    2. Due deviazioni standard vanno da 100 − 30 = 70 a 100 + 30 = 130
    3. Tre deviazioni standard vanno da 100 − 45 = 55 a 100 + 45 = 145
    4. Le quote non usano affatto né la media né la deviazione standard: 68,27% entro 1σ, 95,45% entro 2σ, 99,73% entro 3σ

    Le tre percentuali sono identiche in ogni esempio di questa pagina, e questo è il contenuto della regola e non una coincidenza di questo esempio. Una distribuzione normale è descritta completamente dal suo centro e dalla sua dispersione, e la quota che cade entro k deviazioni standard dal centro dipende solo da k: quindi la media e la deviazione standard spostano gli estremi e non toccano mai le quote. Se un risultato mostrasse una percentuale che si muove quando si muove la media, le percentuali starebbero venendo calcolate dalla quantità sbagliata, e stamparle sulle stesse tre righe è ciò che rende visibile quell'errore.

  2. La normale standard: media 0, deviazione standard 1

    1. Una deviazione standard da entrambi i lati di 0 va da −1 a 1
    2. Due deviazioni standard vanno da −2 a 2, e tre da −3 a 3
    3. Le quote restano invariate a 68,27%, 95,45% e 99,73%

    Con una media di zero e una deviazione standard di uno gli estremi sono i conteggi di sigma stessi, il che rende questa la versione della regola che vale la pena imparare a memoria: i numeri −1, −2, −3 e i loro positivi sono i punteggi z, e ogni altra distribuzione normale è questa, allungata e spostata. Mostra anche perché le quote non possono dipendere dagli input: qui gli estremi sono letteralmente i valori di k, e le percentuali accanto sono le stesse che erano con una media di 100.

  3. Una deviazione standard piccola: media 500, deviazione standard 0,5

    1. Una deviazione standard è mezzo punto, quindi il primo intervallo è da 499,5 a 500,5
    2. Due deviazioni standard vanno da 499 a 501, e tre da 498,5 a 501,5
    3. Le quote sono ancora 68,27%, 95,45% e 99,73%

    Niente della regola è legato al fatto che la deviazione standard sia un numero tondo o grande, e una distribuzione stretta è il caso in cui gli intervalli smettono di essere leggibili a colpo d'occhio. Una fascia di tolleranza su un pezzo lavorato si scrive di solito così — un obiettivo e una dispersione molto più piccola dell'obiettivo — e l'output utile è la riga degli estremi più che quella delle percentuali. È anche un promemoria del fatto che l'intervallo del 99,7% copre quasi tutto solo quando la distribuzione è davvero normale: tre deviazioni standard qui sono un intervallo piccolo in termini assoluti, e qualunque processo reale con una coda più pesante ne lascerebbe fuori molto più dello 0,27%.

  4. Una media negativa: −2,5 con una deviazione standard di 1,25

    1. Una deviazione standard da entrambi i lati di −2,5 va da −3,75 a −1,25
    2. Due deviazioni standard vanno da −5 a 0 — l'estremo superiore cade esattamente su zero
    3. Tre deviazioni standard vanno da −6,25 a 1,25, e attraversano lo zero
    4. Le quote restano invariate a 68,27%, 95,45% e 99,73%

    Una media sotto zero è ordinaria — un'anomalia di temperatura, un rendimento logaritmico, una differenza fra due misure — ed è il caso in cui gli intervalli attraversano lo zero, quindi un'implementazione con un errore di segno può comunque sembrare giusta su tutti gli esempi positivi. L'estremo superiore delle due sigma che cade esattamente su zero è il tipo di coincidenza che fa sembrare deliberata una risposta sbagliata, ed è per questo che il caso è fissato come test invece di essere lasciato al caso. La deviazione standard resta positiva comunque: è una larghezza, non una coordinata, e solo la media porta il segno.

Limiti

La regola appartiene alla distribuzione normale e a nient'altro. Viene spesso ripetuta come se il 68% fosse un fatto sui dati in generale, ma è una proprietà di una particolare curva: una distribuzione con una forma diversa ha quote diverse a una, due e tre deviazioni standard, e una sbilanciata può avere quote molto diverse dai due lati della media. Quindi la pagina presuppone la normalità invece di verificarla, e un risultato qui vale quanto vale quell'ipotesi. Altri tre limiti. La deviazione standard deve essere positiva: a zero la distribuzione collassa in un punto singolo e la domanda su quale quota stia entro zero dalla media non ha una risposta utile, quindi la pagina rifiuta l'input invece di sceglierne una. Le tre quote sono valori esatti della funzione di ripartizione normale, quindi differiranno al secondo decimale dal 68, 95 e 99,7 con cui la regola si cita abitualmente: la pagina non li arrotonda per farli coincidere con il nome, perché l'arrotondamento è la scorciatoia e il numero stampato è la cosa che quella scorciatoia abbrevia. E la pagina non adatta una distribuzione ai tuoi dati né verifica che una vi si adatti: prende una media e una deviazione standard come dati di fatto e riporta quello che ne segue.

Domande frequenti

Perché la pagina dice 68,27% quando la regola dice 68%?
Perché il 68 nel nome è una cifra arrotondata e 68,27% è il valore che essa arrotonda. La regola empirica è un modo di ricordare tre numeri, e circa 68%, 95% e 99,7% è quello che la maggior parte delle persone riesce a tenere in testa; le quote esatte entro una, due e tre deviazioni standard dalla media di una distribuzione normale sono 68,27%, 95,45% e 99,73%, ed è quello che la pagina calcola invece di citare. Se su uno di questi numeri ci si deve costruire un calcolo, quello da usare è il valore non arrotondato: una cifra arrotondata usata come input produce una risposta sbagliata in un modo che nessuno riesce a ricondurre all'arrotondamento.
Le percentuali cambiano se cambio la media o la deviazione standard?
No, e questo è tutto il contenuto della regola. Una distribuzione normale è fissata da due numeri, il suo centro e la sua dispersione, e la quota che cade entro k deviazioni standard dal centro dipende solo da k — uno, due o tre. Quindi cambiare la media fa scorrere tutti e sei gli estremi lungo la retta dei numeri e cambiare la deviazione standard li allunga o li comprime, mentre le tre quote restano esattamente dove erano. Se un risultato mostrasse una quota che si muove con gli input, le quote starebbero venendo calcolate dagli estremi invece che dal numero di deviazioni standard, e quello sarebbe un errore e non una proprietà dei dati.
Che cosa mi dice davvero l'intervallo — è una probabilità?
È una probabilità, letta come quota della distribuzione. Se una grandezza è davvero distribuita normalmente con la media e la deviazione standard che hai inserito, allora la probabilità che un singolo valore estratto da essa cada dentro l'intervallo di un sigma è 68,27%, e gli intervalli traducono le deviazioni standard nelle unità in cui stai misurando, così che l'affermazione si possa applicare a un numero concreto. Quello che non è, è un'affermazione sul tuo campione particolare: una distribuzione può coprire il 68% della sua probabilità in un intervallo mentre i dati che hai davanti ne hanno una proporzione diversa dentro, e la pagina non ha dati — ha due parametri che hai scritto tu.
Come faccio a sapere se la distribuzione normale è il modello giusto?
Questa pagina non può dirtelo, perché non vede mai i dati. Quello che ti dà è un controllo rapido sulla plausibilità del modello: se una deviazione standard da entrambi i lati della media copre un intervallo che non può plausibilmente contenere circa due terzi dei valori — perché l'intervallo supera un limite minimo o massimo invalicabile, perché i valori sono conteggi che non possono scendere sotto zero, o perché la distribuzione è visibilmente sbilanciata — allora l'ipotesi normale sta facendo un danno reale e le percentuali di questa pagina descrivono una curva che i dati non seguono. Un istogramma o un grafico di probabilità normale è il modo abituale di rispondere davvero alla domanda; l'aritmetica qui sta a valle di quella risposta, non al posto suo.
Perché la deviazione standard non può essere zero?
Perché una distribuzione normale con deviazione standard zero è collassata in un punto singolo, e lì la regola smette di significare qualcosa. Ogni valore starebbe esattamente sulla media, quindi gli intervalli larghi una, due e tre deviazioni standard avrebbero tutti ampiezza zero, e chiedere quale quota della distribuzione contengano ha due risposte difendibili — tutta, visto che tutto sta sulla media, oppure nessuna, visto che l'intervallo non ha estensione — senza modo di scegliere fra le due. Invece di sceglierne una in silenzio, la pagina respinge l'input e dice che la deviazione standard deve essere positiva. Una deviazione standard che in un calcolo reale è venuta zero significa quasi sempre una sola osservazione o un problema di inserimento dati, non una distribuzione genuina.
È la stessa cosa della calcolatrice che dà le probabilità dai punteggi z?
Sono due punti d'ingresso nella stessa distribuzione normale. La calcolatrice del punteggio z prende un valore e ti dice dove cade e quale probabilità sta sotto di esso; questa pagina prende la media e la deviazione standard e distende i tre intervalli standard con la quota che ciascuno copre. Quello che cambia è la direzione della domanda: una parte da una misura, l'altra parte dalla regola stessa. Gli input sono deliberatamente identici, la media e la deviazione standard negli stessi due campi, perché passare da una pagina all'altra non voglia dire riscrivere niente, e le due non possono mai contraddirsi sulla distribuzione sottostante perché la calcolano allo stesso modo.

Riferimenti

Calcolatrici correlate