Calcolatrice dell'errore standard
Risultato
Errore standard
- Deviazione standard
- 2,1381
- Media
- 5,0000
- Numerosità
- 8
Una calcolatrice dell'errore standard calcola l'errore standard della media o di una proporzione, a seconda di quali dati hai. Nella modalità media prende il campione stesso — un elenco di numeri — e restituisce la deviazione standard, il conteggio e l'errore standard, che è la deviazione standard divisa per √n. Nella modalità proporzione non c'è alcun elenco da cui partire: la variabilità di una domanda sì o no discende dalla sola percentuale, quindi la pagina prende la dimensione del campione e la percentuale, calcola la deviazione standard come √(p(1 − p)) × 100 e divide per lo stesso √n. Entrambe le modalità arrivano così alla stessa grandezza per la stessa via, e le quattro righe mostrano l'intera catena invece del solo punto di arrivo. Quello che la pagina non può dirti è se il numero che stai guardando è stabile: dipende dalla dimensione del campione, e la pagina di riferimento sulla distribuzione campionaria è il posto dove la legge 1/√n è esposta per esteso.
Formula
SE = s / √n s = √( Σ(xᵢ − x̄)² / (n − 1) ) s = √(p(1 − p)) × 100
- SE
- L'errore standard — la deviazione standard della stima, e il risultato principale della pagina. Risponde a una domanda sulla stima e non sui dati: quanto una media campionaria si discosterebbe tipicamente dalla media della popolazione se il campionamento fosse ripetuto. È il numero da cui si costruisce un intervallo di confidenza e per cui si divide una statistica test, ed è per questo che vale la pena calcolarlo da solo
- s
- La deviazione standard del campione, con il denominatore n − 1. È ciò da cui l'errore standard deriva nella modalità media, ed è stampata in una riga sua perché la divisione si possa verificare. Il denominatore n − 1 anziché n è ciò che la rende una stima non distorta della dispersione della popolazione: usare n sottostimerebbe leggermente la variabilità, e la sottostima è massima proprio dove i campioni sono più piccoli
- n
- Quante osservazioni contiene il campione — il conteggio, anch'esso stampato in una riga sua. Compare sotto una radice quadrata, ed è per questo che l'errore standard si riduce lentamente: dieci volte i dati comprano un errore standard circa tre volte più piccolo. Nella modalità proporzione questo è il campo della dimensione del campione e non un conteggio ricavato da un elenco, perché una percentuale non porta con sé alcun elenco
- x̄
- La media campionaria, stampata perché l'aritmetica della deviazione standard abbia un centro visibile. Non ha alcun ruolo nell'errore standard in sé — l'errore standard è una proprietà della dispersione e della dimensione del campione, non di dove stanno i dati — ed è per questo che un insieme di dati si può traslare di una costante qualsiasi lasciando l'errore standard invariato
- p
- La proporzione campionaria, frazione nella formula e percentuale sul pannello. Nella modalità proporzione sostituisce del tutto la deviazione standard: per una domanda sì o no la variabilità è funzione della percentuale, massima quando la ripartizione è pari e via via nulla man mano che la percentuale si avvicina a 0 o a 100. Il × 100 riporta il risultato in punti percentuali, così si può leggere accanto alla percentuale da cui è venuto
Usala quando hai i dati in mano e vuoi l'errore standard di una stima — per costruire a mano un intervallo di confidenza, per controllare un numero in un rapporto, o per vedere quanta parte dell'ampiezza di un risultato venga dalla dispersione dei dati e quanta dalla dimensione del campione. Stampare accanto la deviazione standard e il conteggio rende visibile questa divisione del lavoro: cambia i dati e si muove la riga della deviazione standard, cambia solo la dimensione del campione e si muove la riga dell'errore standard mentre la deviazione standard resta ferma. Le due modalità esistono perché le due stime più comuni richiedono input diversi. Una media richiede il campione, dato che nulla predice quanto saranno disperse le misure; una proporzione no, dato che la sua dispersione discende dal suo stesso valore, ed è per questo che i sondaggi possono dichiarare un margine di errore dalla sola dimensione del campione. Nessuna delle due modalità controlla se il campione è abbastanza grande perché la stima sia all'incirca normale. Dipende da quanto è asimmetrica la distribuzione sottostante, e per la modalità proporzione esiste una regola empirica più specifica su n·p e n·(1 − p) che la pagina non impone.
Esempi svolti
Il caso predefinito: otto numeri con una deviazione standard di circa 2,14
- Conteggio: otto numeri. Media: (2 + 4 + 4 + 4 + 5 + 5 + 7 + 9) / 8 = 40 / 8 = 5
- Gli scarti al quadrato da 5 sommano a 32, quindi la varianza campionaria è 32 / 7 = 4,5714
- Deviazione standard: √4,5714 = 2,1381
- Errore standard: 2,1381 / √8 = 2,1381 / 2,8284 = 0,7559
I numeri sono distribuiti ai due lati del 5 senza che nessuno sia molto lontano, ed è questo che ne fa un valore predefinito utile: la media è un numero tondo e la deviazione standard no, quindi le ultime due righe non si possono confondere tra loro. Leggere il pannello dall'alto verso il basso è il punto — 2,1381 è un fatto sui dati e 0,7559 è un fatto sulla stima, e l'unica cosa in mezzo è la divisione per √8. In questa modalità i campi della dimensione del campione e della percentuale restano inutilizzati.
Nove numeri scelti perché l'errore standard venga esattamente 1
- Media: (3 × 4 + (−3) × 4 + 0) / 9 = 0
- Scarti al quadrato: quattro 9, altri quattro 9 e uno 0, che sommano a 72
- Varianza campionaria: 72 / 8 = 9, quindi la deviazione standard è 3
- Errore standard: 3 / √9 = 3 / 3 = 1
Nove osservazioni sono poche abbastanza perché il denominatore n − 1 conti in modo visibile: dividendo per 9 invece che per 8 la varianza verrebbe 8 e la deviazione standard 2,8284, e l'errore standard uscirebbe a 0,9428 invece che a 1. È la correzione che fa il suo lavoro — con un campione piccolo la dispersione osservata è una leggera sottostima di quella della popolazione, e dividere per uno meno del conteggio la corregge. La coppia n = 9 e s = 3 è la stessa che usa la pagina dell'intervallo di confidenza, e il suo intervallo esce esattamente a ±2,306 perché il valore della t con 8 gradi di libertà è 2,306.
Una proporzione non ha bisogno di alcun elenco di dati
- Proporzione come frazione: 60% = 0,6
- Deviazione standard in punti percentuali: √(0,6 × 0,4) × 100 = 0,4899 × 100 = 48,9898
- Errore standard: 48,9898 / √100 = 48,9898 / 10 = 4,899
- L'elenco di dati viene ignorato del tutto — la riga del conteggio riporta invece il campo della dimensione del campione
Il campo dei dati è ancora sullo schermo e contiene ancora un elenco, e nella risposta non se ne usa nulla: in questa modalità la variabilità viene dalla percentuale e la dimensione del campione viene dal suo campo. È per questo che la riga della deviazione standard legge 48,99 — un numero dall'aria insolita per una domanda binaria. È la deviazione standard di una variabile sì o no codificata come 0 e 100, e qui il suo unico scopo è essere divisa per √n. La stessa struttura compare nella pagina sulla dimensione del campione, dove il caso peggiore p = 0,5 serve a pianificare uno studio prima che qualsiasi percentuale sia nota.
Due osservazioni, dove il denominatore n − 1 fa il lavoro maggiore
- Media: 5
- Scarti al quadrato: 25 e 25, che sommano a 50
- Varianza campionaria: 50 / 1 = 50, quindi la deviazione standard è √50 = 7,0711
- Errore standard: 7,0711 / √2 = 7,0711 / 1,4142 = 5
Con due osservazioni la deviazione standard è semplicemente metà della distanza tra loro — il denominatore n − 1 lascia un solo grado di libertà, e la formula si riduce a qualcosa che si vede invece di calcolarlo. L'errore standard è poi la deviazione standard divisa per √2, che qui fa 5. Questo è il campione più piccolo che la pagina accetta nella modalità media, e vale la pena provarlo una volta per vedere quanto è larga davvero una stima tratta da due numeri: l'errore standard esce pari a metà dell'intervallo dei dati.
Limiti
La pagina riporta l'errore standard della stima e si ferma prima di trasformarlo in un intervallo o in un test. Quel confine è deliberato: un intervallo richiede un valore critico, che dipende da un livello di confidenza e dal fatto che la dispersione sia dovuta essere stimata dal campione, e un test richiede una seconda statistica con cui confrontarsi. Entrambi stanno nelle pagine vicine, e l'aritmetica di qui è l'input di entrambe anziché un sostituto dell'una o dell'altra. La modalità media presume che le osservazioni siano indipendenti, cosa che non vale per misure ripetute sullo stesso soggetto, per coppie appaiate e per dati a grappolo come studenti dentro le scuole; in tutti e tre i casi la dimensione campionaria efficace è minore del conteggio e l'errore standard esce troppo piccolo. Presume inoltre che l'elenco contenga ogni osservazione che intendevi includere — l'errore standard si calcola da ciò che è digitato, e trascurare per sbaglio un valore anomalo lo restringe. La modalità proporzione porta un'avvertenza a parte: la sua formula è un'approssimazione per campioni grandi che si comporta male quando il numero di successi o di insuccessi è piccolo, quindi una percentuale vicina a 0 o a 100 da un campione modesto è servita meglio da un intervallo esatto che da questo errore standard. Nessuna delle due modalità giudica se la stima sia distorta, cosa che nessun errore standard può rilevare.
Domande frequenti
- Qual è la differenza tra deviazione standard ed errore standard?
- La deviazione standard descrive quanto i singoli valori si discostano dalla loro media; l'errore standard descrive quanto una media campionaria si discosta dalla media della popolazione. Il secondo è il primo diviso per √n, e quella divisione è tutta la relazione — ed è per questo che entrambi sono stampati. La deviazione standard è una proprietà dei dati e non cambia man mano che ne raccogli altri, mentre l'errore standard continua a ridursi al crescere del campione. Un controllo utile sul pannello: modifica i numeri e si muovono entrambe le righe; cambia solo il conteggio e la deviazione standard resta dov'era mentre l'errore standard scende.
- Perché la pagina divide per n − 1 invece che per n?
- Perché nel misurare la dispersione si usa come centro la media del campione stesso, e quella media sta più vicina ai dati di quanto stia la vera media della popolazione — quindi la media ingenua degli scarti al quadrato è sistematicamente un po' troppo piccola. Dividere per uno meno del conteggio la corregge. L'effetto è massimo sui campioni piccoli: con due osservazioni raddoppia la varianza, e con cento osservazioni è un aggiustamento dell'1%. Dividere per n non è sbagliato per descrivere il campione che hai; è sbagliato per stimare la dispersione della popolazione da cui viene, che è ciò a cui serve un errore standard.
- Come calcolo l'errore standard di una proporzione senza alcun dato?
- La proporzione fornisce da sé la propria variabilità, quindi non serve alcun elenco — bastano la dimensione del campione e la percentuale. Codifica i due esiti come 0 e 100 e la deviazione standard risulta √(p(1 − p)) × 100, che è massima quando la ripartizione è pari e si riduce verso zero man mano che la percentuale si avvicina a un estremo. Per il 60% di 100 persone è √(0,6 × 0,4) × 100 = 48,9898, e dividendo per √100 si ottiene un errore standard di 4,899 punti percentuali. È la stessa coppia di input che usa la pagina del margine di errore, dove l'errore standard viene moltiplicato per un valore critico per dare un più o meno.
- L'errore standard diminuisce se aggiungo dati?
- Sì, ma solo in proporzione alla radice quadrata della dimensione del campione. Passare da 100 osservazioni a 400 dimezza l'errore standard; ottenere un altro dimezzamento ne costa 1600. È per questo che l'errore standard è il numero da tenere d'occhio quando si pianifica uno studio, e perché il miglioramento di un campione molto grande rispetto a uno semplicemente grande si sopravvaluta facilmente. La riga della deviazione standard, al contrario, resta all'incirca dov'è — più dati non rendono la popolazione sottostante meno variabile, rendono solo più precisa la stima del suo centro.
- Che cosa significa un errore standard pari a 0?
- O che ogni osservazione del campione era identica, o che la proporzione era 0% o 100% — in entrambi i casi la formula non trova variazione con cui lavorare e restituisce zero. Letto alla lettera, un errore standard di zero dice che la stima è esatta, e questa è un'affermazione che i dati non possono sostenere: un campione di quattro letture identiche è una prova che la dispersione è piccola, non che è nulla. La pagina restituisce lo zero invece di un errore, perché l'aritmetica è corretta e la ragione è visibile sulle altre righe, ma un errore standard esattamente nullo va trattato come il segno che il campione è troppo piccolo o troppo uniforme per dire qualcosa sulla variabilità.
- È la stessa cosa della calcolatrice del teorema del limite centrale?
- Calcolano la stessa grandezza da input diversi, e quale ti serva dipende da che cosa hai. Questa pagina prende il campione — un elenco di numeri, oppure una percentuale e una dimensione — ed è quella da usare quando i dati sono già in mano. La pagina del teorema del limite centrale prende la deviazione standard della popolazione e una dimensione del campione, i valori che esistono prima che si raccolga qualsiasi cosa, ed è quella da usare quando si pianifica uno studio o si vuole capire come l'errore standard risponde a n. Le due differiscono esattamente per il passo di stima che sta in mezzo, ed è per questo che i loro risultati coincidono ogni volta che la deviazione standard campionaria capita di essere uguale al valore della popolazione.
Riferimenti
- 1.3.5.6. Measures of Scale — e-Handbook of Statistical Methods (the sample standard deviation and the n − 1 denominator the standard error is built from) — National Institute of Standards and Technology (NIST)
- 1.3.6.1. What is a Probability Distribution — e-Handbook of Statistical Methods (the sampling distribution of a statistic, whose spread is what the standard error measures) — National Institute of Standards and Technology (NIST)
- 1.3.5.1. Measures of Location — e-Handbook of Statistical Methods (the sample mean printed alongside the spread, and why the two are reported together) — National Institute of Standards and Technology (NIST)