Salta al contenuto principale
CalcMax

Calcolatrice teorema del limite centrale

Minimo: 0

Minimo: 1

Risultato

2,5000

Errore standard

Media delle medie campionarie
100,0000
Varianza delle medie campionarie
6,2500

Una calcolatrice del teorema del limite centrale descrive la distribuzione campionaria della media campionaria: dove è centrata, quanto è larga e come entrambe reagiscono alla dimensione del campione. Il centro è la parte sorprendente: la media di tutte le medie campionarie è uguale alla media della popolazione per qualsiasi dimensione del campione, quindi raccogliere più dati non la sposta. Quello che cambia è la larghezza: l'errore standard è la deviazione standard della popolazione divisa per √n, perciò quadruplicare il campione lo dimezza, mentre la varianza si riduce di quattro volte. La tesi del teorema — che al crescere di n la forma si avvicina alla normale — riguarda la forma e non l'ampiezza, e nessun calcolo di questa pagina può mostrarla.

Come cala l'errore standard al crescere del campione

Dimensione del campione, n√nErrore standard ÷ σ
111
420.5
1640.25
2550.2
100100.1
400200.05
2500500.02
100001000.01

La terza colonna è il fattore per cui moltiplicare σ — una deviazione standard della popolazione di 15 con un campione di 100 dà un errore standard di 0,1 × 15 = 1,5. Nulla nella tabella dipende dalla tua media o dalla tua deviazione standard, ed è per questo che non può contraddire il pannello qui sopra: è la funzione 1/√n, e il pannello la valuta in un solo punto. Scorrendo le righe, la legge della radice quadrata si vede come andamento e non come affermazione — ogni volta che la dimensione del campione si moltiplica per quattro, l'errore standard si dimezza, e le otto righe procedono a passi di quattro proprio perché l'andamento si ripeta invece di derivare. Le dimensioni del campione sono quelle con radice quadrata intera, quindi ogni riga si può verificare a mano. Nella tabella i decimali sono scritti con il punto e nel testo con la virgola: è la convenzione della pagina, non un errore.

Formula

E[X̄] = μ Var(X̄) = σ² / n SE = σ / √n

μ
La media della popolazione — il centro della distribuzione da cui si estraggono i campioni. Torna fuori invariata come media della distribuzione campionaria, ed è il primo dei tre risultati nonché l'unico vero per qualsiasi dimensione del campione
σ
La deviazione standard della popolazione. La sua unità di misura è quella dei dati, e lo è anche quella dell'errore standard: per questo σ e SE si possono confrontare direttamente — un errore standard di 2,5 accanto a una σ di 15 è un'affermazione sulla dimensione del campione, non sui dati
n
Quante osservazioni contiene un campione — la dimensione di ogni estrazione, non il numero di estrazioni. Compare come √n sotto una divisione e come n sotto un'altra, e quella differenza è tutto il messaggio pratico: la varianza cala in proporzione a n, l'errore standard solo alla sua radice quadrata
X̄
La media campionaria, trattata come grandezza aleatoria e non come un numero. Un campione dà una sola X̄; ripetendo il campionamento se ne ottiene una distribuzione, e i tre risultati descrivono quella distribuzione, non un singolo campione
SE
L'errore standard — la deviazione standard delle medie campionarie, e il risultato principale della pagina. È ciò con cui si costruisce un intervallo di confidenza e per cui si divide una statistica test: per questo è il numero che vale la pena leggere, invece della varianza di cui è la radice quadrata

Usala quando ti serve sapere quanto può spostarsi una media campionaria da un campione all'altro — prima di progettare uno studio, quando leggi un errore standard su un rapporto e vuoi vedere da dove viene, o quando vuoi verificare che un'intuizione sulla dimensione del campione sia corretta. L'intuizione che di solito corregge è che un campione più grande dia una stima proporzionalmente migliore: non è così, perché l'errore standard cala con la radice quadrata. Passare da 100 osservazioni a 400 dimezza la dispersione della stima, e ottenere un altro dimezzamento ne costa 1600. I due risultati in cima valgono per qualsiasi forma della popolazione, ed è per questo che si possono usare prima di sapere qualcosa sulla distribuzione. Quello che la pagina non può dirti è se un certo n basti perché la media campionaria sia all'incirca normale: dipende da quanto è asimmetrica la distribuzione di partenza, ed è una questione di giudizio, non un calcolo.

Esempi svolti

  1. Il caso predefinito: una popolazione con media 100 e deviazione standard 15, campionata 36 alla volta

    1. Varianza delle medie campionarie: σ² / n = 225 / 36 = 6,25
    2. Errore standard: √6,25 = 2,5
    3. Media delle medie campionarie: 100, la media della popolazione invariata
    4. Confronto con σ = 15: campionare 36 alla volta riduce la dispersione di un fattore 6, che è √36

    Sia 15 sia 36 sono stati scelti perché l'aritmetica si fa a mente — 225 diviso 36 fa 6,25, e la sua radice quadrata è un tondo 2,5. La terza riga merita un secondo sguardo proprio perché sembra che non sia successo nulla: la media di tutte le medie campionarie è la media della popolazione, per qualsiasi dimensione del campione, e questo è un fatto sul valore atteso, non un'approssimazione. Vedere 100 = 100 è il senso della riga, ed è il motivo per cui viene stampata anche se ripete l'input.

  2. La stessa popolazione campionata 9 alla volta invece di 36

    1. Il campione è un quarto, quindi la varianza è quattro volte più grande: 225 / 9 = 25
    2. Errore standard: √25 = 5
    3. La media è ancora 100 — rimpicciolire il campione ha cambiato la dispersione e nient'altro
    4. Rispetto al primo esempio, n è sceso a un quarto e l'errore standard è solo raddoppiato

    Questa coppia è la legge della radice quadrata resa concreta: dividi il campione per quattro e l'errore standard raddoppia soltanto, perché è la varianza che scala con n. Letta al contrario, è il motivo per cui la precisione costa: quadruplicare il campione compra un miglioramento doppio, e il doppio successivo costa sedici volte il campione iniziale. Ogni decisione sulla dimensione del campione è questo scambio, e la tabella di riferimento qui sotto lo mostra su un intervallo più ampio di n.

  3. Campionare una sola osservazione alla volta lascia la dispersione intatta

    1. Con n = 1 la media campionaria è l'unica osservazione, quindi la distribuzione campionaria è la popolazione stessa
    2. Varianza: 225 / 1 = 225, cioè σ²
    3. Errore standard: √225 = 15, cioè σ
    4. La media delle medie campionarie è ancora 100

    Vale la pena vedere l'estremo n = 1 perché ancora tutta l'idea: un campione di una sola osservazione è un'estrazione dalla popolazione, quindi non si è mediato via nulla e l'errore standard è la deviazione standard della popolazione stessa. Ogni altra dimensione del campione è questo punto di partenza diviso per √n. La pagina accetta n = 1 invece di richiedere almeno due osservazioni, perché è un input legittimo e istruttivo — la distribuzione campionaria semplicemente non è stata ristretta dal campione.

Limiti

Le due identità in cima alla formula valgono per qualsiasi popolazione e qualsiasi n, ma descrivono solo i primi due momenti della distribuzione campionaria. La terza tesi del teorema — la normalità approssimata — è quella su cui poggia quasi tutto l'uso pratico, ed è la parte che questa pagina non può verificare, perché quanto debba essere grande n dipende da quanto è asimmetrica la distribuzione di partenza: per una popolazione all'incirca simmetrica spesso bastano 10 osservazioni, mentre una distribuzione con una coda lunga può richiederne centinaia prima che la media campionaria si stabilizzi. Considera la soglia di 30, ripetuta ovunque, una regola empirica e non un risultato. La formula presuppone inoltre che le osservazioni siano indipendenti, cosa che il campionamento senza reimmissione da una popolazione piccola viola — la pagina sulla dimensione del campione applica quella correzione e chiederà meno persone di quante ne implichi questa. Qui non si stima nulla dai dati: entrambi gli input sono valori della popolazione, e se hai soltanto una deviazione standard campionaria, la pagina dell'intervallo di confidenza è quella che conosce la differenza.

Domande frequenti

Qual è la differenza tra deviazione standard ed errore standard?
La deviazione standard descrive quanto le singole osservazioni distano dalla media; l'errore standard descrive quanto una media campionaria dista dalla media della popolazione. Il secondo è il primo diviso per √n, e quella divisione è tutto il contenuto della differenza: una popolazione con σ = 15 è altrettanto dispersa sia che tu ne campioni 9 sia che ne campioni 900, ma la media di 900 osservazioni si colloca tre volte più vicino al vero di quella di 100 osservazioni. Ecco perché σ compare nell'unità di misura dei dati mentre l'errore standard si restringe al crescere dello studio — e perché l'errore standard è il numero che entra in un intervallo di confidenza o in una statistica test.
La media delle medie campionarie cambia se prendo campioni più grandi?
No, ed è il risultato che si fa più fatica a credere. La media della distribuzione campionaria è uguale alla media della popolazione per ogni dimensione del campione, da n = 1 in su, perché fare la media non spinge la stima in nessuna delle due direzioni: la rende soltanto meno variabile. La distribuzione delle medie campionarie diventa più stretta e più alta intorno allo stesso centro. La dimensione del campione compra precisione, mai accuratezza: riduce la dispersione della stima senza spostare dove la stima è centrata. Un metodo di campionamento distorto, invece, sposta il centro e nessuna dimensione del campione lo riporta indietro: per questo i due modi di sbagliare vale la pena tenerli distinti.
Quanto deve essere grande il campione perché il teorema del limite centrale si applichi?
Dipende dalla forma della popolazione, e non esiste una soglia valida per tutte. Una popolazione simmetrica si comporta bene già con n = 10, mentre una fortemente asimmetrica può richiedere alcune centinaia di osservazioni prima che la media campionaria sia vicina alla normale. La regola empirica di 30, tanto ripetuta, viene da studi di simulazione su dati moderatamente asimmetrici ed è un valore predefinito ragionevole, non un teorema. Quello che la pagina ti dà senza assumere nulla sulla forma sono il centro e la larghezza — media ed errore standard sono esatti per qualsiasi n. Solo l'approssimazione normale richiede il campione grande, e solo gli intervalli di confidenza e i valori p costruiti su di essa ereditano quel requisito.
Perché la varianza delle medie campionarie è molto più piccola della varianza dei dati?
Perché fare la media cancella gli errori indipendenti delle singole osservazioni, e la cancellazione procede in proporzione alla dimensione del campione — mentre l'errore standard, che è ciò che di solito si confronta, procede in proporzione alla sua radice quadrata. Con σ = 15 e n = 36 la varianza scende da 225 a 6,25, un fattore 36, mentre la deviazione standard scende da 15 a 2,5, un fattore solo 6. Entrambe le righe sono stampate per questo motivo. La varianza è il modo in cui il teorema si enuncia di solito, l'errore standard è la forma che si usa, e lo scarto tra i due fattori è la radice quadrata.
È la stessa cosa della calcolatrice dell'errore standard?
Calcolano la stessa grandezza partendo da input diversi, e quale ti serve dipende da cosa hai. Questa pagina prende la deviazione standard della popolazione e la dimensione del campione — i valori che esistono prima di raccogliere dati — ed è lo strumento giusto per pianificare uno studio o per verificare un'intuizione su come n guidi la precisione. La calcolatrice dell'errore standard prende il campione stesso e ne calcola la deviazione standard, che è quello che si usa quando i dati sono in mano e il valore della popolazione è ignoto. Le due differiscono esattamente per il passo di stima che sta in mezzo, e la pagina dell'intervallo di confidenza è quella dove quella differenza ha conseguenze.

Riferimenti

Calcolatrici correlate