Calcolatrice del test t
Risultato
Statistica t
- Valore p
- 34,6594%
- Gradi di libertà
- 8
- Errore standard
- 1,0000
Una calcolatrice del test t esegue il più comune dei test su una media: trasforma una media campionaria, una deviazione standard e una dimensione del campione in una statistica t, un valore p e i gradi di libertà a cui i primi due si leggono. La modalità a un campione confronta una media con un valore fisso — un obiettivo, una specifica, una media storica. La modalità a due campioni confronta due gruppi tra loro, e la versione implementata qui è il test t a due campioni con varianza comune, che presume che i due gruppi condividano la varianza: le due deviazioni standard vengono mediate con pesi n − 1, e quella singola varianza comune guida l'errore standard. L'alternativa, il test di Welch, rinuncia all'ipotesi di varianza uguale ed è il valore predefinito più sicuro quando i gruppi differiscono per dimensione e per dispersione, ma i suoi gradi di libertà escono frazionari ed è un calcolo diverso in un punto diverso del codice; questa pagina fa il test a varianza uguale e lo dichiara invece di approssimarlo in silenzio. Il valore p è l'area di coda della distribuzione t oltre la statistica, ed è stampato in percentuale.
Formula
t = (x̄ − μ₀) / (s / √n) t = (x̄₁ − x̄₂) / √(s_p²(1/n₁ + 1/n₂)) s_p² = ((n₁−1)s₁² + (n₂−1)s₂²) / (n₁ + n₂ − 2)
- t
- La statistica test — di quanti errori standard la media osservata sta dal valore che si sta verificando. Il suo segno porta la direzione, ed è per questo che un test a una coda nella direzione sbagliata restituisce un valore p grande anziché un errore: una t di −1 contro un'alternativa maggiore di non è un effetto piccolo, è una prova che punta dall'altra parte, e l'area di coda lo dice
- x̄, μ₀
- La media campionaria e il valore con cui la si confronta, nella modalità a un campione. Il numeratore è la loro differenza, quindi la statistica misura una distanza nelle unità dei dati — la stessa differenza conta molto meno se la dispersione è ampia o il campione piccolo, ed è ciò che fornisce il denominatore
- s
- La deviazione standard campionaria, stimata dai dati anziché nota in anticipo. Quella stima è l'intera ragione per cui si usa la distribuzione t invece della normale: l'incertezza in più che introduce rende le code più pesanti, e sono le code più pesanti che il valore critico della t tiene in conto. Deve essere maggiore di zero — un campione senza variazione non ha alcun denominatore per cui dividere
- n
- La dimensione del campione, che dà n − 1 gradi di libertà nella modalità a un campione. Per il test a due campioni le due dimensioni sommano a uno in più di ciascuna presa da sola: n₁ + n₂ − 2, perché la varianza comune spende un grado di libertà sulla media di ciascun gruppo prima di misurarne la dispersione intorno a essa
- s_p²
- La varianza comune — la media ponderata delle varianze dei due gruppi, ciascuna pesata con i propri gradi di libertà. È qui che entra l'ipotesi di varianza uguale: i due gruppi vengono trattati come due campioni di un'unica dispersione di popolazione, quindi un gruppo con più osservazioni, o con una varianza propria più piccola, contribuisce in proporzione a un'unica stima condivisa. Se le due varianze differiscono sostanzialmente è la messa in comune a cedere, e il test di Welch è il rimedio
- valore p
- La probabilità di una statistica almeno così lontana da zero, nella direzione che il test interroga, se le due medie fossero davvero uguali. Due code raddoppiano l'area oltre |t|; le alternative maggiore e minore prendono una coda ciascuna. Qui è riportato come percentuale, quindi 5% è il familiare 0,05, ed è un'affermazione sui dati data l'ipotesi e non sull'ipotesi dati i dati
Usala quando hai una media e una deviazione standard da un campione e vuoi sapere se la differenza rispetto a un obiettivo, o rispetto a un altro gruppo, sia più grande di quanto spiegherebbe il rumore di campionamento. La modalità a un campione gestisce il caso in cui il valore di confronto è un numero fisso — una macchina tarata per riempire 500 grammi, una specifica di 5 mm, la media dell'anno scorso — e la modalità a due campioni gestisce il caso in cui entrambe le grandezze sono state misurate e nessuna delle due è privilegiata. Due cose vale la pena decidere prima di leggere la risposta. La prima è una coda o due: un test a due code chiede se i gruppi differiscano in una direzione o nell'altra ed è il valore predefinito giusto, mentre un test a una coda pone una domanda direzionale e va scelto perché la direzione era stata specificata in anticipo, non perché la risposta sarebbe più favorevole. La seconda è l'ipotesi di varianza uguale, che la modalità a due campioni fa e non può verificare al posto tuo. L'indizio è sul pannello: se le due deviazioni standard che hai digitato sono vicine, metterle in comune costa poco, e se differiscono di un fattore due o più il test che ti serve è quello di Welch. Questa pagina calcola il test con varianza comune, che è ciò che la maggior parte dei manuali e dei cultori della materia intende per il test t nel caso di varianze uguali, e riporta le due deviazioni standard che hai fornito perché l'ipotesi si possa giudicare invece che dare per scontata.
Esempi svolti
Il caso predefinito: una media campionaria di 6 contro un obiettivo di 5
- Errore standard: s / √n = 3 / 3 = 1
- Statistica t: (6 − 5) / 1 = 1 — la media campionaria sta un errore standard sopra l'obiettivo
- Gradi di libertà: n − 1 = 8
- Valore p a due code: l'area oltre ±1 su una distribuzione t con 8 gradi di libertà, che è 34,66%
Una differenza di una unità intera sembra tanta finché non le si mette accanto l'errore standard: un errore standard rientra tranquillamente nell'intervallo che il rumore di campionamento produce, e il valore p lo dice. Istruttivo il confronto con la curva normale — la stessa t di 1 darebbe 31,7% se la distribuzione fosse normale, e i tre punti in più sono il prezzo di aver stimato la deviazione standard da nove osservazioni invece di conoscerla.
Una statistica t di 2,306 dà esattamente il 5%
- Errore standard: 3 / √9 = 1, quindi la statistica t è la media stessa
- Statistica t: (2,306 − 0) / 1 = 2,306
- La soglia t a due code al 95% con 8 gradi di libertà è 2,306
- Stare esattamente sulla soglia significa che il valore p a due code è esattamente 5%
Questa è la coppia che la pagina dei valori critici produce dalla parte opposta, e metterle insieme è la dimostrazione più chiara che sono un solo fatto letto da due estremi. Chiedi a quella pagina la soglia t a due code al 95% con 8 gradi di libertà e restituisce 2,306; dai 2,306 in pasto a questa e il valore p torna esattamente al 5%. Nulla, in mezzo, è arrotondato — il numero è stato scelto perché la deviazione standard di 3 e la dimensione del campione di 9 rendono l'errore standard esattamente 1, quindi la statistica e la soglia sono la stessa cifra. Una statistica appena sotto cadrebbe sopra il 5%, e una appena sopra sotto il 5%.
Due gruppi di dieci con la stessa dispersione
- Varianza comune: ((9 × 4) + (9 × 4)) / 18 = 72 / 18 = 4, quindi la deviazione standard comune è 2
- Errore standard: √(4 × (1/10 + 1/10)) = √0,8 = 0,8944
- Statistica t: (5 − 4) / 0,8944 = 1,118
- Gradi di libertà: 10 + 10 − 2 = 18, che dà un valore p a due code di 27,83%
Quando le due varianze sono uguali la messa in comune non fa nulla — la varianza comune esce a 4, esattamente il valore che entrambi i gruppi avevano fornito — e l'errore standard è più piccolo della deviazione standard di ciascun gruppo divisa per il proprio √n. Confrontare due medie di dieci è meno preciso che stimare una sola media di dieci — un errore standard di 0,8944 contro 0,6325 — perché si sottraggono due grandezze incerte invece di misurarne una, e quel costo vale la pena solo quando il confronto risponde a una domanda a cui un singolo campione non può rispondere. Nota che il campo della media della popolazione è sullo schermo e inutilizzato in questa modalità; entrambe le grandezze sono misurate, quindi nessuna delle due è l'obiettivo fisso.
Dispersioni e dimensioni diverse, dove la messa in comune va sorvegliata
- Varianza comune: ((9 × 4,41) + (11 × 3,24)) / 20 = (39,69 + 35,64) / 20 = 3,7665
- Errore standard: √(3,7665 × (1/10 + 1/12)) = √0,6905 = 0,831
- Statistica t: (5,2 − 4,1) / 0,831 = 1,3237
- Gradi di libertà: 10 + 12 − 2 = 20
La varianza comune è 3,7665, che non è il punto medio tra 4,41 e 3,24 — il gruppo di dodici pesa di più perché contribuisce undici gradi di libertà contro i nove del gruppo di dieci. Quel peso è tutto il contenuto della parola comune, ed è il motivo per cui la risposta non si può riprodurre facendo la media delle due deviazioni standard. Le due dispersioni qui sono abbastanza vicine perché l'ipotesi di varianza uguale sia comoda; una coppia come 2,1 e 0,6 con queste dimensioni non lo sarebbe, e il test di Welch darebbe un valore p visibilmente diverso.
Una t di 1,96 da 900 osservazioni, dove t e z sono ormai convergenti
- Errore standard: 3 / √900 = 3 / 30 = 0,1
- Statistica t: (5,196 − 5) / 0,1 = 1,96
- Gradi di libertà: 899
- Valore p a due code: 5,0304% — appena sopra 5, non esattamente a 5
Il famoso 1,96 dà il 5% sulla curva normale e il 5,0304% qui, e lo scarto è il punto dell'esempio. Con 899 gradi di libertà la distribuzione t è quasi indistinguibile dalla normale, ma non esattamente — è ancora un po' più pesante nelle code, quindi la stessa statistica sta un po' più in là. È anche il motivo per cui una t di 1,96 non è automaticamente significativa al 5% in un campione grande, e per cui un software che riporta 0,0499 e un software che riporta 0,0501 possono non concordare sullo stesso studio alla terza cifra decimale.
Limiti
La modalità a due campioni presume che i due gruppi condividano la varianza, e quell'ipotesi fa un lavoro reale invece di sistemare la notazione. Quando le dimensioni dei gruppi sono uguali il test con varianza comune è abbastanza robusto anche se le varianze differiscono, ma quando le dimensioni sono disuguali e le varianze differiscono pure, il test può sbagliare gravemente in una direzione o nell'altra — è il problema di Behrens–Fisher, e il test di Welch esiste per risolverlo. Le due deviazioni standard sono sul pannello proprio per questo: confrontale prima di fidarti del valore p, e se una è più del doppio dell'altra mentre le dimensioni dei gruppi differiscono, il test a varianza uguale non è quello che ti serve. La modalità a un campione non ha questo problema ma presume che le osservazioni siano indipendenti, cosa che non vale per misure ripetute su un solo soggetto né per dati appaiati o a grappolo, dove serve un modello per dati appaiati o misto. Entrambe le modalità presumono che i dati sottostanti siano all'incirca normali, e entrambe diventano meno sensibili a questa ipotesi al crescere del campione — è il teorema del limite centrale a rendere ragionevole un test t su 900 osservazioni asimmetriche e discutibile un test t su 9 osservazioni asimmetriche. Infine, la pagina riporta una statistica e un valore p e nessuna conclusione. Non ha alcun livello di significatività con cui confrontarsi, e il numero 0,05 è una convenzione e non un risultato, quindi la decisione resta dove deve stare.
Domande frequenti
- Questa pagina usa il test t a due campioni con varianza comune o quello di Welch?
- Quello con varianza comune — il test a varianza uguale, con n₁ + n₂ − 2 gradi di libertà. Il test di Welch è la scelta migliore quando i due gruppi differiscono per dispersione e per dimensione, e i due campi della deviazione standard sono sul pannello proprio perché tu possa controllare: se una è più o meno del doppio dell'altra e le dimensioni del campione differiscono, quello che ti serve è Welch e questa pagina darà un valore p sbagliato, a volte in modo sostanziale. La versione a varianza uguale è implementata qui perché è il test dei manuali, è ciò che un manuale di riferimento chiama il test t a due campioni per medie uguali, e i suoi gradi di libertà interi mantengono l'aritmetica di questa pagina esatta anziché approssimata.
- Devo usare un test a una coda o a due code?
- A due code, a meno che la direzione non fosse stata specificata prima di vedere i dati. Un test a due code chiede se i gruppi differiscano affatto e divide il livello di significatività tra i due estremi; un test a una coda chiede se un gruppo sia maggiore e mette tutto il livello in quella coda, il che lo rende più facile da portare a significatività — esattamente il doppio più facile a parità di livello, dato che 1,96 diventa 1,645. È una scelta legittima quando la domanda è davvero direzionale, ed è una forma di caccia al risultato quando la direzione è stata scelta dopo aver visto da che parte andava la differenza.
- Qual è la differenza tra la statistica t e il valore p?
- La statistica t misura la differenza in errori standard e porta dentro di sé la dimensione del campione, mentre il valore p converte quella cifra in una probabilità usando la distribuzione t ai gradi di libertà corrispondenti. Quindi t risponde a quanto distano queste cose in errori standard e il valore p risponde a quanto spesso il solo campionamento produrrebbe un divario così grande. Sono riportati entrambi perché il primo è confrontabile tra studi con lo stesso disegno e il secondo è ciò con cui si confronta un livello di significatività. Nessuno dei due è l'ampiezza dell'effetto — un campione grande può far produrre a una differenza banale una t grande e un valore p minuscolo.
- Perché una statistica t di 1,96 non dà esattamente il 5%?
- Perché 1,96 è la soglia del 5% della curva normale, e la distribuzione t è un po' più pesante nelle code a qualsiasi grado di libertà finito. Con 899 gradi di libertà una t di 1,96 dà 5,0304%, appena oltre la linea; con 8 gradi di libertà la stessa statistica dà 8,57%. La distribuzione t converge alla normale man mano che i gradi di libertà crescono, ed è la stessa curva per tutto il percorso — cambia solo il peso delle code. È per questo che un software può riportare un valore p di 0,0499 dove un calcolo a mano contro 1,96 dice significativo, e nessuno dei due è sbagliato.
- Che cosa significa una statistica t negativa?
- Che la media campionaria è risultata sotto il valore con cui la si confronta, oppure sotto la media del secondo gruppo nella modalità a due campioni. Il segno è informazione sulla direzione e nulla più — è la sua ampiezza rispetto alla distribuzione che determina il valore p. In un test a due code il segno viene scartato perché conta un estremo come l'altro. In un test a una coda conta e può essere informativo: una t di −2,5 contro un'alternativa maggiore di dà un valore p vicino al 99%, che non è un risultato nullo ma una prova che punta dall'altra parte, e riportarlo come non significativo getterebbe via quell'informazione.
- Quante osservazioni servono per un test t?
- La pagina richiede almeno due per gruppo, perché la deviazione standard di una sola osservazione è indefinita. È un limite matematico e non una raccomandazione pratica — un test t su due osservazioni per gruppo ha un grado di libertà e quasi nessuna potenza di rilevare altro che una differenza enorme, e il valore p sarà grande a meno che i due gruppi non si sovrappongano appena. La domanda utile non è il minimo che la formula consente ma la dimensione del campione necessaria a rilevare la differenza che ti interessa, che dipende dalla dispersione dei dati e dall'ampiezza dell'effetto che vorresti notare; il calcolo vive nella pagina sulla dimensione del campione, che lavora all'indietro da un margine di errore invece che in avanti da un insieme di dati.
- Dov'è la tabella dei valori critici della t?
- Nella pagina dei valori critici, e solo lì in questo insieme — questa pagina non ne stampa una perché andrebbe indicizzata per gradi di libertà oltre che per livello di significatività, il che significa una pagina di manuale per ogni livello anziché una tabella. È anche il motivo per cui la risposta qui si calcola invece di cercarla: una tabella può elencare solo i gradi di libertà che qualcuno ha scelto di stampare, e i gradi di libertà che produce un test a due campioni, n₁ + n₂ − 2, non sono quasi mai tra quelli. L'unica soglia che vale la pena portare a memoria è che i valori della t convergono a 1,96 al crescere del campione, quindi la tabella che stai cercando è quella normale con una penalità attaccata che si riduce man mano che i gradi di libertà salgono.
Riferimenti
- 1.3.5.3. Two-Sample t-Test for Equal Means — e-Handbook of Statistical Methods (the pooled two-sample test this page implements, including the pooled standard deviation and its n₁ + n₂ − 2 degrees of freedom) — National Institute of Standards and Technology (NIST)
- 1.3.5.1. Measures of Location — e-Handbook of Statistical Methods (the sample mean and the standard error that the one-sample statistic is built from) — National Institute of Standards and Technology (NIST)
- 1.3.6.7.1. Cumulative Distribution Function of the Standard Normal Distribution — e-Handbook of Statistical Methods (the curve the t distribution approaches as the degrees of freedom grow, which is why 1.96 and 5% are only approximately each other's partner) — National Institute of Standards and Technology (NIST)