Salta al contenuto principale
CalcMax

Calcolatrice del valore p

Minimo: 1

Minimo: 1

Risultato

4,9996%

Valore p

Una calcolatrice del valore p converte una statistica test nella probabilità di osservare un valore almeno altrettanto estremo se l'ipotesi nulla fosse vera. Gestisce le quattro statistiche che coprono la maggior parte della statistica applicata — z, t, chi quadrato e F — e ha bisogno solo della statistica, dei suoi gradi di libertà e di una scelta delle code. L'impostazione delle code è quella che si sbaglia più spesso: un test a due code conta entrambe le direzioni, un test a una coda conta solo quella che era stata prevista. L'output è un unico numero, in punti percentuali. Quello che la pagina deliberatamente non fa è giudicare, perché il livello di significatività è tuo e tocca a te portarlo.

Formula

coda superiore: p = P(T ≥ t) coda inferiore: p = P(T ≤ t) a due code: p = 2 · min( superiore, inferiore ) — solo per distribuzioni simmetriche

t
La statistica test che hai già calcolato — una z da un campione grande, una t da uno piccolo, un chi quadrato da categorie contate, oppure una F da un rapporto tra due varianze. La pagina non la calcola: la converte
T
La distribuzione che la statistica seguirebbe se l'ipotesi nulla fosse vera. Quale sia lo dice il selettore a quattro vie, e la scelta non è una preferenza: usare la distribuzione normale dove andrebbe una t rende ogni valore p troppo piccolo
df
I gradi di libertà — una proprietà di come la statistica è stata calcolata più che dei dati, e richiesti da t, chi quadrato e F. F ne vuole due: i gradi di libertà del numeratore, cioè il numero di gruppi o di termini confrontati, e quelli del denominatore, che vengono dalla dimensione campionaria residua
α
Il livello di significatività, la soglia con cui il valore p verrà confrontato. Non è un input di questa pagina perché non fa parte del calcolo: appartiene alla decisione che stai per prendere, e stampare un verdetto contro un valore predefinito di 0,05 significherebbe scegliere quella soglia al posto tuo
p
La probabilità di coda, riportata come percentuale anziché come numero decimale. Un valore p di 0,05 viene mostrato come 5,0000, così la cifra sullo schermo si può confrontare direttamente con un livello di significatività citato, senza prima spostare la virgola

Usala quando hai già una statistica e vuoi la probabilità che le si accompagna — da un esercizio di un manuale in cui la statistica è data, da un software che ha stampato la statistica ma non il valore p, o da un calcolo a mano che vuoi controllare. La scelta che conta di più è quella delle code, e la regola si fissa prima di vedere i dati e non dopo: scegli due code quando entrambe le direzioni conterebbero come allontanamento dall'ipotesi nulla, che è il caso abituale, e una coda solo quando un risultato nella direzione opposta non interesserebbe affatto e lo hai dichiarato in anticipo. La seconda scelta è la distribuzione. Abbinala a come è stata costruita la statistica e non al valore p che speri di ottenere: una z appartiene a una proporzione o a una media con varianza nota, una t a una media la cui dispersione viene dallo stesso campione piccolo, un chi quadrato a categorie contate, e una F a un confronto tra varianze. Sbagliare quell'abbinamento è il modo più comune in cui un'aritmetica corretta produce un numero privo di significato.

Esempi svolti

  1. Una z di 1,96, la classica soglia a due code

    1. Coda superiore: P(Z ≥ 1,96) = 0,025002, calcolata dalla distribuzione normale standard
    2. La curva normale è simmetrica, quindi la coda inferiore è uguale: P(Z ≤ −1,96) = 0,025002
    3. A due code: 2 × 0,025002 = 0,050004
    4. In percentuale: 5,0000%, che è il 5% che tutti citano

    1,96 è il valore scelto proprio perché il risultato venga 5%, e vedere 4,9996 anziché un tondo 5,0000 non è un errore — il quantile vero è 1,959964, quindi 1,96 è già di per sé un arrotondamento. I tre campi dei gradi di libertà sono tutti compilati e vengono letti solo la statistica e l'impostazione delle code, perché la z non ha bisogno di gradi di libertà: i due campi inutilizzati sono sempre sullo schermo, e un valore vuoto o inutilizzato al loro interno non cambia nulla.

  2. Una t di 2,2281 con 10 gradi di libertà

    1. La distribuzione t con 10 gradi di libertà ha code più pesanti della curva normale
    2. Coda superiore: P(T ≥ 2,2281) = 0,0250015
    3. A due code: 2 × 0,0250015 = 0,050003, cioè 5,0003%

    Confronta questo esempio con quello della z e il senso della distribuzione t diventa visibile: la stessa area di coda del 5% sta a 2,2281 invece che a 1,96, perché un campione piccolo deve spingersi più lontano prima che l'evidenza sia altrettanto insolita. Quello scarto è esattamente ciò che controlla la dimensione del campione — con 1000 gradi di libertà il valore critico della t è 1,962 e le due distribuzioni sono praticamente la stessa curva.

  3. Un chi quadrato di 20 su tre gradi di libertà, sola coda superiore

    1. La distribuzione chi quadrato non ha una metà negativa, quindi qui è disponibile solo la coda superiore
    2. P(χ² ≥ 20) con 3 gradi di libertà = 0,00016975
    3. In percentuale: 0,017%

    Questa è la statistica che la pagina del chi quadrato produce dai conteggi 30, 10, 20 e 40 contro un'attesa uniforme. Il valore p è uscito piccolo — 0,017% — quindi le quattro categorie non sono ugualmente probabili. Nota che cosa manca e va chiesto separatamente: questa pagina dice quanto è insolita la statistica, e non dice nulla sul più piccolo conteggio atteso, che è il controllo dal quale dipende se l'approssimazione chi quadrato fosse appropriata fin dall'inizio.

Limiti

Un valore p risponde a una domanda stretta e viene abitualmente letto come se rispondesse a molte altre che non può coprire. Non è la probabilità che l'ipotesi nulla sia vera, non è la probabilità che il risultato sia capitato per caso e non è una misura di quanto sia grande un effetto — una differenza banale diventa schiacciantemente significativa se il campione è abbastanza grande, e una differenza importante può stare a p = 0,20 in un campione di dodici. Vale inoltre quanto vale il modello dietro la statistica: le quattro distribuzioni qui presenti presuppongono osservazioni indipendenti, e una statistica calcolata da misure raggruppate o ripetute porta meno osservazioni indipendenti di quante la sua formula creda, il che rende troppo piccolo ogni valore p riportato per essa. Due guardie sono imposte anziché lasciate al lettore. Una statistica negativa viene rifiutata per chi quadrato e F, perché quelle distribuzioni vivono sulla semiretta positiva e un valore negativo significa che la statistica è stata calcolata male. E un chi quadrato o una F a due code vengono rifiutati, perché quelle distribuzioni sono asimmetriche e non esiste per esse un'unica convenzione bilaterale accettata.

Domande frequenti

Che cos'è un valore p?
La probabilità di ottenere una statistica test almeno altrettanto estrema di quella che hai, ammesso che l'ipotesi nulla sia vera e che il modello dietro la statistica sia corretto. Descrive i dati, non l'ipotesi: un valore p piccolo dice che il risultato osservato sarebbe insolito se non stesse succedendo nulla, il che non è la stessa cosa del dire che qualcosa sta succedendo. Il passo da lì a una conclusione passa per un livello di significatività che scegli in anticipo, più tutto ciò che sai della materia e che non sta nei numeri.
Devo usare una coda o due?
Due, a meno che tu non abbia deciso diversamente prima di vedere i dati e sappia dire quale direzione avevi previsto. Un test a due code conta come prova contro l'ipotesi nulla un risultato in entrambe le direzioni, il che corrisponde a come sono poste davvero la maggior parte delle domande: anche un farmaco che peggiora le cose è un risultato. Il test a una coda è legittimo ma dimezza il valore p, e scegliere la coda dopo aver guardato i dati è il modo più comune di fabbricare dal nulla un risultato significativo. Se non sei sicuro, usa due code — è la scelta conservativa e quella che un revisore si aspetterà.
Con quale livello di significatività va confrontato il valore p?
Con quello che hai fissato prima di raccogliere i dati — per convenzione 0,05, ma la convenzione è un'abitudine e non un risultato. Qui non è deliberatamente un input e non viene stampato alcun verdetto, perché lo stesso valore p di 0,04 è una scoperta in un contesto e rumore in un altro: setacciare diecimila geni in cerca di un segnale, oppure verificare una sola ipotesi che dieci anni di lavoro precedente sostengono, richiede soglie molto diverse. La convenzione che vale la pena mantenere è che il livello si scelga in anticipo e si dichiari accanto al valore p, invece di aggiustarlo una volta che il numero è sullo schermo.
Perché non posso scegliere due code per il chi quadrato o per la F?
Perché quelle due distribuzioni sono asimmetriche e non esiste un modo unico e accettato di renderle bilaterali. La ricetta abituale — raddoppiare la coda minore — si comporta male proprio dove conta di più: con un chi quadrato esattamente 0, che è un adattamento perfetto tra osservato e atteso e quindi il risultato meno significativo possibile, restituisce un valore p dello 0%. Un adattamento perfetto riportato come massima significatività non è un artefatto di arrotondamento ma una risposta sbagliata, e comparirebbe sullo schermo con un aspetto del tutto normale. Le due code sono inequivocabili per una distribuzione simmetrica, dove raddoppiarne una è esatto, mentre per una asimmetrica è la sola coda superiore a rispondere alla domanda che si pone davvero: quanto è sorprendente una statistica così grande?
Perché la pagina rifiuta una statistica chi quadrato o F negativa?
Perché nessuna delle due statistiche può essere negativa, quindi un valore negativo significa che il numero viene da un posto diverso dal test a cui lo si attribuisce. Entrambe sono costruite da quantità al quadrato — un chi quadrato da scarti al quadrato tra conteggi, una F da un rapporto tra due varianze — e una quantità al quadrato non è mai sotto zero. La pagina potrebbe restituire 100%, e sarebbe aritmeticamente coerente, ma accetterebbe anche un input calcolato male e lo vestirebbe da risultato vero. Rifiutare qui non costa nulla, perché non esiste un chi quadrato negativo legittimo che il rifiuto possa bloccare.
Perché su questa pagina non c'è una tabella dei valori critici?
Perché una tabella dei valori p dovrebbe essere indicizzata per la statistica test, e la statistica può essere un numero qualsiasi, quindi una tabella del genere avrebbe bisogno di infinite righe. Le tabelle stampate in fondo ai manuali vanno nel verso opposto: poche righe per i livelli di significatività convenzionali e colonne per i gradi di libertà che potrebbero servirti, e stanno su una pagina solo perché i livelli di significatività sono pochi e concordati in anticipo. Questa pagina valuta l'area di coda esattamente alla statistica che hai digitato, che è la sola cosa che una tabella non può fare — una tabella può solo dirti se la tua statistica è caduta sopra o sotto i valori che le capita di elencare. La tabella più vicina in questo insieme è sulla pagina dei valori critici, dove le righe sono i livelli di significatività e le colonne danno la z corrispondente. Le due pagine sono lo stesso fatto letto da estremi opposti, ed è per questo che ciascuna rimanda all'altra al primo posto tra gli strumenti correlati.

Riferimenti

Calcolatrici correlate