Calcolatrice della covarianza
Risultato
Covarianza
- Coefficiente di correlazione (r)
- 0,7746
- Media del primo insieme di dati
- 3,0000
- Media del secondo insieme di dati
- 4,0000
- Deviazione standard del primo insieme di dati
- 1,5811
- Deviazione standard del secondo insieme di dati
- 1,2247
- Numerosità
- 5
La covarianza misura se due insiemi di dati appaiati si muovono insieme: quando un valore della prima lista sta sopra la sua media, il valore corrispondente della seconda lista sta di solito sopra la sua media? Incolla le due liste — un valore per riga, oppure separati da punto e virgola o da spazi — e questa calcolatrice della covarianza restituisce la covarianza, il suo segno, e accanto il coefficiente di correlazione lineare di Pearson. Sono stampate anche le due medie e le due deviazioni standard, così il numero si può controllare passaggio per passaggio. Nulla viene ordinato: il primo valore di una lista è appaiato al primo valore dell'altra, quindi l'ordine in cui li digiti fa parte dell'input.
Formula
cov = Σ(xᵢ − x̄)(yᵢ − ȳ) ÷ divisore, con n − 1 per un campione e n per una popolazione; r = cov ÷ (sₓ × s_y)
- xᵢ, yᵢ
- I valori appaiati: l'i-esimo numero della prima lista va con l'i-esimo numero della seconda. Le due liste devono avere la stessa lunghezza, e nessuna delle due viene ordinata: l'appaiamento è per posizione, quindi riordinare una lista cambia la risposta
- x̄, ȳ
- La media di ciascuna lista, entrambe stampate nel risultato. Ogni valore entra nel calcolo come scostamento dalla media della propria lista, ed è per questo che sottrarre una costante qualsiasi da tutti i valori di una lista lascia la covarianza invariata
- n
- Quante coppie ci sono, cioè la lunghezza di una delle due liste, fino a 200 in questa pagina. È il divisore per la covarianza di popolazione e uno in meno del divisore per quella campionaria
- sₓ, s_y
- La deviazione standard di ciascuna lista, con la stessa impostazione campione o popolazione. Sono ciò che trasforma una covarianza nel coefficiente di correlazione, e sono stampate perché r si possa ricalcolare dal solo pannello
- cov
- La covarianza stessa: positiva quando le due liste tendono a salire e scendere insieme, negativa quando una sale mentre l'altra scende, vicina a zero quando la relazione lineare è debole. Le sue unità di misura sono quelle della x moltiplicate per quelle della y
- r
- Il coefficiente di correlazione di Pearson, cov ÷ (sₓ × s_y), che annulla quelle unità e cade fra −1 e 1. A differenza della covarianza non cambia quando si riscala una lista, e viene identico con l'impostazione campione e con quella popolazione
La covarianza è il riassunto naturale quando due misure sono prese sugli stessi soggetti e la domanda è se si muovono al passo: altezza e peso, ore di studio e voti, temperatura e consumo di elettricità, lo stesso sensore letto in due momenti. È la grandezza a cui la deviazione standard si generalizza quando le variabili sono due, ed è l'ingrediente da cui nascono ogni correlazione, ogni pendenza di regressione e ogni formula di varianza di portafoglio: vale la pena calcolarla una volta a mano per vedere da dove vengono. Leggi il segno, non la grandezza: una covarianza di 1,5 e una di 150 possono descrivere esattamente la stessa relazione, se una lista era misurata in metri e l'altra in centimetri. Il coefficiente di correlazione stampato sotto è la versione senza unità di misura, ed è il numero da citare quando quello che conta è la forza della relazione. La covarianza inoltre non dice nulla sulla causalità, e vede solo le rette: due liste con una relazione curva perfetta possono avere covarianza zero.
Esempi svolti
Cinque coppie che salgono insieme: covarianza 1,5, r = 0,7746
- Medie: x̄ = (1+2+3+4+5) ÷ 5 = 3, e ȳ = (2+4+5+4+5) ÷ 5 = 4
- Scostamenti dalla media, x: −2, −1, 0, 1, 2; y: −2, 0, 1, 0, 1
- Prodotti incrociati: (−2)(−2) + (−1)(0) + (0)(1) + (1)(0) + (2)(1) = 4 + 0 + 0 + 0 + 2 = 6
- Divisore campionario n − 1 = 4: covarianza = 6 ÷ 4 = 1,5
- Deviazioni standard: 1,5811 e 1,2247, quindi r = 1,5 ÷ (1,5811 × 1,2247) = 0,7746
Il segno è positivo, ed è la parte per cui la covarianza si legge davvero: i valori di x sopra la media si accompagnano a valori di y sopra la media. La grandezza — 1,5 — è in unità di x per unità di y e cambierebbe se una delle due liste fosse riscalata, ed è per questo che accanto c'è il coefficiente di correlazione. r esce a 0,7746: una relazione chiaramente crescente, ma lontana da una retta, perché la coppia (4, 4) sta sotto lo schema.
Le stesse coppie come popolazione: covarianza 1,2, r invariato
- Somme invariate: i prodotti incrociati fanno sempre 6 e le medie sono sempre 3 e 4
- Divisore di popolazione n = 5: covarianza = 6 ÷ 5 = 1,2 — più piccola di quella campionaria, perché il divisore è più grande
- Anche le due deviazioni standard si riducono per lo stesso motivo: 1,4142 e 1,0954
- r = 1,2 ÷ (1,4142 × 1,0954) = 0,7746 — lo stesso di prima
Cambiare il divisore sposta la covarianza e le due deviazioni standard, ma non la correlazione: in quel rapporto n − 1 si semplifica contro n. Quindi la scelta fra campione e popolazione conta per la covarianza e non conta affatto per r, cosa che vale la pena sapere prima di confrontare una covarianza calcolata qui con una riportata altrove: due lavori possono non essere d'accordo fra 1,5 e 1,2 ed essere perfettamente d'accordo sulla relazione.
Una curva perfetta con covarianza zero
- Medie: entrambe le liste hanno media 3
- Scostamenti, x: −2, −1, 0, 1, 2; y: −2, 1, 2, 1, −2
- Prodotti incrociati: 4 − 1 + 0 + 1 − 4 = 0
- Covarianza: 0 ÷ 4 = 0, e anche r = 0 ÷ (1,5811 × 1,8708) = 0
La seconda lista è una U rovesciata: 1, 4, 5, 4, 1 è uno schema perfettamente regolare, e la sua covarianza con 1, 2, 3, 4, 5 è esattamente zero. La covarianza rileva solo relazioni rettilinee — qui la seconda lista sale e poi scende, e i contributi positivi e negativi si annullano con precisione. Una covarianza vicina a zero significa dunque assenza di relazione lineare, mai assenza di relazione, ed è il motivo per cui il diagramma a dispersione non è stato reso inutile da un singolo numero.
Limiti
La covarianza non è una correlazione e non va letta come tale. La sua grandezza dipende dalle unità di misura di entrambe le liste, quindi non si può confrontare fra coppie di variabili misurate su scale diverse, e non ha un limite superiore con cui giudicarla: solo il suo segno è direttamente interpretabile. Inoltre misura soltanto l'associazione lineare, perciò una relazione curva forte può produrre una covarianza vicina a zero. Poiché è calcolata da valori appaiati, richiede che le due liste siano allineate: devono avere la stessa lunghezza, e ogni valore è appaiato a quello che sta nella stessa posizione, quindi una voce mancante o in più in una lista sposta tutto ciò che viene dopo. Se una delle due liste non ha alcuna variazione — tutti i valori identici — il coefficiente di correlazione è indefinito e questa pagina si rifiuta di rispondere invece di stampare una divisione per zero. Le liste sono limitate a 200 coppie, e numeri come 1,500 vengono rifiutati invece di essere interpretati, dato che una virgola fra le cifre è un segno decimale in alcuni paesi e un separatore di migliaia in altri. Nulla di quanto c'è qui stabilisce un rapporto di causa: due liste che si muovono insieme possono rispondere a una terza variabile che non è in nessuna delle due.
Domande frequenti
- Come si calcola la covarianza?
- Appaia le liste per posizione, sottrai a ciascun valore la media della sua lista, moltiplica fra loro i due scostamenti di ogni coppia, somma quei prodotti e dividi per n − 1 se il campione o per n se la popolazione. Per x = 1, 2, 3, 4, 5 e y = 2, 4, 5, 4, 5 i prodotti incrociati fanno 6, quindi la covarianza campionaria è 6 ÷ 4 = 1,5. Le due medie, le due deviazioni standard e il risultato sono stampati qui sopra, così ogni passaggio si può seguire.
- Le due liste devono avere la stessa lunghezza?
- Sì, e devono anche essere nell'ordine giusto: il primo valore di una lista è appaiato al primo valore dell'altra, e nulla viene ordinato. È per questo che la pagina rifiuta due liste di lunghezza diversa invece di allungare la più corta: con 3 valori in una lista e 2 nell'altra non c'è modo di sapere quale voce manchi, e appaiare in silenzio le prime due darebbe una risposta sbagliata dall'aspetto del tutto ragionevole. Controlla che entrambe le liste vengano dagli stessi soggetti e dalle stesse righe prima di incollarle.
- Che cosa significa il segno della covarianza?
- Una covarianza positiva significa che quando un valore sta sopra la media della propria lista, il valore appaiato tende a stare sopra la media dell'altra: le due salgono e scendono insieme. Una covarianza negativa significa l'opposto: uno sopra la media tende ad accompagnarsi all'altro sotto la media. Un valore vicino a zero significa che non c'è uno schema rettilineo, il che non è la stessa cosa che assenza di relazione: la lista 1, 4, 5, 4, 1 ha una forma a U rovesciata perfettamente regolare e covarianza esattamente zero con 1, 2, 3, 4, 5.
- Perché viene stampato anche il coefficiente di correlazione?
- Perché una covarianza non si legge da sola. Le sue unità di misura sono quelle della prima lista moltiplicate per quelle della seconda, quindi misurare una lista in centimetri invece che in metri la moltiplica per 100 senza cambiare nulla della relazione. Dividere per entrambe le deviazioni standard annulla quelle unità e costringe la risposta fra −1 e 1, il che la rende confrontabile fra variabili diverse. La covarianza è la grandezza su cui è costruita l'algebra; r è quella da citare quando qualcuno chiede quanto è forte la relazione.
- Perché si è rifiutata di calcolare quando una delle liste è costante?
- Perché il coefficiente di correlazione verrebbe diviso per zero: se tutti i valori di una lista sono identici, la deviazione standard di quella lista è zero e la relazione non ha una forza definita. La covarianza in sé è perfettamente definita — vale zero — ma la pagina stampa i due numeri insieme, e riportare mezza risposta inviterebbe il lettore a prendere per buono un r che non significa nulla. La stessa scelta è fatta altrove su questo sito: la pagina del coefficiente di variazione si rifiuta quando la media non è positiva, invece di stampare un rapporto indefinito.
- Conviene usare il divisore campionario o quello di popolazione?
- Usa l'impostazione campionaria, n − 1, quando le tue liste sono un campione estratto da qualcosa di più grande e vuoi descrivere il gruppo più ampio: è il caso usuale. Usa l'impostazione di popolazione, n, quando le liste sono l'intero gruppo che ti interessa. La scelta cambia la covarianza e le due deviazioni standard ma mai il coefficiente di correlazione, dato che in quel rapporto n − 1 si semplifica contro n. Per le cinque coppie qui sopra la covarianza è 1,5 come campione e 1,2 come popolazione, con r = 0,7746 in entrambi i casi.
Riferimenti
- Correlation, Variance and Covariance (Matrices) — R stats package reference (cov and cor; documents the n − 1 denominator used for the covariance and treats the correlation as the covariance scaled by the two standard deviations) — The R Project for Statistical Computing
- scipy.stats.pearsonr — SciPy reference (the Pearson coefficient's range and its interpretation as a measure of linear association) — SciPy
- The Regression Equation — Introductory Statistics 2e, section 12.3 (defines the correlation coefficient r, after Karl Pearson, as a numerical measure of the strength and direction of the linear association between two variables) — OpenStax, Rice University
- GB/T 3358.1-2009, Statistics — Vocabulary and symbols, Part 1 (the Chinese national vocabulary standard covering covariance and the correlation coefficient; the record page notes that no online full text is offered) — State Administration for Market Regulation, China