Saltar al contenido principal
CalcMax

Calculadora de covarianza

Resultado

1,5000

Covarianza

Coeficiente de correlación (r)
0,7746
Media del primer conjunto de datos
3,0000
Media del segundo conjunto de datos
4,0000
Desviación estándar del primer conjunto
1,5811
Desviación estándar del segundo conjunto
1,2247
Cantidad
5

La covarianza mide si dos listas apareadas se mueven juntas: cuando un valor del primer conjunto de datos queda por encima de su media, ¿el valor que le toca en el segundo conjunto queda normalmente por encima de la suya también? Pega las dos listas —un valor por línea, o separados por puntos y coma, comas o espacios— y esta calculadora de covarianza devuelve la covarianza, su signo y, al lado, el coeficiente de correlación de Pearson. También imprime las dos medias y las dos desviaciones estándar, para que el número se pueda comprobar paso a paso. Nada se ordena: el primer valor de una lista se aparea con el primero de la otra, así que el orden en que los escribas forma parte de los datos.

Fórmula

covarianza = Σ(xᵢ − x̄)(yᵢ − ȳ) ÷ divisor, con n − 1 para una muestra y n para una población; r = covarianza ÷ (sₓ × s_y)

xᵢ, yᵢ
Los valores apareados: el i-ésimo número del primer conjunto de datos va con el i-ésimo del segundo. Las dos listas tienen que tener la misma longitud, y ninguna se ordena: el apareamiento es por posición, así que reordenar una lista cambia la respuesta
x̄, ȳ
La media de cada lista, las dos impresas en el resultado. Cada valor entra en el cálculo como su distancia a la media de su propia lista, y de ahí que restar una constante a todos los valores de una lista deje la covarianza igual
n
Cuántas parejas hay —la longitud de cualquiera de las dos listas, hasta 200 aquí—. Es el divisor de la covarianza poblacional, y una unidad menos que el divisor de la muestral
sₓ, s_y
La desviación estándar de cada lista, con el mismo ajuste de muestra o población. Son lo que convierte una covarianza en un coeficiente de correlación, y se imprimen para que la r se pueda recalcular solo con lo que hay en el panel
covarianza
La covarianza misma: positiva cuando las dos listas tienden a subir y bajar juntas, negativa cuando una sube mientras la otra baja, y cercana a cero cuando la relación lineal es débil. Sus unidades son las de x multiplicadas por las de y
r
El coeficiente de correlación de Pearson, covarianza ÷ (sₓ × s_y), que cancela esas unidades y queda entre −1 y 1. A diferencia de la covarianza no cambia al reescalar una lista, y sale idéntico con el ajuste muestral y con el poblacional

La covarianza es el resumen natural cuando se toman dos mediciones sobre los mismos sujetos y la pregunta es si se mueven al mismo paso: altura y peso, horas de estudio y calificaciones, temperatura y consumo eléctrico, el mismo sensor leído en dos momentos. Es la cantidad a la que se generaliza la desviación estándar cuando hay dos variables, y es el ingrediente con el que se construyen toda correlación, toda pendiente de regresión y toda fórmula de varianza de una cartera, así que merece la pena calcularla una vez a mano para ver de dónde salen. Lee el signo, no el tamaño: una covarianza de 1,5 y otra de 150 pueden describir exactamente la misma relación si una lista se midió en metros y la otra en centímetros. El coeficiente de correlación que aparece debajo es la versión sin unidades, y ese es el número que hay que citar cuando lo que importa es la fuerza de la relación. La covarianza tampoco dice nada sobre la causalidad, y solo ve líneas rectas: dos listas con una relación curva perfecta pueden tener covarianza cero.

Ejemplos resueltos

  1. Cinco parejas que suben juntas: covarianza 1,5, r = 0,7746

    1. Medias: x̄ = (1+2+3+4+5) ÷ 5 = 3, y ȳ = (2+4+5+4+5) ÷ 5 = 4
    2. Desviaciones respecto a la media, x: −2, −1, 0, 1, 2; y: −2, 0, 1, 0, 1
    3. Productos cruzados: (−2)(−2) + (−1)(0) + (0)(1) + (1)(0) + (2)(1) = 4 + 0 + 0 + 0 + 2 = 6
    4. Divisor muestral n − 1 = 4: covarianza = 6 ÷ 4 = 1,5
    5. Desviaciones estándar: 1,5811 y 1,2247, así que r = 1,5 ÷ (1,5811 × 1,2247) = 0,7746

    El signo es positivo, que es la parte por la que se lee de verdad una covarianza: los valores de x por encima de la media van con los valores de y por encima de la media. El tamaño —1,5— está en unidades de x por unidades de y y cambiaría si se reescalara cualquiera de las dos listas, y por eso el coeficiente de correlación se imprime al lado. La r sale 0,7746: una relación ascendente clara, pero lejos de una línea recta, porque la pareja (4, 4) se queda por debajo del patrón.

  2. Las mismas parejas como población: covarianza 1,2 y r sin cambios

    1. Las sumas no cambian: los productos cruzados siguen sumando 6 y las medias siguen siendo 3 y 4
    2. Divisor poblacional n = 5: covarianza = 6 ÷ 5 = 1,2, menor que el valor muestral porque el divisor es mayor
    3. Las dos desviaciones estándar encogen por la misma razón: 1,4142 y 1,0954
    4. r = 1,2 ÷ (1,4142 × 1,0954) = 0,7746, igual que antes

    Cambiar el divisor mueve la covarianza y las dos desviaciones estándar, pero no la correlación: en ese cociente n − 1 se cancela con n. Así que la elección entre muestra y población importa para la covarianza y no importa en absoluto para la r, cosa que conviene saber antes de comparar una covarianza calculada aquí con otra publicada en otro sitio: dos trabajos pueden discrepar entre 1,5 y 1,2 y coincidir perfectamente sobre la relación.

  3. Una curva perfecta con covarianza cero

    1. Medias: las dos listas promedian 3
    2. Desviaciones, x: −2, −1, 0, 1, 2; y: −2, 1, 2, 1, −2
    3. Productos cruzados: 4 − 1 + 0 + 1 − 4 = 0
    4. Covarianza: 0 ÷ 4 = 0, y r = 0 ÷ (1,5811 × 1,8708) = 0 también

    La segunda lista es una U invertida: 1, 4, 5, 4, 1 es un patrón perfectamente regular, y su covarianza con 1 a 5 es exactamente cero. La covarianza solo detecta relaciones en línea recta; aquí la segunda lista sube y luego baja, y las contribuciones positivas y negativas se cancelan con precisión. Una covarianza cercana a cero significa por tanto «ninguna relación lineal», nunca «ninguna relación», y esa es la razón de que el diagrama de dispersión no haya quedado obsoleto frente a un solo número.

Limitaciones

Una covarianza no es una correlación y no se debe leer como tal. Su tamaño depende de las unidades de las dos listas, así que no se puede comparar entre parejas de variables medidas en escalas distintas, y no tiene ningún límite superior contra el que juzgarla: solo su signo es directamente interpretable. Además solo mide asociación lineal, de modo que una relación curva fuerte puede producir una covarianza cercana a cero. Como se calcula a partir de valores apareados, necesita que las dos listas se correspondan: tienen que tener la misma longitud, y cada valor se aparea con el que ocupa su misma posición, así que un dato que falte o que sobre en una lista desplaza todo lo que viene detrás. Si alguna de las dos listas no tiene variación ninguna —todos sus valores iguales—, el coeficiente de correlación no está definido y esta página se niega a responder en lugar de imprimir una división entre cero. Las listas están limitadas a 200 parejas, y formas como 1,500 se rechazan en lugar de adivinar qué significan, porque una coma entre dígitos es una parte decimal en unos países y un separador de millares en otros. Nada de lo que hay aquí establece causalidad: dos listas que se mueven juntas pueden estar respondiendo a una tercera variable que no está en ninguna de las dos.

Preguntas frecuentes

¿Cómo calcular la covarianza?
Aparea las listas por posición, resta a cada valor la media de su propia lista, multiplica las dos desviaciones de cada pareja, suma esos productos y divide entre n − 1 si es una muestra o entre n si es una población. Para x = 1, 2, 3, 4, 5 e y = 2, 4, 5, 4, 5 los productos cruzados suman 6, así que la covarianza muestral es 6 ÷ 4 = 1,5. Las dos medias, las dos desviaciones estándar y el resultado se imprimen arriba, así que cada paso se puede seguir.
¿Tienen que tener la misma longitud las dos listas?
Sí, y además tienen que estar en el orden correcto: el primer valor de una lista se aparea con el primero de la otra, y no se ordena nada. Por eso esta página rechaza una pareja de listas descuadrada en lugar de rellenar la más corta: con 3 valores en un conjunto de datos y 2 en el otro no hay manera de saber qué dato falta, y aparear los dos primeros en silencio daría una respuesta equivocada que parece completamente razonable. Comprueba que las dos columnas vienen de los mismos sujetos y en las mismas filas antes de pegarlas.
¿Qué significa el signo de la covarianza?
Una covarianza positiva significa que cuando un valor queda por encima de la media de su propia lista, el valor apareado tiende a quedar por encima de la media de la otra: las dos suben y bajan juntas. Una covarianza negativa significa lo contrario: uno por encima de la media tiende a ir con el otro por debajo. Un valor cercano a cero significa que no hay ningún patrón en línea recta, lo que no es lo mismo que no haber ninguna relación: la lista 1, 4, 5, 4, 1 tiene una forma de U invertida perfectamente regular y una covarianza exactamente cero con 1, 2, 3, 4, 5.
¿Por qué se imprime también el coeficiente de correlación?
Porque una covarianza no se puede leer sola. Sus unidades son las del primer conjunto de datos multiplicadas por las del segundo, así que medir una lista en centímetros en lugar de en metros la multiplica por 100 sin que cambie nada de la relación. Dividir entre las dos desviaciones estándar cancela esas unidades y encierra la respuesta entre −1 y 1, lo que la hace comparable entre variables. La covarianza es la cantidad con la que está construido el álgebra; la r es la que hay que citar cuando alguien pregunta qué fuerza tiene la relación.
¿Por qué se ha negado a responder cuando una de mis listas es constante?
Porque el coeficiente de correlación se dividiría entre cero: si todos los valores de una lista son idénticos, la desviación estándar de esa lista es cero y la relación no tiene una fuerza definida. La covarianza en sí está perfectamente definida —vale cero—, pero la página imprime los dos números juntos, e informar de media respuesta invitaría a tomar una r sin sentido por una r real. La misma decisión se toma en otros sitios de este sitio: la página del coeficiente de variación se niega cuando la media no es positiva en lugar de imprimir un cociente indefinido.
¿Debo usar el divisor muestral o el poblacional?
Usa el ajuste muestral, n − 1, cuando tus listas sean una muestra extraída de algo mayor y quieras describir el grupo amplio, que es el caso habitual. Usa el ajuste poblacional, n, cuando las listas sean el grupo entero que te interesa. La elección cambia la covarianza y las dos desviaciones estándar, pero nunca el coeficiente de correlación, porque n − 1 se cancela con n en ese cociente. Para las cinco parejas de arriba la covarianza es 1,5 como muestra y 1,2 como población, con r = 0,7746 en los dos casos.

Referencias

Calculadoras relacionadas