Calculadora de covariância
Resultado
Covariância
- Coeficiente de correlação (r)
- 0,7746
- Média do primeiro conjunto de dados
- 3,0000
- Média do segundo conjunto de dados
- 4,0000
- Desvio padrão do primeiro conjunto de dados
- 1,5811
- Desvio padrão do segundo conjunto de dados
- 1,2247
- Contagem
- 5
A covariância mede se duas listas emparelhadas andam juntas: quando um valor da primeira lista fica acima da média dela, o valor correspondente na segunda lista costuma ficar acima da média também? Cole as duas listas, um valor por linha ou separados por ponto e vírgula, vírgula ou espaço, e esta calculadora de covariância devolve a covariância, o sinal dela e o coeficiente de correlação de Pearson ao lado. As duas médias e os dois desvios padrão também são impressos, para que o número possa ser conferido passo a passo. Nada é ordenado: o primeiro valor de uma lista é emparelhado com o primeiro valor da outra, então a ordem em que você digita faz parte da entrada.
Fórmula
cov = Σ(xᵢ − x̄)(yᵢ − ȳ) ÷ divisor, com n − 1 para uma amostra e n para uma população; r = cov ÷ (sₓ × s_y)
- xᵢ, yᵢ
- Os valores emparelhados: o i-ésimo número da primeira lista acompanha o i-ésimo número da segunda. As duas listas precisam ter o mesmo comprimento, e nenhuma delas é ordenada — o emparelhamento é por posição, então reordenar uma lista muda a resposta
- x̄, ȳ
- A média de cada lista, ambas impressas no resultado. Cada valor entra na conta como um desvio em relação à média da própria lista, e é por isso que subtrair uma constante de todos os valores de uma lista deixa a covariância intacta
- n
- Quantos pares existem: o comprimento de qualquer das listas, até 200 aqui. É o divisor da covariância populacional e uma unidade menos que o divisor da amostral
- sₓ, s_y
- O desvio padrão de cada lista, no mesmo ajuste de amostra ou população. São eles que transformam uma covariância no coeficiente de correlação, e aparecem impressos para que o r possa ser refeito só com o painel
- cov
- A covariância em si: positiva quando as duas listas tendem a subir e cair juntas, negativa quando uma sobe enquanto a outra desce, perto de zero quando a relação linear é fraca. As unidades dela são as unidades de x vezes as unidades de y
- r
- O coeficiente de correlação de Pearson, cov ÷ (sₓ × s_y), que cancela essas unidades e fica entre −1 e 1. Ao contrário da covariância, ele não muda quando você reescala uma lista, e sai idêntico nos ajustes de amostra e de população
A covariância é o resumo natural quando duas medições são feitas nas mesmas unidades amostrais e a pergunta é se elas andam em passo: altura e peso, horas de estudo e notas, temperatura e consumo de energia, o mesmo sensor lido em dois momentos. É a quantidade para a qual o desvio padrão se generaliza quando são duas variáveis, e é o ingrediente de toda correlação, de toda inclinação de regressão e de toda fórmula de variância de carteira, então vale calculá-la uma vez à mão para ver de onde essas coisas saem. Leia o sinal, não o tamanho: uma covariância de 1,5 e uma de 150 podem descrever exatamente a mesma relação se uma lista foi medida em metros e a outra em centímetros. O coeficiente de correlação impresso abaixo é a versão sem unidade, e é o número a citar quando o que importa é a força da relação. A covariância também não diz nada sobre causalidade, e só enxerga retas: duas listas com uma relação curva perfeita podem ter covariância zero.
Exemplos resolvidos
Cinco pares que sobem juntos: covariância 1,5, r = 0,7746
- Médias: x̄ = (1+2+3+4+5) ÷ 5 = 3, e ȳ = (2+4+5+4+5) ÷ 5 = 4
- Desvios em relação à média, x: −2, −1, 0, 1, 2; y: −2, 0, 1, 0, 1
- Produtos cruzados: (−2)(−2) + (−1)(0) + (0)(1) + (1)(0) + (2)(1) = 4 + 0 + 0 + 0 + 2 = 6
- Divisor amostral n − 1 = 4: covariância = 6 ÷ 4 = 1,5
- Desvios padrão: 1,5811 e 1,2247, então r = 1,5 ÷ (1,5811 × 1,2247) = 0,7746
O sinal é positivo, e é por ele que a covariância é de fato lida: valores de x acima da média andam junto com valores de y acima da média. O tamanho, 1,5, está em unidades de x vezes unidades de y e mudaria se qualquer das listas fosse reescalada, e é por isso que o coeficiente de correlação aparece impresso ao lado. O r sai em 0,7746: uma relação de subida clara, mas longe de uma reta, porque o par (4, 4) fica abaixo do padrão.
Os mesmos pares como população: covariância 1,2, r sem mudança
- As somas são as mesmas: os produtos cruzados ainda somam 6 e as médias continuam 3 e 4
- Divisor populacional n = 5: covariância = 6 ÷ 5 = 1,2 — menor que o valor amostral, porque o divisor é maior
- Os dois desvios padrão encolhem pelo mesmo motivo: 1,4142 e 1,0954
- r = 1,2 ÷ (1,4142 × 1,0954) = 0,7746 — o mesmo de antes
Trocar o divisor muda a covariância e os dois desvios padrão, mas não a correlação: n − 1 se cancela com n nessa razão. Então a escolha entre amostra e população importa para a covariância e não importa nada para o r, o que é bom saber antes de comparar uma covariância calculada aqui com uma relatada em outro lugar — dois artigos podem discordar entre 1,5 e 1,2 e concordar perfeitamente sobre a relação.
Uma curva perfeita com covariância zero
- Médias: as duas listas dão média 3
- Desvios, x: −2, −1, 0, 1, 2; y: −2, 1, 2, 1, −2
- Produtos cruzados: 4 − 1 + 0 + 1 − 4 = 0
- Covariância: 0 ÷ 4 = 0, e r = 0 ÷ (1,5811 × 1,8708) = 0 também
A segunda lista é um U de cabeça para baixo: 1, 4, 5, 4, 1 é um padrão perfeitamente regular, e a covariância dela com 1 a 5 é exatamente zero. A covariância só detecta relações em linha reta — aqui a segunda lista sobe e depois desce, e as contribuições positivas e negativas se cancelam com precisão. Uma covariância perto de zero significa, portanto, ausência de relação linear, nunca ausência de relação, e é por isso que o diagrama de dispersão não foi aposentado por um único número.
Limitações
Covariância não é correlação e não deve ser lida como se fosse. O tamanho dela depende das unidades das duas listas, então ela não pode ser comparada entre pares de variáveis medidos em escalas diferentes, e não tem limite superior com o qual se comparar: só o sinal dela é diretamente interpretável. Ela também mede apenas associação linear, então uma relação curva forte pode produzir uma covariância perto de zero. Como é calculada a partir de valores emparelhados, depende de as duas listas se alinharem: elas precisam ter o mesmo comprimento, e cada valor é emparelhado com o que está na mesma posição, então uma entrada faltando ou sobrando em uma lista desloca tudo o que vem depois dela. Se qualquer das listas não tiver variação nenhuma, com todos os valores idênticos, o coeficiente de correlação fica indefinido e esta página se recusa a responder em vez de imprimir uma divisão por zero. As listas são limitadas a 200 pares, e entradas como 1.500 são recusadas em vez de adivinhadas, porque um ponto entre dígitos é separador de milhar em tantas línguas. Nada aqui estabelece causalidade: duas listas que andam juntas podem estar respondendo a uma terceira variável que não está em nenhuma delas.
Perguntas frequentes
- Como calcular a covariância?
- Emparelhe as listas por posição, subtraia de cada valor a média da própria lista, multiplique os dois desvios de cada par, some esses produtos e divida por n − 1 para uma amostra ou por n para uma população. Para x = 1, 2, 3, 4, 5 e y = 2, 4, 5, 4, 5 os produtos cruzados somam 6, então a covariância amostral é 6 ÷ 4 = 1,5. As duas médias, os dois desvios padrão e o resultado aparecem impressos acima, para que cada passo possa ser acompanhado.
- As duas listas precisam ter o mesmo comprimento?
- Sim, e precisam também estar na ordem certa: o primeiro valor de uma lista é emparelhado com o primeiro valor da outra, e nada é ordenado. É por isso que esta página recusa um par de listas de tamanhos diferentes em vez de completar a menor: com 3 valores em uma lista e 2 na outra, não há como saber qual entrada está faltando, e emparelhar os dois primeiros em silêncio daria uma resposta errada com aparência perfeitamente razoável. Confira se as duas listas vêm das mesmas unidades amostrais, nas mesmas linhas, antes de colar.
- O que significa o sinal da covariância?
- Uma covariância positiva significa que, quando um valor fica acima da média da própria lista, o valor emparelhado tende a ficar acima da média da outra lista: as duas sobem e descem juntas. Uma covariância negativa significa o contrário — um acima da média tende a acompanhar o outro abaixo da média. Um valor perto de zero significa que não há padrão em linha reta, o que não é a mesma coisa que nenhuma relação: a lista 1, 4, 5, 4, 1 tem um formato de U invertido perfeitamente regular e covariância exatamente zero com 1, 2, 3, 4, 5.
- Por que o coeficiente de correlação também é impresso?
- Porque uma covariância não pode ser lida sozinha. As unidades dela são as unidades da primeira lista multiplicadas pelas da segunda, então medir uma lista em centímetros em vez de metros multiplica o valor por 100 sem mudar nada na relação. Dividir pelos dois desvios padrão cancela essas unidades e prende a resposta entre −1 e 1, o que a torna comparável entre variáveis. A covariância é a quantidade com que a álgebra é construída; o r é o número a citar quando alguém pergunta qual é a força da relação.
- Por que a página se recusou a responder quando uma das listas é constante?
- Porque o coeficiente de correlação seria uma divisão por zero: se todos os valores de uma lista são idênticos, o desvio padrão dela é zero, e a relação não tem força definida. A covariância em si está perfeitamente bem definida — ela é zero —, mas a página imprime os dois números juntos, e relatar meia resposta convidaria quem lê a tratar um r sem sentido como se fosse real. A mesma escolha é feita em outro ponto do site: a página do coeficiente de variação se recusa quando a média não é positiva, em vez de imprimir uma razão indefinida.
- Devo usar o divisor de amostra ou o de população?
- Use o ajuste de amostra, n − 1, quando as suas listas são uma amostra tirada de algo maior e você quer descrever o grupo mais amplo, que é o caso comum. Use o ajuste de população, n, quando as listas são o grupo inteiro que interessa. A escolha muda a covariância e os dois desvios padrão, mas nunca o coeficiente de correlação, já que n − 1 se cancela com n nessa razão. Para os cinco pares acima, a covariância amostral é 1,5 e a populacional é 1,2, com r = 0,7746 nos dois casos.
Referências
- Correlation, Variance and Covariance (Matrices) — R stats package reference (cov and cor; documents the n − 1 denominator used for the covariance and treats the correlation as the covariance scaled by the two standard deviations) — The R Project for Statistical Computing
- scipy.stats.pearsonr — SciPy reference (the Pearson coefficient's range and its interpretation as a measure of linear association) — SciPy
- The Regression Equation — Introductory Statistics 2e, section 12.3 (defines the correlation coefficient r, after Karl Pearson, as a numerical measure of the strength and direction of the linear association between two variables) — OpenStax, Rice University