Calculatrice de covariance
Résultat
Covariance
- Coefficient de corrélation (r)
- 0,7746
- Moyenne du premier jeu de données
- 3,0000
- Moyenne du deuxième jeu de données
- 4,0000
- Écart type du premier jeu de données
- 1,5811
- Écart type du deuxième jeu de données
- 1,2247
- Effectif
- 5
La covariance mesure si deux listes appariées varient ensemble : quand une valeur de la première liste se situe au-dessus de sa moyenne, la valeur correspondante de la seconde liste est-elle elle aussi le plus souvent au-dessus de sa moyenne ? Collez les deux listes — une valeur par ligne, ou séparées par des points-virgules, des virgules ou des espaces — et cette calculatrice de covariance renvoie la covariance, son signe, et le coefficient de corrélation de Pearson à côté. Les deux moyennes et les deux écarts types sont également affichés, de sorte que le nombre se vérifie étape par étape. Rien n’est trié : la première valeur d’une liste est appariée à la première valeur de l’autre, donc l’ordre dans lequel vous les saisissez fait partie de l’entrée.
Formule
cov = Σ(xᵢ − x̄)(yᵢ − ȳ) ÷ diviseur, avec n − 1 pour un échantillon et n pour une population ; r = cov ÷ (sₓ × s_y)
- xᵢ, yᵢ
- Les valeurs appariées : le i-ème nombre de la première liste va avec le i-ème nombre de la seconde. Les deux listes doivent avoir la même longueur, et aucune n’est triée — l’appariement se fait par position, donc réordonner une liste change la réponse
- x̄, ȳ
- La moyenne de chaque liste, toutes deux imprimées dans le résultat. Chaque valeur entre dans le calcul comme un écart à la moyenne de sa propre liste, et c’est pourquoi soustraire une même constante à toutes les valeurs d’une liste laisse la covariance inchangée
- n
- Le nombre de paires — la longueur de l’une ou l’autre liste, plafonnée à 200 ici. C’est le diviseur de la covariance de population, et un de moins que le diviseur pour un échantillon
- sₓ, s_y
- L’écart type de chaque liste, sur le même réglage échantillon ou population. Ce sont eux qui transforment une covariance en coefficient de corrélation, et ils sont imprimés pour que r puisse être recalculé à partir du panneau seul
- cov
- La covariance elle-même : positive quand les deux listes tendent à monter et descendre ensemble, négative quand l’une monte pendant que l’autre descend, proche de zéro quand la relation linéaire est faible. Son unité est l’unité de x multipliée par l’unité de y
- r
- Le coefficient de corrélation de Pearson, cov ÷ (sₓ × s_y), qui annule ces unités et se situe entre −1 et 1. Contrairement à la covariance, il ne change pas quand on change l’échelle d’une liste, et il est identique dans les réglages échantillon et population
La covariance est le résumé naturel quand deux mesures sont prises sur les mêmes sujets et que la question est de savoir si elles évoluent du même pas : taille et poids, heures d’étude et notes, température et consommation d’électricité, un même capteur relevé à deux instants. C’est la quantité vers laquelle l’écart type se généralise à deux variables, et c’est l’ingrédient dont sont faites toutes les corrélations, les pentes de régression et les formules de variance de portefeuille — cela vaut donc la peine de la calculer une fois à la main pour voir d’où elles viennent. Lisez le signe, pas la taille : une covariance de 1,5 et une covariance de 150 peuvent décrire exactement la même relation si une liste a été mesurée en mètres et l’autre en centimètres. Le coefficient de corrélation imprimé en dessous est la version sans unité, et c’est le nombre à citer quand c’est la force de la relation qui importe. La covariance ne dit rien non plus de la causalité, et elle ne voit que les droites : deux listes liées par une courbe parfaite peuvent avoir une covariance nulle.
Exemples détaillés
Cinq paires qui montent ensemble : covariance 1,5, r = 0,7746
- Moyennes : x̄ = (1+2+3+4+5) ÷ 5 = 3, et ȳ = (2+4+5+4+5) ÷ 5 = 4
- Écarts à la moyenne, x : −2, −1, 0, 1, 2 ; y : −2, 0, 1, 0, 1
- Produits croisés : (−2)(−2) + (−1)(0) + (0)(1) + (1)(0) + (2)(1) = 4 + 0 + 0 + 0 + 2 = 6
- Diviseur d’échantillon n − 1 = 4 : covariance = 6 ÷ 4 = 1,5
- Écarts types : 1,5811 et 1,2247, donc r = 1,5 ÷ (1,5811 × 1,2247) = 0,7746
Le signe est positif, et c’est la partie pour laquelle la covariance se lit vraiment : les valeurs de x au-dessus de la moyenne s’apparient avec des valeurs de y au-dessus de la moyenne. La taille — 1,5 — est en unités de x fois unités de y et changerait si l’une ou l’autre liste était remise à l’échelle, et c’est pourquoi le coefficient de corrélation est imprimé à côté. r ressort à 0,7746 : une relation ascendante nette, mais loin d’une droite, parce que la paire (4 ; 4) passe sous le motif.
Les mêmes paires en population : covariance 1,2, r inchangé
- Mêmes sommes : les produits croisés totalisent toujours 6 et les moyennes valent toujours 3 et 4
- Diviseur de population n = 5 : covariance = 6 ÷ 5 = 1,2 — plus petite que la valeur d’échantillon, parce que le diviseur est plus grand
- Les deux écarts types diminuent pour la même raison : 1,4142 et 1,0954
- r = 1,2 ÷ (1,4142 × 1,0954) = 0,7746 — le même qu’avant
Changer de diviseur déplace la covariance et les deux écarts types, mais pas la corrélation : n − 1 s’annule contre n dans ce rapport. Le choix entre échantillon et population compte donc pour la covariance et pas du tout pour r, ce qui mérite d’être su avant de comparer une covariance calculée ici avec une covariance annoncée ailleurs — deux articles peuvent ne pas être d’accord sur 1,5 contre 1,2 et être parfaitement d’accord sur la relation.
Une courbe parfaite avec une covariance nulle
- Moyennes : les deux listes ont pour moyenne 3
- Écarts, x : −2, −1, 0, 1, 2 ; y : −2, 1, 2, 1, −2
- Produits croisés : 4 − 1 + 0 + 1 − 4 = 0
- Covariance : 0 ÷ 4 = 0, et r = 0 ÷ (1,5811 × 1,8708) = 0 également
La seconde liste est un U renversé : 1, 4, 5, 4, 1 est un motif parfaitement régulier, et sa covariance avec 1 à 5 vaut exactement zéro. La covariance ne détecte que les relations en ligne droite — ici la seconde liste monte puis redescend, et les contributions positives et négatives s’annulent précisément. Une covariance proche de zéro signifie donc « aucune relation linéaire », jamais « aucune relation », et c’est la raison pour laquelle le nuage de points n’a pas été rendu obsolète par un seul nombre.
Limites
La covariance n’est pas une corrélation et ne doit pas se lire comme telle. Sa taille dépend des unités des deux listes, elle ne se compare donc pas d’un couple de variables à un autre mesuré sur des échelles différentes, et elle n’a aucune borne supérieure à laquelle se juger — seul son signe est directement interprétable. Elle ne mesure par ailleurs que l’association linéaire, si bien qu’une forte relation courbe peut produire une covariance proche de zéro. Comme elle est calculée à partir de valeurs appariées, elle exige que les deux listes soient alignées : les deux listes doivent avoir la même longueur, et chaque valeur est appariée à celle qui occupe la même position, donc une entrée manquante ou en trop dans une liste décale tout ce qui suit. Si l’une des listes ne varie pas du tout — toutes les valeurs identiques — le coefficient de corrélation n’est pas défini et cette page refuse de répondre plutôt que d’imprimer une division par zéro. Les listes sont plafonnées à 200 paires, et des jetons comme « 1,500 » sont refusés plutôt que devinés, puisqu’une virgule entre deux chiffres est un séparateur décimal dans certains pays et un séparateur de milliers dans d’autres. Rien ici n’établit de causalité : deux listes qui évoluent ensemble peuvent répondre à une troisième variable absente des deux.
Questions fréquentes
- Comment calcule-t-on la covariance ?
- Appariez les listes par position, soustrayez à chaque valeur la moyenne de sa propre liste, multipliez les deux écarts de chaque paire, additionnez ces produits, puis divisez par n − 1 pour un échantillon ou par n pour une population. Pour x = 1, 2, 3, 4, 5 et y = 2, 4, 5, 4, 5 les produits croisés totalisent 6, donc la covariance d’échantillon vaut 6 ÷ 4 = 1,5. Les deux moyennes, les deux écarts types et le résultat sont imprimés ci-dessus, de sorte que chaque étape se suive.
- Les deux listes doivent-elles avoir la même longueur ?
- Oui, et elles doivent aussi être dans le bon ordre — la première valeur d’une liste est appariée à la première valeur de l’autre, et rien n’est trié. C’est pourquoi cette page refuse un couple de listes de longueurs différentes au lieu de compléter la plus courte : avec 3 valeurs dans une liste et 2 dans l’autre, aucun moyen de savoir quelle entrée manque, et apparier silencieusement les deux premières donnerait une réponse fausse qui paraît parfaitement raisonnable. Vérifiez que les deux listes viennent des mêmes sujets dans les mêmes lignes avant de les coller.
- Que signifie le signe de la covariance ?
- Une covariance positive signifie que lorsqu’une valeur se situe au-dessus de la moyenne de sa propre liste, la valeur appariée tend à se situer au-dessus de la moyenne de l’autre liste : les deux montent et descendent ensemble. Une covariance négative signifie l’inverse — l’une au-dessus de la moyenne va de pair avec l’autre en dessous. Une valeur proche de zéro signifie qu’il n’y a pas de motif en ligne droite, ce qui n’est pas la même chose qu’une absence de relation : la liste 1, 4, 5, 4, 1 présente un U renversé parfaitement régulier et une covariance exactement nulle avec 1, 2, 3, 4, 5.
- Pourquoi le coefficient de corrélation est-il imprimé lui aussi ?
- Parce qu’une covariance ne se lit pas seule. Son unité est celle de la première liste multipliée par celle de la seconde, donc mesurer une liste en centimètres plutôt qu’en mètres la multiplie par 100 sans rien changer à la relation. La division par les deux écarts types annule ces unités et ramène la réponse entre −1 et 1, ce qui la rend comparable d’une variable à l’autre. La covariance est la quantité sur laquelle l’algèbre est construite ; r est celle à citer quand on vous demande quelle est la force de la relation.
- Pourquoi cette page a-t-elle refusé de répondre quand une de mes listes est constante ?
- Parce que le coefficient de corrélation serait divisé par zéro : si toutes les valeurs d’une liste sont identiques, l’écart type de cette liste vaut zéro, et la relation n’a pas de force définie. La covariance elle-même est parfaitement définie — elle vaut zéro — mais la page imprime les deux nombres ensemble, et annoncer une demi-réponse inviterait le lecteur à prendre un r dénué de sens pour un vrai r. Le même choix est fait ailleurs sur ce site : la page du coefficient de variation refuse de répondre quand la moyenne n’est pas positive plutôt que d’imprimer un rapport indéfini.
- Faut-il employer le diviseur d’échantillon ou celui de population ?
- Employez le réglage échantillon, n − 1, quand vos listes sont un échantillon tiré de quelque chose de plus vaste et que vous voulez décrire le groupe plus large — le cas habituel. Employez le réglage population, n, quand les listes sont le groupe entier qui vous intéresse. Le choix modifie la covariance et les deux écarts types, mais jamais le coefficient de corrélation, puisque n − 1 s’annule contre n dans ce rapport. Pour les cinq paires ci-dessus la covariance vaut 1,5 en échantillon et 1,2 en population, avec r = 0,7746 dans les deux cas.
Références
- covariance — Grand dictionnaire terminologique (somme des produits des écarts par rapport à leurs moyennes de deux ou plusieurs variables corrélées ; fiche du domaine de la statistique) — OQLF — Office québécois de la langue française
- Correlation, Variance and Covariance (Matrices) — R stats package reference (cov and cor; documents the n − 1 denominator used for the covariance and treats the correlation as the covariance scaled by the two standard deviations) — The R Project for Statistical Computing
- scipy.stats.pearsonr — SciPy reference (the Pearson coefficient's range and its interpretation as a measure of linear association) — SciPy
- The Regression Equation — Introductory Statistics 2e, section 12.3 (defines the correlation coefficient r, after Karl Pearson, as a numerical measure of the strength and direction of the linear association between two variables) — OpenStax, Rice University
- GB/T 3358.1-2009, Statistics — Vocabulary and symbols, Part 1 (the Chinese national vocabulary standard covering covariance and the correlation coefficient; the record page notes that no online full text is offered) — State Administration for Market Regulation, China