Calculatrice de khi-deux
Résultat
Statistique du khi-deux
- Valeur p
- 0,0170 %
- Degrés de liberté
- 3
- Plus petit effectif attendu
- 25,0000
Une calculatrice de khi-deux compare des effectifs comptés par catégorie aux effectifs que vous attendiez, puis renvoie la statistique, ses degrés de liberté et la valeur p qui l’accompagne. C’est le test derrière toute question de la forme ces groupes sont-ils de même taille : un dé est-il équilibré, quatre options ont-elles été choisies aussi souvent les unes que les autres, l’effectif observé de chaque catégorie correspond-il à l’effectif théorique que vous aviez une raison de prévoir. Laissez les effectifs théoriques vides et la page suppose que chaque catégorie est équiprobable, ce qui est à la fois le cas le plus fréquent et celui qui ne demande aucun calcul préalable. Le plus petit effectif théorique est imprimé à côté, parce que c’est le nombre auquel se vérifient les conditions d’emploi du test.
Formule
χ² = Σ ( O − E )² / E ; ddl = k − 1 ; p = P( χ² ≥ χ²₀ )
- O
- L’effectif observé de chaque catégorie — un comptage et non une mesure, les nombres sont donc entiers et leur somme est la taille de l’échantillon. Un effectif nul est autorisé : cela veut dire que la catégorie ne s’est jamais présentée, ce qui est un résultat et non une erreur
- E
- L’effectif théorique de chaque catégorie, c’est-à-dire ce que prédit l’hypothèse nulle et non ce que vous espérez voir. Laissé vide, il devient le total divisé par le nombre de catégories, et le test demande alors si les catégories sont équiprobables
- k
- Le nombre de catégories, lu sur la longueur de la liste que vous avez saisie. Il fixe les degrés de liberté et c’est aussi par lui que se divise le total quand les effectifs théoriques sont laissés vides, si bien qu’une seule liste d’effectifs détermine les deux
- ddl
- Les degrés de liberté, qui valent k − 1 et non k. La soustraction est la partie que l’on oublie : une fois le total et tous les effectifs sauf un fixés, le dernier est déterminé, les catégories portent donc une information de moins qu’il n’y en a
- χ²₀
- La statistique calculée par cette page, réinjectée dans sa propre loi sous l’hypothèse nulle pour obtenir l’aire de queue. C’est la même opération que lire une valeur sur une courbe normale, avec la courbe du khi-deux à la place de la normale — et c’est pourquoi la valeur p a besoin des degrés de liberté autant que de la statistique
Servez-vous de cette page quand les données sont un ensemble d’effectifs répartis en catégories et que la question est de savoir si ces effectifs sont compatibles avec une prédiction. C’est le comptage qui distingue ce test de ceux portant sur une moyenne ou sur une proportion : les observations ne sont pas mesurées sur une échelle, et ce qui compte est combien sont tombées dans chaque case plutôt que la grandeur de l’une d’elles. La prédiction peut être un partage égal, ou un jeu d’effectifs théoriques construit à partir de données antérieures — un taux national appliqué à une population locale, un rapport mendélien, la sortie d’un modèle. Le test ne vaut que ce que valent ces attentes : il compare ce que vous avez compté à ce que vous avez énoncé, et il ne remarquera pas que l’attente elle-même était fausse. Deux conditions méritent d’être vérifiées avant de se fier à la valeur p, et la page imprime la première, puisque le plus petit effectif théorique est précisément le nombre dont parle la règle empirique habituelle.
Exemples détaillés
Quatre catégories comptées inégalement, effectifs théoriques laissés vides
- Le total est 100, et l’attente vide répartit les 4 catégories à 100 / 4 = 25 chacune
- Écarts au carré par rapport à 25 : (30 − 25)² = 25, (10 − 25)² = 225, (20 − 25)² = 25, (40 − 25)² = 225
- Divisez chacun par son effectif théorique 25 et additionnez : 1 + 9 + 1 + 9 = 20
- Degrés de liberté : k − 1 = 3, et l’aire de queue au-delà de 20 vaut 0,017 %
C’est le cas par défaut de la page, et il a été choisi visiblement inégal : 40 et 10 face à une attente de 25 chacun. La valeur p tombe à 0,017 %, les effectifs sont donc très loin de ce que produirait un partage égal, et le plus petit effectif théorique de 25 dépasse confortablement tous les seuils d’usage — l’approximation derrière la valeur p est donc solide ici. À noter que les effectifs théoriques n’ont jamais eu à être saisis. Laisser le champ vide est la façon d’exprimer un partage égal, et c’est la raison pour laquelle ce champ est facultatif.
Trois catégories face à des effectifs théoriques tirés d’une enquête antérieure
- Les deux listes totalisent 100, l’attente est donc cohérente avec les effectifs et le test peut se faire
- Écarts au carré : (50 − 60)² = 100, (30 − 30)² = 0, (20 − 10)² = 100
- Divisez par chaque effectif théorique et additionnez : 100/60 + 0/30 + 100/10 = 1,6667 + 0 + 10 = 11,6667
- Degrés de liberté : 3 − 1 = 2, et l’aire de queue au-delà de 11,6667 vaut 0,2928 %
Les deux listes doivent décrire le même nombre d’observations, et ici elles valent toutes deux 100 — c’est ce qui fait de la seconde une hypothèse sur la première plutôt qu’une autre expérience. Lire les termes un par un est instructif : la catégorie du milieu est tombée exactement sur son attente et n’a rien apporté, tandis que la troisième a fourni dix des onze points et demi de la statistique alors qu’elle est la plus petite, parce qu’elle a manqué son attente de 100 %. Le plus petit effectif théorique de 10 reste au-dessus du niveau habituellement exigé.
Une pièce lancée 20 fois, testée contre un partage égal
- Effectifs théoriques : 20 lancers répartis également entre deux issues donnent 10 et 10
- Écarts au carré : (12 − 10)² = 4 et (8 − 10)² = 4
- Divisez et additionnez : 4/10 + 4/10 = 0,8
- Degrés de liberté : 2 − 1 = 1, et l’aire de queue au-delà de 0,8 vaut 37,1093 %
12 faces sur 20 ressemble à une pièce biaisée jusqu’à ce qu’on lise la probabilité de queue : 37 % des pièces équilibrées produisent un écart au moins aussi grand, le résultat est donc banal. C’est la même arithmétique que le premier exemple, faite sur le plus petit tableau utile, et cela montre pourquoi la statistique ne se lit jamais seule — 0,8 et 20 ne sont pas des nombres comparables, et seule la valeur p les met sur une même échelle. Le cas à deux catégories a en outre un raccourci qui vaut la peine d’être connu : la statistique du khi-deux est égale au carré du z qu’utiliserait un test de comparaison de deux proportions.
Limites
La valeur p repose sur une approximation qui exige des effectifs théoriques suffisamment grands, et le plus petit effectif théorique imprimé est le nombre auquel le vérifier — les manuels ne s’accordent pas sur l’emplacement de la limite, « au moins 5 dans chaque catégorie » et « au moins 1 partout plus 5 dans la plupart » étant tous deux largement utilisés. Quand les attentes sont trop petites, l’approximation échoue en silence et renvoie une valeur p d’apparence ordinaire. Les effectifs sont également supposés indépendants, ce qui tombe en défaut pour des mesures appariées ou répétées et pour un échantillonnage par grappes, deux situations qui gonflent la statistique. Les attentes elles-mêmes sont prises telles quelles, si bien qu’un test contre une prédiction fausse répond à une autre question que celle posée. Enfin, une petite valeur p dit que les effectifs sont incompatibles avec l’attente, pas pourquoi : elle ne dit pas quelle catégorie en est responsable, et lorsqu’il y a plusieurs catégories, les écarts qui portent la statistique méritent d’être examinés séparément.
Questions fréquentes
- Que m’apprend au juste le test du khi-deux ?
- Si les effectifs que vous avez observés sont compatibles avec les effectifs que vous attendiez, compte tenu du nombre d’observations. La statistique croît avec la somme des écarts au carré entre observation et attente, rapportés à la taille de chaque attente, si bien qu’un même écart relatif pèse davantage quand les effectifs théoriques sont petits. La valeur p dit ensuite à quelle fréquence un monde conforme à l’hypothèse produirait un écart au moins aussi grand. C’est un test du tableau entier et non d’une catégorie particulière, et les deux se confondent facilement lorsqu’une catégorie est visiblement l’intruse.
- Que se passe-t-il si je laisse les effectifs théoriques vides ?
- La page suppose que chaque catégorie est équiprobable et calcule l’effectif théorique comme le total divisé par le nombre de catégories. C’est l’usage le plus fréquent du test — un dé, une roue, quatre boutons qui devraient recevoir un trafic égal — et cela évite de saisir une liste dont les valeurs sont de toute façon toutes les mêmes. C’est aussi la seule lecture possible quand aucune donnée antérieure ne permet de prévoir la répartition. Saisissez les effectifs théoriques dès que vous avez une vraie prédiction à tester, comme la répartition de l’an dernier ou un rapport théorique, parce qu’un test contre un partage égal et un test contre un modèle précis répondent à des questions différentes, et que le second seul exploite l’information dont vous disposez déjà.
- Pourquoi les deux listes doivent-elles totaliser le même nombre ?
- Parce que les effectifs théoriques d’un test d’adéquation se déduisent du nombre total d’observations au lieu d’être choisis librement — ils décrivent la façon dont ces mêmes observations se répartiraient si l’hypothèse était vraie. Deux listes de totaux différents décrivent deux expériences différentes, et la statistique calculée à partir d’elles ne teste rien. Quand chaque effectif théorique est écrit sous forme d’entier, chacun peut s’écarter d’une demi-unité sans que l’intention change, la page tolère donc 0,5 par catégorie : 20,5, 20,5 et 20,5 face à un total de 60 est accepté, puisqu’il s’agit de valeurs arrondies d’un partage exact à 20 chacun.
- Une catégorie peut-elle avoir un effectif nul ?
- Oui pour un effectif observé, non pour un effectif théorique, et cette asymétrie découle directement de la formule. Un zéro observé est un résultat ordinaire — une catégorie qui ne s’est jamais présentée — et l’écart au carré devient simplement grand, ce qui est le comportement attendu. Un zéro théorique ne peut pas servir parce qu’il est le diviseur et que le terme serait infini : la prédiction qu’une catégorie ne peut jamais se produire n’est pas une prédiction que ce test peut mettre en balance avec un effectif. Si une attente réelle est très petite plutôt que nulle, le test l’accepte, et le plus petit effectif théorique imprimé sous le résultat indique si cela pose problème.
- Où se trouve la table des valeurs critiques du khi-deux ?
- Pas sur cette page, pour la même raison que sur la page de la valeur p : la valeur qui compte est déjà imprimée, puisque la statistique et ses degrés de liberté déterminent directement l’aire de queue. Une table devrait en outre être construite pour un seuil de signification donné, si bien qu’un lecteur travaillant à 1 % lirait une table contredisant le panneau. L’outil de valeur critique est l’endroit prévu pour cette lecture, et il y a une raison supplémentaire pour laquelle cette page ne peut pas montrer de table, même en principe : ses degrés de liberté valent k − 1, où k est le nombre de catégories saisies, si bien que la ligne de table applicable n’est connue qu’une fois les effectifs saisis.
Références
- 1.3.6.1. What is a Probability Distribution — e-Handbook of Statistical Methods (a test statistic as a quantity with its own distribution under the null hypothesis, which is what makes the tail area computable) — National Institute of Standards and Technology (NIST)
- 3.1 Terminology — Introductory Statistics 2e (relative frequency as an estimate of a probability, which is the step that turns a category's probability into an expected count of observations) — OpenStax (Rice University)
- 1.3.6.7.1. Cumulative Distribution Function of the Standard Normal Distribution — e-Handbook of Statistical Methods (the same reading of a tail area off a cumulative curve that this page performs with the chi-square curve instead) — National Institute of Standards and Technology (NIST)