Aller au contenu principal
CalcMax

Calculatrice de test t

Minimum : 0

Minimum : 2

Minimum : 0

Minimum : 2

Résultat

1,0000

Statistique t

Valeur p
34,6594 %
Degrés de liberté
8
Erreur type
1,0000

Une calculatrice de test t exécute le plus courant des tests portant sur une moyenne : elle transforme une moyenne d’échantillon, un écart type et une taille d’échantillon en une statistique t, une valeur p et les degrés de liberté auxquels les deux se lisent. Le mode un échantillon compare une moyenne à une valeur fixe — une cible, une spécification, une moyenne historique. Le mode deux échantillons compare deux groupes l’un à l’autre, et la version implémentée ici est le test t à deux échantillons à variances égales, qui suppose que les deux groupes partagent une variance : les deux écarts types sont moyennés avec des poids de n − 1, et cette variance commune unique pilote l’erreur type. L’alternative, le test de Welch, abandonne l’hypothèse d’égalité des variances et constitue la valeur par défaut plus sûre quand les groupes diffèrent en taille et en dispersion, mais ses degrés de liberté ressortent fractionnaires et c’est un autre calcul, à un autre endroit du code ; cette page fait le test à variances égales et le dit plutôt que de l’approximer en silence. La valeur p est l’aire de queue de la loi de Student au-delà de la statistique, et elle est imprimée en pourcentage.

Formule

t = (x̄ − μ₀) / (s / √n) t = (x̄₁ − x̄₂) / √(s_p²(1/n₁ + 1/n₂)) s_p² = ((n₁−1)s₁² + (n₂−1)s₂²) / (n₁ + n₂ − 2)

t
La statistique de test — de combien d’erreurs types la moyenne observée se situe de la valeur testée. Son signe porte la direction, ce qui explique qu’un test unilatéral dans le mauvais sens renvoie une grande valeur p plutôt qu’une erreur : un t de −1 face à une alternative supérieure n’est pas un petit effet, c’est une indication qui pointe dans l’autre sens, et l’aire de queue le dit
x̄, μ₀
La moyenne de l’échantillon et la valeur à laquelle elle est comparée, dans le mode un échantillon. Le numérateur est leur différence, la statistique mesure donc une distance dans l’unité des données — la même différence compte beaucoup moins si la dispersion est large ou l’échantillon petit, et c’est ce que fournit le dénominateur
s
L’écart type de l’échantillon, estimé à partir des données plutôt que connu d’avance. C’est cette estimation qui justifie à elle seule l’emploi de la loi de Student au lieu de la loi normale : l’incertitude supplémentaire qu’elle introduit alourdit les queues, et ce sont ces queues plus lourdes que la valeur critique de Student prend en compte. Il doit être strictement supérieur à zéro — un échantillon sans aucune variation n’a pas de dénominateur par lequel diviser
n
La taille d’échantillon, qui donne n − 1 degrés de liberté dans le mode un échantillon. Pour le test à deux échantillons, les deux tailles s’additionnent pour donner un de plus que chacune prise seule : n₁ + n₂ − 2, parce que la variance commune dépense un degré de liberté sur la moyenne de chaque groupe avant de mesurer la dispersion autour d’elle
s_p²
La variance commune — la moyenne pondérée des variances des deux groupes, chacune pondérée par ses propres degrés de liberté. C’est ici que l’hypothèse d’égalité des variances entre en jeu : les deux groupes sont traités comme deux échantillons d’une dispersion de population unique, si bien qu’un groupe comptant plus d’observations, ou dont la variance propre est plus petite, contribue proportionnellement à une estimation partagée unique. Si les deux variances diffèrent sensiblement, c’est la mise en commun qui se trompe, et le test de Welch est la réparation
valeur p
La probabilité d’une statistique au moins aussi éloignée de zéro, dans la direction sur laquelle porte le test, si les deux moyennes étaient réellement égales. Deux queues doublent l’aire au-delà de |t| ; les alternatives supérieure et inférieure prennent une queue chacune. Elle est rapportée ici en pourcentage, si bien que 5 % est le fameux 0,05, et c’est un énoncé sur les données étant donné l’hypothèse plutôt que sur l’hypothèse étant donné les données

Servez-vous-en quand vous disposez d’une moyenne et d’un écart type issus d’un échantillon et que vous voulez savoir si l’écart à une cible, ou à un autre groupe, dépasse ce que le bruit d’échantillonnage expliquerait. Le mode un échantillon traite le cas où la valeur de comparaison est un nombre fixe — une machine réglée pour remplir 500 grammes, une spécification de 5 mm, la moyenne de l’an dernier — et le mode deux échantillons traite le cas où les deux grandeurs ont été mesurées et où aucune n’est privilégiée. Deux choses méritent d’être décidées avant de lire la réponse. La première est une queue ou deux : un test bilatéral demande si les groupes diffèrent dans un sens ou dans l’autre et constitue la valeur par défaut correcte, tandis qu’un test unilatéral pose une question directionnelle et doit être choisi parce que la direction a été spécifiée d’avance, non parce que la réponse serait plus favorable. La seconde est l’hypothèse d’égalité des variances, que le mode deux échantillons fait et ne peut pas vérifier à votre place. L’indice est sur le panneau : si les deux écarts types que vous avez saisis sont proches, les mettre en commun coûte peu, et s’ils diffèrent d’un facteur deux ou plus, c’est le test de Welch qu’il vous faut. Cette page calcule le test à variances égales, qui est ce que la plupart des manuels et la plupart des statisticiens entendent par le test t dans le cas d’égalité des variances, et elle rapporte les deux écarts types que vous avez fournis pour que l’hypothèse puisse être jugée plutôt que supposée.

Exemples détaillés

  1. Le cas par défaut : une moyenne de 6 face à une cible de 5

    1. Erreur type : s / √n = 3 / 3 = 1
    2. Statistique t : (6 − 5) / 1 = 1 — la moyenne de l’échantillon se situe une erreur type au-dessus de la cible
    3. Degrés de liberté : n − 1 = 8
    4. Valeur p bilatérale : l’aire au-delà de ±1 sur une loi de Student à 8 degrés de liberté, soit 34,66 %

    Une différence d’une unité entière paraît importante jusqu’à ce que l’erreur type soit posée à côté : une erreur type reste bien dans la fourchette que produit le bruit d’échantillonnage, et la valeur p le dit. La comparaison avec la courbe normale est instructive — le même t de 1 donnerait 31,7 % si la loi était normale, et les trois points supplémentaires sont le prix d’avoir estimé l’écart type à partir de neuf observations au lieu de le connaître.

  2. Une statistique t de 2,306 donne exactement 5 %

    1. Erreur type : 3 / √9 = 1, la statistique t est donc la moyenne elle-même
    2. Statistique t : (2,306 − 0) / 1 = 2,306
    3. La borne t bilatérale à 95 % à 8 degrés de liberté vaut 2,306
    4. Se trouver exactement sur la borne signifie que la valeur p bilatérale vaut exactement 5 %

    C’est le couple que la page des valeurs critiques produit dans l’autre sens, et les mettre côte à côte est la démonstration la plus claire qu’il s’agit d’un seul fait lu par les deux bouts. Demandez à cette page une borne t bilatérale à 95 % avec 8 degrés de liberté et elle renvoie 2,306 ; introduisez 2,306 ici et la valeur p revient à exactement 5 %. Rien entre les deux n’est arrondi — le nombre a été choisi parce que l’écart type de 3 et la taille d’échantillon de 9 rendent l’erreur type exactement égale à 1, si bien que la statistique et la borne sont le même chiffre. Une statistique juste en dessous passerait au-dessus de 5 %, et une juste au-dessus passerait en dessous.

  3. Deux groupes de dix de même dispersion

    1. Variance commune : ((9 × 4) + (9 × 4)) / 18 = 72 / 18 = 4, l’écart type commun vaut donc 2
    2. Erreur type : √(4 × (1/10 + 1/10)) = √0,8 = 0,8944
    3. Statistique t : (5 − 4) / 0,8944 = 1,118
    4. Degrés de liberté : 10 + 10 − 2 = 18, soit une valeur p bilatérale de 27,83 %

    Quand les deux variances sont égales, la mise en commun ne change rien — la variance commune ressort à 4, exactement la valeur qu’ont fournie les deux groupes — et l’erreur type est plus petite que l’écart type de chaque groupe divisé par son propre √n. Comparer deux moyennes de dix est moins précis qu’estimer une moyenne unique de dix — une erreur type de 0,8944 contre 0,6325 — parce que deux grandeurs incertaines sont soustraites au lieu d’une seule étant mesurée, et ce coût ne vaut la peine que lorsque la comparaison répond à une question qu’un échantillon unique ne peut pas trancher. À noter que le champ de la moyenne de la population est à l’écran et inutilisé dans ce mode : les deux grandeurs sont mesurées, aucune n’est la cible fixe.

  4. Dispersions inégales et tailles inégales, là où la mise en commun doit être surveillée

    1. Variance commune : ((9 × 4,41) + (11 × 3,24)) / 20 = (39,69 + 35,64) / 20 = 3,7665
    2. Erreur type : √(3,7665 × (1/10 + 1/12)) = √0,6905 = 0,831
    3. Statistique t : (5,2 − 4,1) / 0,831 = 1,3237
    4. Degrés de liberté : 10 + 12 − 2 = 20

    La variance commune vaut 3,7665, qui n’est pas le milieu de 4,41 et 3,24 — le groupe de douze pèse davantage parce qu’il apporte onze degrés de liberté contre neuf au groupe de dix. Cette pondération est tout le contenu du mot commun, et c’est pourquoi la réponse ne peut pas être reproduite en faisant la moyenne des deux écarts types. Les deux dispersions sont ici assez proches pour que l’hypothèse d’égalité des variances soit confortable ; un couple comme 2,1 et 0,6 avec ces tailles de groupe ne le serait pas, et le test de Welch donnerait une valeur p visiblement différente.

  5. Un t de 1,96 sur 900 observations, là où Student et la loi normale ont convergé

    1. Erreur type : 3 / √900 = 3 / 30 = 0,1
    2. Statistique t : (5,196 − 5) / 0,1 = 1,96
    3. Degrés de liberté : 899
    4. Valeur p bilatérale : 5,0304 % — juste au-dessus de 5, pas exactement dessus

    Le fameux 1,96 donne 5 % sur la courbe normale et 5,0304 % ici, et l’écart est tout l’intérêt de l’exemple. Avec 899 degrés de liberté, la loi de Student est presque indiscernable de la loi normale, mais pas exactement — ses queues restent légèrement plus lourdes, la même statistique se situe donc un peu plus loin. C’est aussi pourquoi un t de 1,96 n’est pas automatiquement significatif à 5 % dans un grand échantillon, et pourquoi un logiciel qui affiche 0,0499 et un logiciel qui affiche 0,0501 peuvent être en désaccord sur la même étude à la troisième décimale.

Limites

Le mode deux échantillons suppose que les deux groupes partagent une variance, et cette hypothèse travaille réellement plutôt qu’elle ne range la notation. Quand les tailles de groupe sont égales, le test à variances communes reste assez robuste même si les variances diffèrent, mais quand les tailles sont inégales et que les variances diffèrent aussi, le test peut se tromper sérieusement dans un sens comme dans l’autre — c’est le problème de Behrens–Fisher, et le test de Welch existe pour le résoudre. Les deux écarts types sont sur le panneau pour cette raison : comparez-les avant de vous fier à la valeur p, et si l’un vaut plus du double de l’autre alors que les tailles de groupe diffèrent, le test à variances égales n’est pas celui qu’il vous faut. Le mode un échantillon n’a pas ce problème mais suppose que les observations sont indépendantes, ce qui tombe en défaut pour des mesures répétées sur un même sujet et pour des données appariées ou en grappes, où il faut un modèle apparié ou mixte. Les deux modes supposent que les données sous-jacentes sont à peu près normales, et tous deux deviennent moins sensibles à cette hypothèse à mesure que l’échantillon grandit — le théorème central limite est ce qui rend raisonnable un test t sur 900 observations asymétriques et douteux un test t sur 9 observations asymétriques. Enfin, la page rapporte une statistique et une valeur p, et aucune conclusion. Elle n’a pas de seuil de signification auquel comparer, et le nombre 0,05 est une convention plutôt qu’un résultat, la décision est donc laissée là où elle appartient.

Questions fréquentes

Cette page utilise-t-elle le test t à variances communes ou celui de Welch ?
Celui à variances communes — le test à variances égales, avec n₁ + n₂ − 2 degrés de liberté. Le test de Welch est le meilleur choix quand les deux groupes diffèrent en dispersion et en taille, et les deux champs d’écart type sont sur le panneau pour que vous puissiez vérifier : si l’un vaut plus d’environ le double de l’autre et que les tailles d’échantillon diffèrent, c’est Welch qu’il vous faut et cette page donnera une valeur p fausse, parfois sensiblement. La version à variances égales est implémentée ici parce que c’est le test des manuels, parce que c’est ce qu’un manuel de référence appelle le test t à deux échantillons pour des moyennes égales, et parce que ses degrés de liberté entiers gardent l’arithmétique de cette page exacte plutôt qu’approchée.
Faut-il un test unilatéral ou bilatéral ?
Bilatéral, sauf si la direction a été spécifiée avant de voir les données. Un test bilatéral demande si les groupes diffèrent tout court et partage le seuil de signification entre les deux extrémités ; un test unilatéral demande si un groupe est plus grand et met tout le seuil dans cette queue, ce qui rend la significativité plus facile à atteindre — exactement deux fois plus facile au même seuil, puisque 1,96 devient 1,645. C’est un choix légitime quand la question est réellement directionnelle, et c’est une forme de recherche de résultat quand la direction a été choisie après avoir vu dans quel sens allait la différence.
Quelle différence entre la statistique t et la valeur p ?
La statistique t mesure la différence en erreurs types et porte la taille d’échantillon en elle, tandis que la valeur p convertit ce chiffre en probabilité à l’aide de la loi de Student aux degrés de liberté correspondants. Le t répond donc à « de combien d’erreurs types ces valeurs sont-elles éloignées ? » et la valeur p à « à quelle fréquence le seul échantillonnage produirait-il un écart de cette taille ? » Les deux sont rapportés parce que le premier est comparable d’une étude à l’autre à plan égal et que la seconde est ce à quoi un seuil de signification se compare. Ni l’un ni l’autre n’est la taille de l’effet — un grand échantillon peut faire produire à une différence insignifiante un grand t et une valeur p minuscule.
Pourquoi une statistique t de 1,96 ne donne-t-elle pas exactement 5 % ?
Parce que 1,96 est la borne des 5 % de la courbe normale, et que la loi de Student a les queues légèrement plus lourdes à tout nombre fini de degrés de liberté. Avec 899 degrés de liberté, un t de 1,96 donne 5,0304 %, juste au-dessus de la ligne ; à 8 degrés de liberté, la même statistique donne 8,57 %. La loi de Student converge vers la loi normale à mesure que les degrés de liberté augmentent, et c’est la même courbe tout du long — seul le poids des queues change. C’est pourquoi un logiciel peut annoncer une valeur p de 0,0499 là où un calcul manuel contre 1,96 conclut à la significativité, et aucun des deux n’a tort.
Que signifie une statistique t négative ?
Que la moyenne de l’échantillon est ressortie en dessous de la valeur à laquelle elle est comparée, ou en dessous de la moyenne du second groupe dans le mode deux échantillons. Le signe est une information de direction et rien de plus — c’est sa taille relative à la loi qui sert à calculer la valeur p. Dans un test bilatéral le signe est écarté parce que l’une ou l’autre extrémité compte. Dans un test unilatéral il compte et peut être instructif : un t de −2,5 face à une alternative supérieure donne une valeur p proche de 99 %, ce qui n’est pas un résultat nul mais une indication qui pointe dans l’autre sens, et le rapporter comme non significatif reviendrait à jeter cette information.
De combien d’observations ai-je besoin pour un test t ?
La page en exige au moins deux par groupe, parce que l’écart type d’une seule observation n’est pas défini. C’est un plancher mathématique plutôt qu’une recommandation pratique — un test t sur deux observations par groupe a un degré de liberté et presque aucune puissance pour détecter autre chose qu’une différence énorme, et la valeur p sera grande à moins que les deux groupes ne se recouvrent à peine. La question utile n’est pas le minimum que la formule autorise mais la taille d’échantillon nécessaire pour détecter la différence qui vous intéresse, laquelle dépend de la dispersion des données et de la taille d’effet que vous voudriez remarquer ; c’est sur la page de la taille d’échantillon que vit ce calcul, et elle part d’une marge d’erreur pour remonter au lieu de partir d’un jeu de données.
Où se trouve la table des valeurs critiques de Student ?
Sur la page des valeurs critiques, et là seulement dans cet ensemble — cette page n’en imprime pas parce qu’une telle table devrait être indexée par les degrés de liberté autant que par le seuil de signification, ce qui fait une page de manuel par seuil plutôt qu’une table. C’est aussi pourquoi la réponse est calculée ici plutôt que consultée : une table ne peut lister que les degrés de liberté que quelqu’un a choisi d’imprimer, et les degrés de liberté que produit un test à deux échantillons, n₁ + n₂ − 2, n’en font presque jamais partie. La seule borne qui vaut la peine d’être retenue de tête est que les valeurs de Student convergent vers 1,96 à mesure que l’échantillon grandit, si bien que la table que vous cherchez est la table normale assortie d’une pénalité qui diminue quand les degrés de liberté augmentent.

Références

Calculatrices liées