Aller au contenu principal
CalcMax

Calculatrice de valeur p

Minimum : 1

Minimum : 1

Résultat

4,9996 %

Valeur p

Une calculatrice de valeur p convertit une statistique de test en la probabilité d’observer une valeur au moins aussi extrême si l’hypothèse nulle était vraie. Elle traite les quatre statistiques qui portent l’essentiel de la statistique appliquée — z, t, khi-deux et Fisher — et n’a besoin que de la statistique, de ses degrés de liberté et d’un choix de queues. Le réglage des queues est celui que l’on se trompe le plus souvent : un test bilatéral compte les deux directions, un test unilatéral ne compte que celle qui avait été prévue. La sortie est un nombre unique, en pourcentage. Ce que la page se refuse délibérément à faire, c’est juger, parce que le seuil de signification vous appartient.

Formule

queue supérieure : p = P(T ≥ t) ; queue inférieure : p = P(T ≤ t) ; bilatéral : p = 2 · min( supérieure, inférieure ) — lois symétriques uniquement

t
La statistique de test que vous avez déjà calculée — un z issu d’un grand échantillon, un t issu d’un petit, un khi-deux issu d’effectifs comptés, ou un F issu d’un rapport de deux variances. La page ne la calcule pas ; elle la convertit
T
La loi que suivrait la statistique si l’hypothèse nulle était vraie. Laquelle est choisie par le sélecteur à quatre positions, et ce choix n’est pas une préférence : employer la loi normale là où une loi de Student convient rend toutes les valeurs p trop petites
ddl
Les degrés de liberté — une propriété de la façon dont la statistique a été calculée plutôt que des données, et exigés par les lois de Student, du khi-deux et de Fisher. Fisher en demande deux : les degrés de liberté du numérateur, qui correspondent au nombre de groupes ou de termes comparés, et ceux du dénominateur, qui viennent de la taille d’échantillon résiduelle
α
Le seuil de signification, le seuil auquel la valeur p sera comparée. Ce n’est pas une entrée de cette page parce que cela ne fait pas partie du calcul : cela relève de la décision que vous êtes sur le point de prendre, et imprimer un verdict contre une valeur par défaut de 0,05 reviendrait à choisir ce seuil à votre place
p
La probabilité de queue, rapportée en pourcentage plutôt qu’en décimal. Une valeur p de 0,05 s’affiche 5,0000, si bien que le chiffre à l’écran se compare directement à un seuil de signification cité, sans déplacer d’abord une virgule

Servez-vous-en une fois que vous avez déjà une statistique et que vous voulez la probabilité qui lui est attachée — à partir d’un exercice de manuel où la statistique est donnée, d’un logiciel qui a imprimé la statistique mais pas la valeur p, ou d’un calcul à la main que vous voulez vérifier. Le choix qui compte le plus est celui des queues, et la règle se fixe avant de voir les données et non après : prenez bilatéral quand l’une ou l’autre direction compterait comme un écart à l’hypothèse nulle, ce qui est le cas habituel, et unilatéral seulement quand un résultat en sens opposé n’aurait aucun intérêt et que vous l’avez dit d’avance. Le second choix est celui de la loi. Accordez-la à la façon dont la statistique a été construite plutôt qu’à la valeur p que vous espérez : un z appartient à une proportion ou à une moyenne de variance connue, un t à une moyenne dont la dispersion vient du même petit échantillon, un khi-deux à des effectifs comptés, et un F à une comparaison de variances. Se tromper dans cet appariement est la façon la plus fréquente pour une arithmétique juste de produire un nombre dépourvu de sens.

Exemples détaillés

  1. Un z de 1,96, le seuil bilatéral classique

    1. Queue supérieure : P(Z ≥ 1,96) = 0,025002, calculée sur la loi normale centrée réduite
    2. La courbe normale est symétrique, la queue inférieure est donc la même : P(Z ≤ −1,96) = 0,025002
    3. Bilatéral : 2 × 0,025002 = 0,050004
    4. En pourcentage : 5,0000 %, soit les 5 % que tout le monde cite

    1,96 est la valeur choisie précisément pour que ce calcul tombe sur 5 %, et voir 4,9996 au lieu d’un 5,0000 rond n’est pas une erreur — le quantile exact est 1,959964, donc 1,96 est déjà un arrondi. Les trois champs de degrés de liberté sont remplis et seuls la statistique et le réglage des queues sont lus, parce que z n’a besoin d’aucun degré de liberté : les deux champs inutilisés sont toujours à l’écran, et une valeur vide ou sans effet n’y change rien.

  2. Un t de 2,2281 à 10 degrés de liberté

    1. La loi de Student à 10 degrés de liberté a des queues plus épaisses que la courbe normale
    2. Queue supérieure : P(T ≥ 2,2281) = 0,0250015
    3. Bilatéral : 2 × 0,0250015 = 0,050003, soit 5,0003 %

    Comparez cet exemple à celui du z et l’intérêt de la loi de Student devient visible : la même aire de queue de 5 % se situe à 2,2281 plutôt qu’à 1,96, parce qu’un petit échantillon doit aller plus loin avant que la preuve soit aussi inhabituelle. Cet écart est exactement ce que la taille d’échantillon gouverne — à 1 000 degrés de liberté, la valeur critique de Student vaut 1,962 et les deux lois sont pratiquement la même courbe.

  3. Un khi-deux de 20 à trois degrés de liberté, queue supérieure seulement

    1. La loi du khi-deux n’a pas de moitié négative, seule la queue supérieure est donc disponible ici
    2. P(χ² ≥ 20) à 3 degrés de liberté = 0,00016975
    3. En pourcentage : 0,017 %

    C’est la statistique que produit la page du khi-deux à partir des effectifs 30, 10, 20 et 40 face à une attente égale. La valeur p ressort petite — 0,017 % — les quatre catégories ne sont donc pas équiprobables. Notez ce qui manque et doit être demandé séparément : cette page dit à quel point la statistique est inhabituelle, et ne dit rien du plus petit effectif théorique, qui est la vérification décidant si l’approximation du khi-deux était appropriée au départ.

Limites

Une valeur p répond à une question étroite et se lit couramment comme si elle en résolvait plusieurs autres, qu’elle ne peut pas trancher. Ce n’est pas la probabilité que l’hypothèse nulle soit vraie, ni la probabilité que le résultat soit dû au hasard, ni une mesure de l’ampleur d’un effet — une différence insignifiante devient écrasante de significativité si l’échantillon est assez grand, et une différence importante peut se situer à p = 0,20 dans un échantillon de douze. Elle ne vaut en outre que ce que vaut le modèle derrière la statistique : les quatre lois présentées ici supposent des observations indépendantes, et une statistique calculée sur des mesures en grappes ou répétées porte moins d’observations indépendantes que sa formule ne le croit, ce qui rend trop petite toute valeur p qui lui est associée. Deux garde-fous sont appliqués plutôt que laissés au lecteur. Une statistique négative est refusée pour le khi-deux et Fisher, parce que ces lois vivent sur la demi-droite positive et qu’une valeur négative signifie que la statistique a été mal calculée. Et un khi-deux ou un Fisher bilatéral est refusé, parce que ces lois sont dissymétriques et qu’il n’existe pour elles aucune convention bilatérale unique et reconnue.

Questions fréquentes

Qu’est-ce qu’une valeur p ?
La probabilité d’obtenir une statistique de test au moins aussi extrême que celle que vous avez, en supposant l’hypothèse nulle vraie et le modèle derrière la statistique correct. Elle décrit les données, pas l’hypothèse : une petite valeur p dit que le résultat observé serait inhabituel s’il ne se passait rien, ce qui n’est pas la même chose que dire qu’il se passe quelque chose. Le pas qui mène de là à une conclusion passe par un seuil de signification que vous choisissez d’avance, plus tout ce que vous savez du sujet et qui ne figure pas dans les nombres.
Faut-il une queue ou deux ?
Deux, sauf si vous en avez décidé autrement avant de voir les données et que vous pouvez dire quelle direction vous aviez prévue. Un test bilatéral compte un résultat dans l’une ou l’autre direction comme une preuve contre l’hypothèse nulle, ce qui correspond à la façon dont la plupart des questions se posent réellement : un médicament qui aggrave les choses est aussi un résultat. Le test unilatéral est légitime mais il divise la valeur p par deux, et choisir la queue après avoir regardé les données est la façon la plus répandue de fabriquer un résultat significatif à partir de rien. En cas de doute, prenez bilatéral — c’est le choix prudent et celui qu’un relecteur attendra.
À quel seuil de signification comparer la valeur p ?
À celui que vous avez fixé avant de collecter les données — par convention 0,05, mais cette convention est une habitude et non un résultat. Ce seuil n’est délibérément pas une entrée ici, et aucun verdict n’est imprimé, parce que la même valeur p de 0,04 est une découverte dans un contexte et du bruit dans un autre : cribler dix mille gènes à la recherche d’un signal, ou tester une hypothèse que dix ans de travaux antérieurs étayent, appelle des seuils très différents. La convention qui mérite d’être conservée est que le seuil soit choisi d’avance et rapporté à côté de la valeur p, plutôt qu’ajusté une fois le nombre à l’écran.
Pourquoi ne puis-je pas choisir deux queues pour le khi-deux ou Fisher ?
Parce que ces deux lois sont dissymétriques et qu’il n’existe aucune façon unique et reconnue de les rendre bilatérales. La recette habituelle — doubler la plus petite queue — se comporte mal là où cela compte le plus : pour un khi-deux exactement nul, qui correspond à un ajustement parfait entre observation et attente et donc au résultat le moins significatif possible, elle renvoie une valeur p de 0 %. Un ajustement parfait rapporté comme une significativité maximale n’est pas un artefact d’arrondi mais une réponse fausse, et elle s’afficherait d’une apparence parfaitement normale. Les deux queues n’ont pas d’ambiguïté pour une loi symétrique, où doubler l’une d’elles est exact, et pour une loi dissymétrique la seule queue supérieure répond à la question réellement posée : à quel point une statistique de cette taille est-elle surprenante ?
Pourquoi la page refuse-t-elle une statistique de khi-deux ou de Fisher négative ?
Parce qu’aucune des deux statistiques ne peut être négative, une valeur négative signifie donc que le nombre vient d’ailleurs que du test auquel il est attribué. Les deux sont construites à partir de quantités au carré — un khi-deux à partir des écarts au carré entre effectifs, un F à partir d’un rapport de deux variances — et une quantité au carré n’est jamais inférieure à zéro. La page pourrait renvoyer 100 %, ce serait arithmétiquement cohérent, mais elle accepterait aussi une entrée mal calculée en la présentant comme un vrai résultat. Refuser ne coûte rien ici, puisqu’il n’existe aucun khi-deux négatif légitime que ce refus bloquerait.
Pourquoi n’y a-t-il pas de table de valeurs critiques sur cette page ?
Parce qu’une table de valeurs p devrait être indexée par la statistique de test, et que celle-ci peut être n’importe quel nombre : une telle table demanderait une infinité de lignes. Les tables imprimées à la fin des manuels vont dans l’autre sens : quelques lignes pour les seuils de signification conventionnels et des colonnes pour les degrés de liberté dont vous pourriez avoir besoin, ce qui tient sur une page uniquement parce que les seuils sont peu nombreux et convenus d’avance. Cette page évalue l’aire de queue exactement à la statistique que vous avez saisie, ce qu’une table ne peut pas faire — une table peut seulement vous dire si votre statistique tombe au-dessus ou en dessous des valeurs qu’elle liste par hasard. La table la plus proche de cet ensemble se trouve sur la page des valeurs critiques, où les lignes sont les seuils de signification et les colonnes donnent le z correspondant. Les deux pages sont le même fait lu par les deux bouts, et c’est pourquoi chacune renvoie à l’autre en premier parmi ses outils liés.

Références

Calculatrices liées