Calculadora de valor p
Resultado
Valor p
Una calculadora de valor p convierte un estadístico de contraste en la probabilidad de ver un valor al menos tan extremo si la hipótesis nula fuera cierta. Cubre los cuatro estadísticos que cargan con casi toda la estadística aplicada (z, t, chi cuadrado y F) y solo necesita el estadístico, sus grados de libertad y una elección de colas. El ajuste de colas es el que más se equivoca: una prueba de dos colas cuenta las dos direcciones y una de una sola cola cuenta únicamente la que se había predicho. La salida es un solo número, en porcentaje. Lo que la página no hace a propósito es juzgar, porque el nivel de significación lo pones tú.
Fórmula
cola superior: p = P(T ≥ t) cola inferior: p = P(T ≤ t) dos colas: p = 2 · min( superior, inferior ) — solo distribuciones simétricas
- t
- El estadístico de contraste que ya has calculado: una z de una muestra grande, una t de una pequeña, un chi cuadrado de categorías contadas o una F de un cociente de dos varianzas. La página no lo calcula, lo convierte
- T
- La distribución que seguiría el estadístico si la hipótesis nula fuera cierta. Cuál de las cuatro es lo decide el selector de arriba, y la elección no es una preferencia: usar la distribución normal donde corresponde una t hace que todos los valores p salgan demasiado pequeños
- df
- Los grados de libertad, que son una propiedad de cómo se calculó el estadístico y no de los datos, y que necesitan la t, el chi cuadrado y la F. La F necesita dos: los del numerador, que es el número de grupos o de términos que se comparan, y los del denominador, que salen del tamaño de muestra que queda tras ajustar
- α
- El nivel de significación, el umbral con el que se comparará el valor p. No es una entrada de esta página porque no forma parte del cálculo: pertenece a la decisión que estás a punto de tomar, e imprimir un veredicto contra un 0,05 por defecto sería elegir ese umbral en tu lugar
- p
- La probabilidad de la cola, expresada en porcentaje y no en forma decimal. Un valor p de 0,05 se muestra como 5,0000, así que la cifra de la pantalla se puede comparar directamente con un nivel de significación citado, sin mover antes la coma
Úsala cuando ya tengas un estadístico y quieras la probabilidad que lleva asociada: un ejercicio de libro en el que el estadístico viene dado, un programa que imprimió el estadístico pero no el valor p, o un cálculo a mano que quieres comprobar. La elección que más importa es la de las colas, y la regla se fija antes de ver los datos y no después: elige dos colas cuando cualquiera de las dos direcciones contaría como una desviación de la hipótesis nula, que es lo habitual, y una sola cola únicamente cuando un resultado en la dirección contraria no tendría ningún interés y lo dijiste de antemano. La segunda elección es la distribución. Emparéjala con cómo se construyó el estadístico y no con el valor p que esperas obtener: una z corresponde a una proporción o a una media con varianza conocida, una t a una media cuya dispersión salió de esa misma muestra pequeña, una prueba de chi cuadrado a categorías contadas y una F a una comparación de varianzas. Equivocar ese emparejamiento es la manera más común de que una aritmética correcta produzca un número sin sentido.
Ejemplos resueltos
Una z de 1,96, el umbral clásico de dos colas
- Cola superior: P(Z ≥ 1,96) = 0,025002, leída de la distribución normal estándar
- La curva normal es simétrica, así que la cola inferior vale lo mismo: P(Z ≤ −1,96) = 0,025002
- Dos colas: 2 × 0,025002 = 0,050004
- En porcentaje: 5,0000 %, que es el 5 % que todo el mundo cita
El 1,96 es el valor elegido precisamente para que esto salga en el 5 %, y ver 4,9996 en lugar de un 5,0000 redondo no es un error: el cuantil verdadero es 1,959964, así que el propio 1,96 ya es un redondeo. Los tres campos de grados de libertad están rellenos y solo se leen el estadístico y la elección de colas, porque la z no necesita ninguno de los dos: los campos que no se usan siguen en pantalla, y un valor en ellos cambia el resultado tanto como no escribirlo.
Una t de 2,2281 con 10 grados de libertad
- La distribución t con 10 grados de libertad tiene colas más pesadas que la curva normal
- Cola superior: P(T ≥ 2,2281) = 0,0250015
- Dos colas: 2 × 0,0250015 = 0,050003, es decir, 5,0003 %
Comparar esto con el ejemplo de la z deja a la vista para qué sirve la distribución t: la misma área de cola del 5 % está en 2,2281 y no en 1,96, porque una muestra pequeña tiene que alejarse más para que la evidencia sea igual de insólita. Esa distancia es exactamente lo que gobierna el tamaño de la muestra: con 1000 grados de libertad el valor crítico de la t es 1,962 y las dos distribuciones son en la práctica la misma curva.
Un chi cuadrado de 20 con tres grados de libertad, solo la cola superior
- La distribución chi cuadrado no tiene mitad negativa, así que aquí solo está disponible la cola superior
- P(χ² ≥ 20) con 3 grados de libertad = 0,00016975
- En porcentaje: 0,017 %
Este es el estadístico que produce la página del chi cuadrado a partir de los recuentos 30, 10, 20 y 40 frente a una expectativa uniforme. El valor p salió pequeño, 0,017 %, así que las cuatro categorías no son igual de probables. Fíjate en lo que falta y hay que pedir aparte: esta página dice cuán insólito es el estadístico y no dice nada sobre la frecuencia esperada más pequeña, que es la comprobación que decide si la aproximación del chi cuadrado era adecuada de entrada.
Limitaciones
Un valor p responde a una pregunta muy concreta y se lee habitualmente como si respondiera a varias que no puede. No es la probabilidad de que la hipótesis nula sea cierta, ni la probabilidad de que el resultado haya salido por azar, ni una medida de lo grande que es un efecto: una diferencia trivial se vuelve abrumadoramente significativa si la muestra es lo bastante grande, y una importante puede quedarse en un valor p de 0,20 con doce observaciones. Además vale lo que valga el modelo que sostiene el estadístico: las cuatro distribuciones de aquí suponen observaciones independientes, y un estadístico calculado sobre mediciones agrupadas o repetidas lleva menos observaciones independientes de las que cree su fórmula, lo que hace que todos los valores p que se le asocien salgan demasiado pequeños. Hay dos guardas que se aplican en lugar de dejarlas al lector. Se rechaza un estadístico negativo en el chi cuadrado y en la F, porque esas distribuciones viven en la mitad positiva y un valor negativo significa que el estadístico se calculó mal. Y se rechaza un chi cuadrado o una F de dos colas, porque esas distribuciones son asimétricas y no hay una convención bilateral única aceptada para ellas.
Preguntas frecuentes
- ¿Qué es un valor p?
- La probabilidad de obtener un estadístico de contraste al menos tan extremo como el que tienes, suponiendo que la hipótesis nula es cierta y que el modelo que sostiene el estadístico es el correcto. Describe los datos y no la hipótesis: un valor p pequeño dice que el resultado observado sería insólito si no estuviera pasando nada, lo cual no es lo mismo que decir que algo está pasando. El paso de ahí a una conclusión pasa por un nivel de significación que eliges de antemano y por todo lo que sabes del asunto y no está en los números.
- ¿Debo usar una cola o dos?
- Dos, salvo que lo hayas decidido antes de ver los datos y puedas decir qué dirección predecías. Una prueba de dos colas cuenta un resultado en cualquiera de las dos direcciones como evidencia contra la hipótesis nula, que es como se plantean casi todas las preguntas: un fármaco que empeora las cosas también es un hallazgo. Trabajar a una cola es legítimo, pero divide el valor p por dos, y elegir la cola después de mirar los datos es la manera más común de fabricar un resultado significativo de la nada. Si dudas, usa dos colas: es la opción prudente y la que esperará quien te revise el trabajo.
- ¿Con qué nivel de significación hay que comparar el valor p?
- Con el que hayas fijado antes de recoger los datos, que por convención es 0,05, aunque la convención es una costumbre y no un resultado. Aquí no es una entrada y no se imprime ningún veredicto a propósito, porque el mismo valor p de 0,04 es un descubrimiento en un contexto y ruido en otro: rastrear diez mil genes buscando una señal, o contrastar una única hipótesis que respalda una década de trabajo previo, piden umbrales muy distintos. La costumbre que sí merece conservarse es que el nivel se elija de antemano y se publique junto al valor p, en lugar de ajustarlo una vez que la cifra está en pantalla.
- ¿Por qué no puedo elegir dos colas para el chi cuadrado o la F?
- Porque esas dos distribuciones son asimétricas y no hay una única manera aceptada de hacerlas bilaterales. La receta habitual, duplicar la cola menor, se comporta mal justo donde más importa: con un chi cuadrado exactamente igual a 0, que es un ajuste perfecto entre observación y expectativa y por tanto el resultado menos significativo posible, devuelve un valor p del 0 %. Un ajuste perfecto presentado como significación máxima no es un artefacto de redondeo, es una respuesta equivocada, y aparecería en pantalla con un aspecto completamente normal. Las dos colas no son ambiguas en una distribución simétrica, donde duplicar una de ellas es exacto, y en una asimétrica la cola superior por sí sola responde a la pregunta que de verdad se hace: cuán sorprendente es un estadístico así de grande.
- ¿Por qué la página rechaza un chi cuadrado o una F negativos?
- Porque ninguno de los dos estadísticos puede ser negativo, así que un valor negativo significa que el número viene de otro sitio y no de la prueba a la que se atribuye. Los dos se construyen con cantidades al cuadrado (un chi cuadrado con diferencias al cuadrado entre recuentos, una F con un cociente de dos varianzas) y una cantidad al cuadrado nunca baja de cero. La página podría devolver un 100 %, y sería coherente desde el punto de vista aritmético, pero también estaría aceptando una entrada mal calculada y presentándola como un resultado real. Rechazarla no cuesta nada, porque no existe ningún chi cuadrado negativo legítimo que la negativa a calcular pueda bloquear.
- ¿Por qué no hay una tabla de valores críticos en esta página?
- Porque una tabla de valores p tendría que estar indexada por el estadístico de contraste, y el estadístico puede ser cualquier número, así que esa tabla necesitaría infinitas filas. Las tablas que se imprimen al final de un libro van al revés: unas pocas filas para los niveles de significación convencionales y columnas para los grados de libertad que puedas necesitar, y caben en una página solo porque los niveles de significación son pocos y están acordados de antemano. Esta página evalúa el área de la cola exactamente en el estadístico que escribiste, que es lo único que una tabla no puede hacer: una tabla solo puede decirte si tu estadístico quedó por encima o por debajo de los valores que da la casualidad de que lista. La tabla más cercana de este conjunto está en la página del valor crítico, donde las filas son los niveles de significación y las columnas dan la z correspondiente. Las dos páginas son el mismo hecho leído desde extremos opuestos, y por eso cada una enlaza a la otra en primer lugar entre sus herramientas relacionadas.
Referencias
- 1.3.6.7.1. Cumulative Distribution Function of the Standard Normal Distribution — e-Handbook of Statistical Methods (the cumulative function a tail probability is read from, and the table it is normally looked up in) — National Institute of Standards and Technology (NIST)
- 6.2 Using the Normal Distribution — Introductory Statistics 2e (reading probabilities off a normal curve, including the upper and lower complements a two-tailed test is assembled from) — OpenStax (Rice University)
- 1.3.6.1. What is a Probability Distribution — e-Handbook of Statistical Methods (a test statistic as a quantity with a distribution under a stated hypothesis, which is what makes a tail area meaningful) — National Institute of Standards and Technology (NIST)