Calculadora de prueba t
Resultado
Estadístico t
- Valor p
- 34,6594 %
- Grados de libertad
- 8
- Error estándar
- 1,0000
Una calculadora de prueba t ejecuta el contraste más común sobre una media: convierte una media muestral, una desviación estándar y un tamaño de muestra en un estadístico t, un valor p y los grados de libertad con los que se leen los otros dos. El modo de prueba t de una muestra compara una media con un valor fijo (un objetivo, una especificación, una media histórica). El modo de prueba t de dos muestras compara dos grupos entre sí, y la versión que se implementa aquí es la de varianza combinada, que supone que los dos grupos comparten una misma varianza: las dos desviaciones estándar se promedian con pesos de n − 1 y esa única varianza combinada es la que gobierna el error estándar. La alternativa, la prueba de Welch, renuncia al supuesto de varianzas iguales y es la opción más segura cuando los grupos difieren en tamaño y en dispersión, pero sus grados de libertad salen fraccionarios y es un cálculo distinto en otro lugar del código; esta página hace el contraste de varianzas iguales y lo dice, en lugar de aproximarlo en silencio. El valor p es el área de la cola de la distribución t más allá del estadístico, y se imprime en porcentaje.
Fórmula
t = (x̄ − μ₀) / (s / √n) t = (x̄₁ − x̄₂) / √(s_p²(1/n₁ + 1/n₂)) s_p² = ((n₁−1)s₁² + (n₂−1)s₂²) / (n₁ + n₂ − 2)
- t
- El estadístico de contraste: a cuántos errores estándar se sitúa la media observada del valor que se está contrastando. Su signo lleva la dirección, y por eso un contraste de una cola en la dirección equivocada devuelve un valor p grande en lugar de un error: una t de −1 frente a una alternativa de mayor que no es un efecto pequeño, es evidencia que apunta al otro lado, y el área de la cola lo dice
- x̄, μ₀
- La media muestral y el valor contra el que se contrasta, en el modo de una muestra. El numerador es su diferencia, así que el estadístico mide una distancia en las unidades de los datos: la misma diferencia cuenta mucho menos si la dispersión es ancha o la muestra pequeña, y eso es lo que aporta el denominador
- s
- La desviación estándar de la muestra, estimada a partir de los datos y no conocida de antemano. Esa estimación es la razón entera de que se use la distribución t en lugar de la normal: la incertidumbre añadida que introduce hace las colas más pesadas, y esas colas más pesadas son lo que el valor crítico de la t tiene en cuenta. Tiene que ser mayor que cero: una muestra sin ninguna variación no tiene denominador entre el que dividir
- n
- El tamaño de la muestra, que da n − 1 grados de libertad en el modo de una muestra. En el contraste de dos muestras los dos tamaños suman uno más que cualquiera de ellos por separado, n₁ + n₂ − 2, porque la varianza combinada gasta un grado de libertad en la media de cada grupo antes de medir la dispersión alrededor de ella
- s_p²
- La varianza combinada: la media ponderada de las varianzas de los dos grupos, con cada una ponderada por sus propios grados de libertad. Aquí es donde entra el supuesto de varianzas iguales: los dos grupos se tratan como dos muestras de una única dispersión poblacional, así que un grupo con más observaciones, o con una varianza propia menor, contribuye proporcionalmente a una sola estimación compartida. Si las dos varianzas difieren de forma sustancial, la combinación es lo que falla, y la prueba de Welch es el arreglo
- p-value
- La probabilidad de un estadístico al menos así de lejos de cero, en la dirección que pregunta el contraste, si las dos medias fueran realmente iguales. Dos colas duplica el área más allá de |t|; las alternativas de mayor y de menor toman una cola cada una. Se informa en porcentaje, así que un 5 % es el 0,05 de siempre, y es una afirmación sobre los datos dada la hipótesis y no sobre la hipótesis dados los datos
Úsala cuando tengas una media y una desviación estándar de una muestra y quieras saber si la diferencia con un objetivo, o con otro grupo, es mayor de lo que explicaría el ruido de muestreo. El modo de una muestra cubre el caso en que el valor de comparación es un número fijo (una máquina ajustada para llenar 500 gramos, una especificación de 5 mm, la media del año pasado) y el modo de dos muestras cubre el caso en que las dos cantidades se midieron y ninguna es privilegiada. Merece la pena decidir dos cosas antes de leer la respuesta. La primera es una cola o dos: un contraste de dos colas pregunta si los grupos difieren en cualquier dirección y es el valor por defecto correcto, mientras que uno de una cola pregunta algo direccional y debería elegirse porque la dirección se especificó de antemano, y no porque la respuesta vaya a ser más favorable. La segunda es el supuesto de varianzas iguales, que el modo de dos muestras hace y no puede comprobar por ti. La pista está en el panel: si las dos desviaciones estándar que escribiste están cerca, combinarlas cuesta poco, y si difieren en un factor de dos o más, la prueba que quieres es la de Welch. Esta página hace el contraste combinado, que es lo que la mayoría de los manuales y de los estadísticos entienden por «la prueba t» en el caso de varianzas iguales, e informa de las dos desviaciones estándar que le diste para que el supuesto se pueda juzgar en lugar de darse por hecho.
Ejemplos resueltos
El caso por defecto: una media muestral de 6 frente a un objetivo de 5
- Error estándar: s / √n = 3 / 3 = 1
- Estadístico t: (6 − 5) / 1 = 1, así que la media muestral está un error estándar por encima del objetivo
- Grados de libertad: n − 1 = 8
- Valor p de dos colas: el área más allá de ±1 en una distribución t con 8 grados de libertad, que es 34,66 %
Una diferencia de una unidad entera suena a mucho hasta que se pone el error estándar a su lado: un error estándar está holgadamente dentro del rango que produce el ruido de muestreo, y el valor p lo dice. La comparación con la curva normal es instructiva: la misma t de 1 daría un 31,7 % si la distribución fuera normal, y los tres puntos de más son el precio de haber estimado la desviación estándar con nueve observaciones en lugar de conocerla.
Un estadístico t de 2,306 da exactamente un 5 %
- Error estándar: 3 / √9 = 1, así que el estadístico t es la media misma
- Estadístico t: (2,306 − 0) / 1 = 2,306
- El límite t de dos colas al 95 % con 8 grados de libertad es 2,306
- Estar exactamente sobre el límite significa que el valor p de dos colas es exactamente 5 %
Este es el par que produce la página del valor crítico desde el otro lado, y juntar los dos es la demostración más clara de que son un mismo hecho leído por sus dos extremos. Pide a aquella página un límite t de dos colas al 95 % con 8 grados de libertad y devuelve 2,306; mete 2,306 en esta y el valor p sale exactamente en un 5 %. Nada de lo que hay en medio está redondeado: el número se eligió porque la desviación estándar de 3 y el tamaño de muestra de 9 hacen que el error estándar sea exactamente 1, así que el estadístico y el límite son la misma cifra. Un estadístico justo por debajo quedaría por encima del 5 %, y uno justo por encima quedaría por debajo.
Dos grupos de diez con la misma dispersión
- Varianza combinada: ((9 × 4) + (9 × 4)) / 18 = 72 / 18 = 4, así que la desviación estándar combinada es 2
- Error estándar: √(4 × (1/10 + 1/10)) = √0,8 = 0,8944
- Estadístico t: (5 − 4) / 0,8944 = 1,118
- Grados de libertad: 10 + 10 − 2 = 18, lo que da un valor p de dos colas de 27,83 %
Cuando las dos varianzas son iguales la combinación no hace nada: la varianza combinada sale 4, exactamente el valor que aportaban los dos grupos, y el error estándar es menor que la desviación estándar de cualquiera de los grupos dividida entre su propio √n. Comparar dos medias de diez es menos preciso que estimar una sola media de diez (un error estándar de 0,8944 frente a 0,6325), porque se están restando dos cantidades inciertas en lugar de midiendo una, y ese coste solo merece la pena cuando la comparación responde a una pregunta que una sola muestra no puede. Fíjate en que el campo de la media de la población está en pantalla y sin usar en este modo: las dos cantidades se miden, así que ninguna es el objetivo fijo.
Dispersiones y tamaños distintos, donde hay que vigilar la combinación
- Varianza combinada: ((9 × 4,41) + (11 × 3,24)) / 20 = (39,69 + 35,64) / 20 = 3,7665
- Error estándar: √(3,7665 × (1/10 + 1/12)) = √0,6905 = 0,831
- Estadístico t: (5,2 − 4,1) / 0,831 = 1,3237
- Grados de libertad: 10 + 12 − 2 = 20
La varianza combinada es 3,7665, que no es el punto medio de 4,41 y 3,24: el grupo de doce pesa más porque aporta once grados de libertad frente a los nueve del grupo de diez. Esa ponderación es todo el contenido de la palabra combinada, y es la razón de que la respuesta no se pueda reproducir promediando las dos desviaciones estándar. Las dos dispersiones de aquí están lo bastante cerca como para que el supuesto de varianzas iguales resulte cómodo; un par como 2,1 y 0,6 con estos tamaños de grupo no lo estaría, y la prueba de Welch daría un valor p visiblemente distinto.
Una t de 1,96 con 900 observaciones, donde la t y la z han convergido
- Error estándar: 3 / √900 = 3 / 30 = 0,1
- Estadístico t: (5,196 − 5) / 0,1 = 1,96
- Grados de libertad: 899
- Valor p de dos colas: 5,0304 %, justo por encima de 5 y no exactamente en él
El famoso 1,96 da un 5 % en la curva normal y un 5,0304 % aquí, y esa distancia es el sentido del ejemplo. Con 899 grados de libertad la distribución t es casi indistinguible de la normal, pero no exactamente: sigue teniendo las colas un poco más pesadas, así que el mismo estadístico queda un poco más afuera. Es también la razón de que una t de 1,96 no sea automáticamente significativa al 5 % en una muestra grande, y de que un programa que informa de 0,0499 y otro que informa de 0,0501 puedan discrepar sobre el mismo estudio en el tercer decimal.
Limitaciones
El modo de dos muestras supone que los dos grupos comparten una varianza, y ese supuesto hace trabajo real y no es una manera de ordenar la notación. Cuando los tamaños de grupo son iguales, el contraste combinado es bastante robusto aunque las varianzas difieran, pero cuando los tamaños son desiguales y las varianzas también difieren, el contraste puede estar seriamente equivocado en cualquiera de las dos direcciones: es el problema de Behrens–Fisher, y la prueba de Welch existe para resolverlo. Las dos desviaciones estándar están en el panel por esa razón: compáralas antes de fiarte del valor p, y si una es más de unas dos veces la otra mientras los tamaños de grupo difieren, el contraste de varianzas iguales no es el que quieres. El modo de una muestra no tiene ese problema, pero supone que las observaciones son independientes, cosa que no se cumple con mediciones repetidas sobre un mismo sujeto ni con datos emparejados o agrupados, donde hace falta un modelo de pares o mixto. Los dos modos suponen que los datos de partida son aproximadamente normales, y los dos se vuelven menos sensibles a eso a medida que la muestra crece: el teorema central del límite es lo que hace razonable una prueba t sobre 900 observaciones asimétricas y cuestionable una prueba t sobre 9. Por último, la página informa de un estadístico y un valor p y de ninguna conclusión. No tiene ningún nivel de significación con el que comparar, y el 0,05 es una convención y no un resultado, así que la decisión se deja donde corresponde.
Preguntas frecuentes
- ¿Esta página usa la prueba t combinada o la de Welch?
- La combinada, la de varianzas iguales, con n₁ + n₂ − 2 grados de libertad. La prueba de Welch es la mejor opción cuando los dos grupos difieren en dispersión y en tamaño, y los dos campos de desviación estándar están en el panel para que puedas comprobarlo: si una es más o menos el doble de la otra y los tamaños de muestra difieren, lo que quieres es Welch y esta página te dará un valor p desviado, a veces de forma sustancial. La versión de varianzas iguales se implementa aquí porque es la prueba de los manuales, porque es lo que un manual de referencia llama el contraste t de dos muestras para medias iguales, y porque sus grados de libertad enteros mantienen la aritmética de esta página exacta en lugar de aproximada.
- ¿Debo usar un contraste de una cola o de dos?
- De dos colas, salvo que la dirección se haya especificado antes de ver los datos. Un contraste de dos colas pregunta si los grupos difieren en general y reparte el nivel de significación entre los dos extremos; uno de una cola pregunta si un grupo es mayor y pone todo el nivel en esa cola, lo que hace más fácil alcanzar la significación, exactamente el doble de fácil al mismo nivel, ya que 1,96 pasa a ser 1,645. Es una elección legítima cuando la pregunta es de verdad direccional, y es una forma de perseguir el resultado cuando la dirección se eligió después de ver hacia dónde iba la diferencia.
- ¿Qué diferencia hay entre el estadístico t y el valor p?
- El estadístico t mide la diferencia en errores estándar y lleva dentro el tamaño de la muestra, mientras que el valor p convierte esa cifra en una probabilidad usando la distribución t con los grados de libertad correspondientes. Así que la t responde a «¿a cuántos errores estándar están de distancia?» y el valor p responde a «¿con qué frecuencia produciría el muestreo por sí solo una brecha así de grande?». Se informa de los dos porque el primero es comparable entre estudios con el mismo diseño y el segundo es con lo que se compara un nivel de significación. Ninguno de los dos es el tamaño del efecto: una muestra grande puede hacer que una diferencia trivial produzca una t grande y un valor p minúsculo.
- ¿Por qué un estadístico t de 1,96 no da exactamente un 5 %?
- Porque 1,96 es el límite del 5 % de la curva normal, y la distribución t tiene las colas algo más pesadas con cualquier número finito de grados de libertad. Con 899 grados de libertad una t de 1,96 da un 5,0304 %, justo por encima de la raya; con 8 grados de libertad el mismo estadístico da un 8,57 %. La distribución t converge hacia la normal a medida que crecen los grados de libertad, y es la misma curva en todo el recorrido: lo único que cambia es el peso de las colas. Por eso un programa puede informar de un valor p de 0,0499 donde un cálculo a mano contra 1,96 dice significativo, y ninguno de los dos está equivocado.
- ¿Qué significa un estadístico t negativo?
- Que la media de la muestra salió por debajo del valor con el que se contrasta, o por debajo de la media del segundo grupo en el modo de dos muestras. El signo es información de dirección y nada más; de su tamaño respecto a la distribución es de donde se calcula el valor p. En un contraste de dos colas el signo se descarta porque cualquiera de los dos extremos cuenta. En uno de una cola importa y puede ser informativo: una t de −2,5 frente a una alternativa de mayor da un valor p cercano al 99 %, que no es un resultado nulo sino evidencia que apunta al otro lado, e informar de él como «no significativo» sería tirar esa información.
- ¿Cuántas observaciones necesito para una prueba t?
- La página exige al menos dos por grupo, porque la desviación estándar de una sola observación no está definida. Eso es un suelo matemático y no una recomendación práctica: una prueba t con dos observaciones por grupo tiene un grado de libertad y casi ninguna potencia para detectar nada que no sea una diferencia enorme, y el valor p saldrá grande salvo que los dos grupos apenas se solapen. La pregunta útil no es el mínimo que permite la fórmula, sino el tamaño de muestra necesario para detectar la diferencia que te importa, que depende de la dispersión de los datos y del tamaño del efecto que querrías notar; la página del tamaño de muestra es donde vive ese cálculo, y allí se trabaja hacia atrás desde un margen de error y no hacia delante desde un conjunto de datos.
- ¿Dónde está la tabla de valores críticos de la t?
- En la página del valor crítico, y solo allí dentro de este conjunto: esta página no imprime ninguna porque tendría que estar indexada por grados de libertad además de por nivel de significación, lo que sería una página del libro por cada nivel en lugar de una tabla. Esa es también la razón de que la respuesta se calcule aquí en lugar de buscarse: una tabla solo puede listar los grados de libertad que alguien decidió imprimir, y los grados de libertad que produce un contraste de dos muestras, n₁ + n₂ − 2, casi nunca son uno de ellos. El único límite que merece la pena llevar en la cabeza es que los valores de la t convergen hacia 1,96 a medida que la muestra crece, así que la tabla que buscas es la normal con una penalización que se encoge según suben los grados de libertad.
Referencias
- 1.3.5.3. Two-Sample t-Test for Equal Means — e-Handbook of Statistical Methods (the pooled two-sample test this page implements, including the pooled standard deviation and its n₁ + n₂ − 2 degrees of freedom) — National Institute of Standards and Technology (NIST)
- 1.3.5.1. Measures of Location — e-Handbook of Statistical Methods (the sample mean and the standard error that the one-sample statistic is built from) — National Institute of Standards and Technology (NIST)
- 1.3.6.7.1. Cumulative Distribution Function of the Standard Normal Distribution — e-Handbook of Statistical Methods (the curve the t distribution approaches as the degrees of freedom grow, which is why 1.96 and 5% are only approximately each other's partner) — National Institute of Standards and Technology (NIST)