Saltar al contenido principal
CalcMax

Calculadora de chi cuadrado

Resultado

20,0000

Estadístico chi-cuadrado

Valor p
0,0170 %
Grados de libertad
3
Frecuencia esperada más pequeña
25,0000

Una calculadora de chi cuadrado compara categorías contadas con las frecuencias que esperabas y devuelve el estadístico, sus grados de libertad y el valor p que va con él. Es la prueba que hay detrás de toda pregunta del tipo estas categorías son igual de grandes: si un dado está equilibrado, si cuatro opciones se eligieron con la misma frecuencia, si la frecuencia observada en cada categoría coincide con la frecuencia esperada que tenías motivos para prever. Deja las frecuencias esperadas en blanco y la página supondrá que todas las categorías son igual de probables, que es a la vez el caso más habitual y el único que no exige hacer cuentas antes. La frecuencia esperada más pequeña se imprime junto al resultado, porque es el número contra el que se comprueban las condiciones de la propia prueba.

Fórmula

χ² = Σ ( O − E )² / E df = k − 1 p = P( χ² ≥ χ²₀ )

O
La frecuencia observada en cada categoría, es decir, un recuento y no una medición, así que los números son enteros y su suma es el tamaño de la muestra. Un recuento de cero está permitido: significa que esa categoría no apareció nunca, y eso es un resultado y no un error
E
La frecuencia esperada en cada categoría, que es lo que predice la hipótesis nula y no lo que esperas ver. Si la dejas en blanco se convierte en el total dividido entre el número de categorías, y la prueba pasa a preguntar si todas las categorías son igual de probables
k
El número de categorías, que se lee de la longitud de la lista que escribiste. Fija los grados de libertad y es también entre lo que se reparte el total cuando las frecuencias esperadas van en blanco, así que una sola lista de recuentos determina las dos cosas
df
Los grados de libertad, que son k − 1 y no k. La resta es la parte que se olvida: una vez fijados el total y todos los recuentos menos uno, el último queda determinado, así que las categorías llevan una pieza de información menos de las que son
χ²₀
El estadístico que ha calculado esta página, introducido en su propia distribución nula para obtener el área de la cola. Es la misma operación que leer un valor en una curva normal, con la curva chi cuadrado en lugar de la normal, y es la razón de que el valor p necesite los grados de libertad además del estadístico

Úsala cuando los datos sean un conjunto de recuentos repartidos en categorías y la pregunta sea si esos recuentos son compatibles con alguna predicción. Los recuentos son lo que distingue esta prueba de las de la media y la proporción: las observaciones no se miden en una escala y lo que importa es cuántas cayeron en cada caja y no lo grandes que fueron. La predicción puede ser un reparto uniforme o un conjunto de frecuencias esperadas construido con datos anteriores, como una tasa nacional aplicada a una población local, una proporción mendeliana o la salida de un modelo. La prueba vale lo que valgan esas expectativas, porque compara lo que contaste con lo que dijiste y no notará que la expectativa misma estaba mal. Hay dos condiciones que conviene revisar antes de fiarse del valor p, y la página imprime la primera, ya que la frecuencia esperada más pequeña es justo el número al que se refiere la regla práctica habitual.

Ejemplos resueltos

  1. Cuatro categorías contadas de forma desigual, con las frecuencias esperadas en blanco

    1. El total es 100 y, al dejar la expectativa en blanco, cada una de las 4 categorías debería llevarse 100 / 4 = 25
    2. Diferencias al cuadrado respecto a 25: (30 − 25)² = 25, (10 − 25)² = 225, (20 − 25)² = 25, (40 − 25)² = 225
    3. Divide cada una entre su esperada, 25, y suma: 1 + 9 + 1 + 9 = 20
    4. Grados de libertad: k − 1 = 3, y el área de la cola superior por encima de 20 es 0,017 %

    Este es el caso por defecto de la página y está elegido para que el desequilibrio se vea: 40 y 10 frente a una expectativa de 25 cada una. El valor p sale 0,017 %, así que los recuentos están muy lejos de lo que daría un reparto uniforme, y la frecuencia esperada más pequeña, 25, supera con holgura cualquiera de los umbrales que se usan, de modo que la aproximación que sostiene el valor p aquí pisa terreno firme. Fíjate en que no hubo que escribir ninguna frecuencia esperada: dejar el campo en blanco es la forma de expresar un reparto uniforme, y es la razón de que el campo sea opcional.

  2. Tres categorías contra frecuencias esperadas tomadas de una encuesta anterior

    1. Las dos listas suman 100, así que la expectativa es coherente con los recuentos y la prueba puede seguir
    2. Diferencias al cuadrado: (50 − 60)² = 100, (30 − 30)² = 0, (20 − 10)² = 100
    3. Divide entre cada esperada y suma: 100/60 + 0/30 + 100/10 = 1,6667 + 0 + 10 = 11,6667
    4. Grados de libertad: 3 − 1 = 2, y el área de la cola superior por encima de 11,6667 es 0,2928 %

    Las dos listas tienen que describir el mismo número de observaciones, y aquí las dos llegan a 100, que es lo que convierte la segunda lista en una hipótesis sobre la primera y no en otro experimento. Leer los términos uno a uno enseña algo: la categoría del medio coincidió exactamente con su expectativa y no aportó nada, mientras que la tercera aportó diez de los once puntos y medio del estadístico a pesar de ser la categoría más pequeña, porque se desvió de su expectativa un 100 %. La esperada más pequeña, 10, sigue por encima del nivel que se suele exigir.

  3. Una moneda lanzada 20 veces, contrastada contra un reparto uniforme

    1. Recuentos esperados: 20 lanzamientos repartidos por igual entre dos resultados dan 10 y 10
    2. Diferencias al cuadrado: (12 − 10)² = 4 y (8 − 10)² = 4
    3. Divide y suma: 4/10 + 4/10 = 0,8
    4. Grados de libertad: 2 − 1 = 1, y el área de la cola superior por encima de 0,8 es 37,1093 %

    Doce caras de veinte parecen una moneda cargada hasta que se lee la probabilidad de la cola: el 37 % de las monedas honestas producen un reparto al menos tan desigual, así que el resultado no tiene nada de llamativo. Es la misma aritmética del primer ejemplo hecha sobre la tabla útil más pequeña, y muestra por qué el estadístico nunca se lee solo: 0,8 y 20 no son números comparables, y solo el valor p los pone en una escala común. El caso de dos categorías tiene además un atajo que conviene conocer: el estadístico chi cuadrado es igual al cuadrado de la z que usaría una prueba de dos proporciones.

Limitaciones

El valor p se apoya en una aproximación que exige frecuencias esperadas razonablemente grandes, y la frecuencia esperada más pequeña que se imprime es el número con el que comprobar eso: los manuales no se ponen de acuerdo en dónde está la raya, y tanto la regla de al menos 5 en cada categoría como la de al menos 1 en cada categoría y 5 en la mayoría están muy extendidas. Cuando las expectativas son demasiado pequeñas la aproximación falla en silencio y devuelve un valor p que parece normal. También se supone que los recuentos son independientes, cosa que no se cumple con mediciones repetidas o emparejadas ni con un muestreo por conglomerados, y en esos casos el estadístico sale demasiado grande. Las expectativas se toman como dadas, así que contrastar contra una predicción equivocada responde a una pregunta distinta de la que se pretendía. Por último, un valor p pequeño dice que los recuentos no encajan con la expectativa, pero no por qué: no señala qué categoría es la responsable, y con varias categorías conviene mirar aparte las diferencias que empujan el estadístico.

Preguntas frecuentes

¿Qué me dice exactamente la prueba de chi cuadrado?
Si los recuentos que observaste son compatibles con las frecuencias que esperabas, dado el número de observaciones que hay. El estadístico crece con el desajuste cuadrático total entre observación y expectativa, escalado por lo grande que era cada expectativa, así que la misma brecha proporcional cuenta más cuando las expectativas son pequeñas. El valor p dice después con qué frecuencia un mundo sin diferencias produciría un desajuste al menos así de grande. Es una prueba de toda la tabla y no de una categoría concreta, y las dos cosas se confunden con facilidad cuando hay una categoría que salta a la vista.
¿Qué pasa si dejo las frecuencias esperadas en blanco?
La página supone que todas las categorías son igual de probables y calcula la frecuencia esperada como el total dividido entre el número de categorías. Ese es el uso más frecuente de la prueba (un dado, una ruleta, cuatro botones que deberían recibir el mismo tráfico) y ahorra escribir una lista cuyos valores son todos iguales de todos modos. También es la única lectura posible cuando no hay datos previos con los que predecir el reparto. Escribe las frecuencias esperadas siempre que tengas una predicción real que contrastar, como la distribución del año pasado o una proporción teórica, porque contrastar contra un reparto uniforme y contrastar contra un modelo concreto responden a preguntas distintas, y solo la segunda aprovecha la información que ya tenías.
¿Por qué las dos listas tienen que sumar lo mismo?
Porque en una prueba de bondad de ajuste las frecuencias esperadas se derivan del número total de observaciones y no se eligen libremente: describen cómo se habrían repartido esas mismas observaciones si la hipótesis fuera cierta. Dos listas con totales distintos describen dos experimentos distintos, y el estadístico calculado con ellas no contrasta nada. Cuando cada frecuencia esperada se escribe como un número entero, cada una puede desviarse hasta media unidad sin que cambie la intención, así que la página admite una tolerancia de 0,5 por categoría: 20,5, 20,5 y 20,5 frente a un total de 60 se aceptan, porque son valores redondeados de un reparto uniforme exacto de 20 cada uno.
¿Puede haber una categoría con recuento cero?
Sí si es observado, no si es esperado, y la asimetría sale directamente de la fórmula. Un cero observado es un resultado corriente (una categoría que no apareció nunca) y la diferencia al cuadrado simplemente sale grande, que es lo que debe pasar. Un cero esperado no se puede usar porque es el divisor y el término se haría infinito: la predicción de que una categoría no puede ocurrir nunca no es una predicción que esta prueba pueda sopesar contra un recuento. Si una expectativa real es muy pequeña en vez de nula, la prueba la acepta, y la frecuencia esperada más pequeña que se imprime bajo el resultado es donde se ve si eso supone un problema.
¿Dónde está la tabla de valores críticos de chi cuadrado?
No está en esta página, por la misma razón que en la del valor p: el único valor que importa ya está impreso, porque el estadístico y sus grados de libertad determinan directamente el área de la cola. Una tabla tendría además que construirse con un nivel de significación fijo, así que quien trabajara al 1 % estaría mirando una tabla que contradice al panel. La herramienta de valor crítico es el sitio para esa consulta, y hay una razón más por la que esta página no puede mostrar una tabla ni en principio: sus grados de libertad son k − 1, donde k es el número de categorías que escribió el lector, así que la fila de la tabla que corresponde no se conoce hasta que se conocen los recuentos.

Referencias

Calculadoras relacionadas