Calculadora de qui-quadrado
Resultado
Estatística qui-quadrado
- Valor p
- 0,0170%
- Graus de liberdade
- 3
- Menor contagem esperada
- 25,0000
Esta calculadora de qui-quadrado compara categorias contadas com as frequências que você esperava e informa a estatística qui-quadrado, os graus de liberdade e o valor p correspondente. É o teste por trás de toda pergunta do tipo estes grupos têm o mesmo tamanho: se um dado é honesto, se quatro opções foram escolhidas com a mesma frequência, se a frequência observada em cada categoria bate com a frequência esperada que você tinha motivo para prever. Deixe as frequências esperadas em branco e a página supõe que todas as categorias são igualmente prováveis, que é ao mesmo tempo o caso mais comum e o que não exige nenhuma conta antes. A menor contagem esperada aparece ao lado, porque é contra esse número que se conferem as condições de uso do teste.
Fórmula
χ² = Σ ( O − E )² / E df = k − 1 p = P( χ² ≥ χ²₀ )
- O
- A frequência observada em cada categoria — uma contagem, não uma medição, então os números são inteiros e a soma deles é o tamanho da amostra. Uma contagem zero é permitida: significa que a categoria nunca apareceu, o que é um resultado e não um erro
- E
- A frequência esperada em cada categoria, que é o que a hipótese nula prevê e não o que você espera ver. Em branco, ela vira o total dividido pelo número de categorias, e o teste passa a perguntar se as categorias são igualmente prováveis
- k
- O número de categorias, lido do comprimento da lista que você digitou. É ele que fixa os graus de liberdade e é por ele que as frequências esperadas são divididas quando o campo fica em branco, então uma única lista de contagens determina as duas coisas
- df
- Os graus de liberdade, que são k − 1 e não k. A subtração é a parte que se esquece: uma vez fixados o total e todas as contagens menos uma, a última contagem está determinada, então as categorias carregam uma informação a menos do que a quantidade delas
- χ²₀
- A estatística que esta página calculou, inserida na própria distribuição nula para obter a área da cauda. É a mesma operação de ler um valor em uma curva normal, com a curva do qui-quadrado no lugar da normal — e é por isso que o valor p precisa dos graus de liberdade além da estatística
Use esta página quando os dados forem um conjunto de contagens distribuídas em categorias e a pergunta for se as contagens são coerentes com alguma previsão. São as contagens que tornam este teste diferente dos que tratam de médias e proporções: as observações não são medidas em uma escala, e o que importa é quantas caíram em cada cesta e não o tamanho de nenhuma delas. A previsão pode ser uma divisão igual, ou um conjunto de frequências esperadas construído a partir de dados anteriores — uma taxa nacional aplicada a uma população local, uma proporção mendeliana, a saída de um modelo. O teste vale o que valem essas expectativas: ele compara o que você contou com o que você afirmou e não percebe que a afirmação em si estava errada. Vale conferir duas condições antes de confiar no valor p, e a página imprime a primeira delas, já que a menor contagem esperada é o número sobre o qual a regra prática habitual fala. É esse teste de aderência que responde se um dado de seis faces é honesto ou se as quatro opções de uma enquete foram escolhidas com a mesma frequência.
Exemplos resolvidos
Quatro categorias contadas de forma desigual, com as frequências esperadas em branco
- O total é 100, e com a expectativa em branco cada uma das 4 categorias deve conter 100 / 4 = 25
- Diferenças ao quadrado em relação a 25: (30 − 25)² = 25, (10 − 25)² = 225, (20 − 25)² = 25, (40 − 25)² = 225
- Divida cada uma pela sua esperada 25 e some: 1 + 9 + 1 + 9 = 20
- Graus de liberdade: k − 1 = 3, e a cauda superior além de 20 é 0,017%
Este é o padrão da página, e foi escolhido para ser visivelmente desigual: 40 e 10 contra uma expectativa de 25 em cada categoria. O valor p sai em 0,017%, então as contagens estão longe do que uma divisão igual produziria, e a menor contagem esperada, 25, está confortavelmente acima de qualquer um dos limiares em uso corrente — a aproximação por trás do valor p está em terreno firme aqui. Repare que as frequências esperadas não precisaram ser digitadas: deixar o campo em branco é a maneira de escrever uma divisão igual, e é a razão de esse campo ser opcional.
Três categorias contra frequências esperadas tiradas de um levantamento anterior
- As duas listas somam 100, então a expectativa é coerente com as contagens e o teste pode prosseguir
- Diferenças ao quadrado: (50 − 60)² = 100, (30 − 30)² = 0, (20 − 10)² = 100
- Divida por cada expectativa e some: 100/60 + 0/30 + 100/10 = 1,6667 + 0 + 10 = 11,6667
- Graus de liberdade: 3 − 1 = 2, e a cauda superior além de 11,6667 é 0,2928%
As duas listas precisam descrever o mesmo número de observações, e aqui as duas chegam a 100 — é isso que faz da segunda lista uma hipótese sobre a primeira e não um experimento diferente. Ler os termos um a um é instrutivo: a categoria do meio bateu exatamente com a sua expectativa e não contribuiu com nada, enquanto a terceira contribuiu com dez dos onze pontos e meio da estatística apesar de ser a menor categoria, porque errou a própria expectativa em 100%. A menor contagem esperada, 10, ainda está acima do nível habitualmente exigido.
Uma moeda lançada 20 vezes, testada contra uma divisão igual
- Contagens esperadas: 20 lançamentos divididos igualmente entre dois resultados dão 10 e 10
- Diferenças ao quadrado: (12 − 10)² = 4 e (8 − 10)² = 4
- Divida e some: 4/10 + 4/10 = 0,8
- Graus de liberdade: 2 − 1 = 1, e a cauda superior além de 0,8 é 37,1093%
12 caras em 20 lançamentos parece uma moeda viciada até que a probabilidade da cauda seja lida: 37% das moedas honestas produzem uma divisão pelo menos tão desigual, então o resultado não tem nada de notável. Esta é a mesma conta do primeiro exemplo feita na menor tabela útil, e mostra por que a estatística nunca é lida sozinha — 0,8 e 20 não são números comparáveis, e só o valor p coloca os dois na mesma escala. O caso de duas categorias tem ainda um atalho que vale conhecer: a estatística qui-quadrado é igual ao quadrado do z que um teste de duas proporções usaria.
Limitações
O valor p repousa sobre uma aproximação que exige frequências esperadas razoavelmente grandes, e a menor contagem esperada impressa é o número com que se confere isso — os livros-texto discordam sobre onde fica a linha, e tanto pelo menos 5 em cada categoria quanto pelo menos 1 em cada categoria mais 5 na maioria delas estão em uso corrente. Quando as expectativas são pequenas demais, a aproximação falha em silêncio e devolve um valor p de aparência comum. Também se supõe que as contagens são independentes, o que não vale para medições pareadas ou repetidas nem para amostragem por conglomerados, e cada um desses casos deixa a estatística grande demais. As próprias expectativas são tomadas como dadas, então um teste contra uma previsão errada responde a uma pergunta diferente da que se pretendia. Por fim, um valor p pequeno diz que as contagens são incoerentes com a expectativa, e não por quê: ele não diz qual categoria é a responsável, e com várias categorias vale inspecionar separadamente as diferenças que movem a estatística.
Perguntas frequentes
- O que o teste de qui-quadrado realmente me diz?
- Se as contagens que você observou são coerentes com as frequências que você esperava, dado quantas observações existem. A estatística cresce com o total da diferença ao quadrado entre observação e expectativa, escalonada pelo tamanho de cada expectativa, então a mesma diferença proporcional pesa mais quando as expectativas são pequenas. O valor p diz então com que frequência um mundo honesto produziria uma diferença pelo menos desse tamanho. É um teste da tabela inteira e não de uma categoria isolada, e as duas coisas são fáceis de confundir quando uma categoria é claramente a que destoa.
- O que acontece se eu deixar as frequências esperadas em branco?
- A página supõe que todas as categorias são igualmente prováveis e calcula a frequência esperada como o total dividido pelo número de categorias. É o uso mais comum do teste — um dado, um ponteiro, quatro botões que deveriam receber o mesmo tráfego — e poupa digitar uma lista cujos valores são todos iguais. É também a única leitura disponível quando não existe dado anterior que preveja a divisão. Digite as frequências esperadas sempre que tiver uma previsão real a testar, como a distribuição do ano passado ou uma razão teórica, porque um teste contra uma divisão igual e um teste contra um modelo específico respondem a perguntas diferentes, e só o segundo usa a informação que você já tem.
- Por que as duas listas precisam somar o mesmo total?
- Porque em um teste de aderência as frequências esperadas derivam do total de observações, e não são escolhidas livremente — elas descrevem como essas mesmas observações teriam se distribuído se a hipótese fosse verdadeira. Duas listas com totais diferentes descrevem dois experimentos diferentes, e a estatística calculada a partir delas não é teste de nada. Quando cada frequência esperada é escrita como um número inteiro, cada uma pode errar por até meia unidade sem mudar a intenção, então a página admite uma tolerância de 0,5 por categoria: 20,5, 20,5 e 20,5 contra um total de 60 é aceito, já que são valores arredondados para uma divisão exata de 20 em cada categoria.
- Uma categoria pode ter contagem zero?
- Sim para uma contagem observada, não para uma esperada, e a assimetria vem direto da fórmula. Um zero observado é um resultado comum — uma categoria que nunca apareceu — e a diferença ao quadrado simplesmente fica grande, que é o que deve acontecer. Uma esperada zero não pode ser usada porque ela é o divisor, e o termo ficaria infinito: a previsão de que uma categoria nunca pode ocorrer não é uma previsão que este teste consiga pesar contra uma contagem. Se uma expectativa real é muito pequena em vez de zero, o teste a aceita, e a menor contagem esperada impressa abaixo do resultado é onde se vê se isso é um problema.
- Onde está a tabela de valores críticos do qui-quadrado?
- Não está nesta página, pelo mesmo motivo da página de valor p: o único valor que importa já está impresso, porque a estatística e os seus graus de liberdade determinam a área da cauda diretamente. Uma tabela também teria de ser construída para um nível de significância, então um leitor trabalhando a 1% estaria olhando uma tabela que contradiz o painel. A ferramenta de valor crítico é o lugar dessa consulta, e há mais uma razão pela qual esta página não poderia mostrar uma tabela nem em princípio: os seus graus de liberdade são k − 1, onde k é o número de categorias que o leitor digitou, então a linha aplicável da tabela não é conhecida antes das contagens.
Referências
- 1.3.6.1. What is a Probability Distribution — e-Handbook of Statistical Methods (a test statistic as a quantity with its own distribution under the null hypothesis, which is what makes the tail area computable) — National Institute of Standards and Technology (NIST)
- 3.1 Terminology — Introductory Statistics 2e (relative frequency as an estimate of a probability, which is the step that turns a category's probability into an expected count of observations) — OpenStax (Rice University)
- 1.3.6.7.1. Cumulative Distribution Function of the Standard Normal Distribution — e-Handbook of Statistical Methods (the same reading of a tail area off a cumulative curve that this page performs with the chi-square curve instead) — National Institute of Standards and Technology (NIST)