Pular para o conteúdo principal
CalcMax

Calculadora de qui-quadrado

Resultado

20,0000

Estatística qui-quadrado

Valor p
0,0170%
Graus de liberdade
3
Menor contagem esperada
25,0000

Esta calculadora de qui-quadrado compara categorias contadas com as frequências que você esperava e informa a estatística qui-quadrado, os graus de liberdade e o valor p correspondente. É o teste por trás de toda pergunta do tipo estes grupos têm o mesmo tamanho: se um dado é honesto, se quatro opções foram escolhidas com a mesma frequência, se a frequência observada em cada categoria bate com a frequência esperada que você tinha motivo para prever. Deixe as frequências esperadas em branco e a página supõe que todas as categorias são igualmente prováveis, que é ao mesmo tempo o caso mais comum e o que não exige nenhuma conta antes. A menor contagem esperada aparece ao lado, porque é contra esse número que se conferem as condições de uso do teste.

Fórmula

χ² = Σ ( O − E )² / E df = k − 1 p = P( χ² ≥ χ²₀ )

O
A frequência observada em cada categoria — uma contagem, não uma medição, então os números são inteiros e a soma deles é o tamanho da amostra. Uma contagem zero é permitida: significa que a categoria nunca apareceu, o que é um resultado e não um erro
E
A frequência esperada em cada categoria, que é o que a hipótese nula prevê e não o que você espera ver. Em branco, ela vira o total dividido pelo número de categorias, e o teste passa a perguntar se as categorias são igualmente prováveis
k
O número de categorias, lido do comprimento da lista que você digitou. É ele que fixa os graus de liberdade e é por ele que as frequências esperadas são divididas quando o campo fica em branco, então uma única lista de contagens determina as duas coisas
df
Os graus de liberdade, que são k − 1 e não k. A subtração é a parte que se esquece: uma vez fixados o total e todas as contagens menos uma, a última contagem está determinada, então as categorias carregam uma informação a menos do que a quantidade delas
χ²₀
A estatística que esta página calculou, inserida na própria distribuição nula para obter a área da cauda. É a mesma operação de ler um valor em uma curva normal, com a curva do qui-quadrado no lugar da normal — e é por isso que o valor p precisa dos graus de liberdade além da estatística

Use esta página quando os dados forem um conjunto de contagens distribuídas em categorias e a pergunta for se as contagens são coerentes com alguma previsão. São as contagens que tornam este teste diferente dos que tratam de médias e proporções: as observações não são medidas em uma escala, e o que importa é quantas caíram em cada cesta e não o tamanho de nenhuma delas. A previsão pode ser uma divisão igual, ou um conjunto de frequências esperadas construído a partir de dados anteriores — uma taxa nacional aplicada a uma população local, uma proporção mendeliana, a saída de um modelo. O teste vale o que valem essas expectativas: ele compara o que você contou com o que você afirmou e não percebe que a afirmação em si estava errada. Vale conferir duas condições antes de confiar no valor p, e a página imprime a primeira delas, já que a menor contagem esperada é o número sobre o qual a regra prática habitual fala. É esse teste de aderência que responde se um dado de seis faces é honesto ou se as quatro opções de uma enquete foram escolhidas com a mesma frequência.

Exemplos resolvidos

  1. Quatro categorias contadas de forma desigual, com as frequências esperadas em branco

    1. O total é 100, e com a expectativa em branco cada uma das 4 categorias deve conter 100 / 4 = 25
    2. Diferenças ao quadrado em relação a 25: (30 − 25)² = 25, (10 − 25)² = 225, (20 − 25)² = 25, (40 − 25)² = 225
    3. Divida cada uma pela sua esperada 25 e some: 1 + 9 + 1 + 9 = 20
    4. Graus de liberdade: k − 1 = 3, e a cauda superior além de 20 é 0,017%

    Este é o padrão da página, e foi escolhido para ser visivelmente desigual: 40 e 10 contra uma expectativa de 25 em cada categoria. O valor p sai em 0,017%, então as contagens estão longe do que uma divisão igual produziria, e a menor contagem esperada, 25, está confortavelmente acima de qualquer um dos limiares em uso corrente — a aproximação por trás do valor p está em terreno firme aqui. Repare que as frequências esperadas não precisaram ser digitadas: deixar o campo em branco é a maneira de escrever uma divisão igual, e é a razão de esse campo ser opcional.

  2. Três categorias contra frequências esperadas tiradas de um levantamento anterior

    1. As duas listas somam 100, então a expectativa é coerente com as contagens e o teste pode prosseguir
    2. Diferenças ao quadrado: (50 − 60)² = 100, (30 − 30)² = 0, (20 − 10)² = 100
    3. Divida por cada expectativa e some: 100/60 + 0/30 + 100/10 = 1,6667 + 0 + 10 = 11,6667
    4. Graus de liberdade: 3 − 1 = 2, e a cauda superior além de 11,6667 é 0,2928%

    As duas listas precisam descrever o mesmo número de observações, e aqui as duas chegam a 100 — é isso que faz da segunda lista uma hipótese sobre a primeira e não um experimento diferente. Ler os termos um a um é instrutivo: a categoria do meio bateu exatamente com a sua expectativa e não contribuiu com nada, enquanto a terceira contribuiu com dez dos onze pontos e meio da estatística apesar de ser a menor categoria, porque errou a própria expectativa em 100%. A menor contagem esperada, 10, ainda está acima do nível habitualmente exigido.

  3. Uma moeda lançada 20 vezes, testada contra uma divisão igual

    1. Contagens esperadas: 20 lançamentos divididos igualmente entre dois resultados dão 10 e 10
    2. Diferenças ao quadrado: (12 − 10)² = 4 e (8 − 10)² = 4
    3. Divida e some: 4/10 + 4/10 = 0,8
    4. Graus de liberdade: 2 − 1 = 1, e a cauda superior além de 0,8 é 37,1093%

    12 caras em 20 lançamentos parece uma moeda viciada até que a probabilidade da cauda seja lida: 37% das moedas honestas produzem uma divisão pelo menos tão desigual, então o resultado não tem nada de notável. Esta é a mesma conta do primeiro exemplo feita na menor tabela útil, e mostra por que a estatística nunca é lida sozinha — 0,8 e 20 não são números comparáveis, e só o valor p coloca os dois na mesma escala. O caso de duas categorias tem ainda um atalho que vale conhecer: a estatística qui-quadrado é igual ao quadrado do z que um teste de duas proporções usaria.

Limitações

O valor p repousa sobre uma aproximação que exige frequências esperadas razoavelmente grandes, e a menor contagem esperada impressa é o número com que se confere isso — os livros-texto discordam sobre onde fica a linha, e tanto pelo menos 5 em cada categoria quanto pelo menos 1 em cada categoria mais 5 na maioria delas estão em uso corrente. Quando as expectativas são pequenas demais, a aproximação falha em silêncio e devolve um valor p de aparência comum. Também se supõe que as contagens são independentes, o que não vale para medições pareadas ou repetidas nem para amostragem por conglomerados, e cada um desses casos deixa a estatística grande demais. As próprias expectativas são tomadas como dadas, então um teste contra uma previsão errada responde a uma pergunta diferente da que se pretendia. Por fim, um valor p pequeno diz que as contagens são incoerentes com a expectativa, e não por quê: ele não diz qual categoria é a responsável, e com várias categorias vale inspecionar separadamente as diferenças que movem a estatística.

Perguntas frequentes

O que o teste de qui-quadrado realmente me diz?
Se as contagens que você observou são coerentes com as frequências que você esperava, dado quantas observações existem. A estatística cresce com o total da diferença ao quadrado entre observação e expectativa, escalonada pelo tamanho de cada expectativa, então a mesma diferença proporcional pesa mais quando as expectativas são pequenas. O valor p diz então com que frequência um mundo honesto produziria uma diferença pelo menos desse tamanho. É um teste da tabela inteira e não de uma categoria isolada, e as duas coisas são fáceis de confundir quando uma categoria é claramente a que destoa.
O que acontece se eu deixar as frequências esperadas em branco?
A página supõe que todas as categorias são igualmente prováveis e calcula a frequência esperada como o total dividido pelo número de categorias. É o uso mais comum do teste — um dado, um ponteiro, quatro botões que deveriam receber o mesmo tráfego — e poupa digitar uma lista cujos valores são todos iguais. É também a única leitura disponível quando não existe dado anterior que preveja a divisão. Digite as frequências esperadas sempre que tiver uma previsão real a testar, como a distribuição do ano passado ou uma razão teórica, porque um teste contra uma divisão igual e um teste contra um modelo específico respondem a perguntas diferentes, e só o segundo usa a informação que você já tem.
Por que as duas listas precisam somar o mesmo total?
Porque em um teste de aderência as frequências esperadas derivam do total de observações, e não são escolhidas livremente — elas descrevem como essas mesmas observações teriam se distribuído se a hipótese fosse verdadeira. Duas listas com totais diferentes descrevem dois experimentos diferentes, e a estatística calculada a partir delas não é teste de nada. Quando cada frequência esperada é escrita como um número inteiro, cada uma pode errar por até meia unidade sem mudar a intenção, então a página admite uma tolerância de 0,5 por categoria: 20,5, 20,5 e 20,5 contra um total de 60 é aceito, já que são valores arredondados para uma divisão exata de 20 em cada categoria.
Uma categoria pode ter contagem zero?
Sim para uma contagem observada, não para uma esperada, e a assimetria vem direto da fórmula. Um zero observado é um resultado comum — uma categoria que nunca apareceu — e a diferença ao quadrado simplesmente fica grande, que é o que deve acontecer. Uma esperada zero não pode ser usada porque ela é o divisor, e o termo ficaria infinito: a previsão de que uma categoria nunca pode ocorrer não é uma previsão que este teste consiga pesar contra uma contagem. Se uma expectativa real é muito pequena em vez de zero, o teste a aceita, e a menor contagem esperada impressa abaixo do resultado é onde se vê se isso é um problema.
Onde está a tabela de valores críticos do qui-quadrado?
Não está nesta página, pelo mesmo motivo da página de valor p: o único valor que importa já está impresso, porque a estatística e os seus graus de liberdade determinam a área da cauda diretamente. Uma tabela também teria de ser construída para um nível de significância, então um leitor trabalhando a 1% estaria olhando uma tabela que contradiz o painel. A ferramenta de valor crítico é o lugar dessa consulta, e há mais uma razão pela qual esta página não poderia mostrar uma tabela nem em princípio: os seus graus de liberdade são k − 1, onde k é o número de categorias que o leitor digitou, então a linha aplicável da tabela não é conhecida antes das contagens.

Referências

Calculadoras relacionadas