Pular para o conteúdo principal
CalcMax

Calculadora de valor p

Mínimo: 1

Mínimo: 1

Resultado

4,9996%

Valor p

A Calculadora de valor p converte uma estatística de teste na probabilidade de observar um valor pelo menos tão extremo quanto o seu, se a hipótese nula for verdadeira. Ela atende às quatro estatísticas que sustentam a maior parte da estatística aplicada — z, t, qui-quadrado e F — e precisa apenas do valor da estatística de teste, dos graus de liberdade e de uma escolha de caudas. A escolha de caudas é a que mais se erra: duas caudas contam as duas direções, enquanto uma cauda conta somente o lado previsto. A saída é um único número, em porcentagem. O que a página deliberadamente não faz é julgar, porque o nível de significância é você quem traz.

Fórmula

cauda superior: p = P(T ≥ t) cauda inferior: p = P(T ≤ t) duas caudas: p = 2 · min( superior, inferior ) — somente distribuições simétricas

t
A estatística de teste que você já calculou — um z de uma amostra grande, um t de uma amostra pequena, um qui-quadrado de categorias contadas ou um F de uma razão entre duas variâncias. A página não calcula esse número; ela o converte
T
A distribuição que a estatística seguiria se a hipótese nula fosse verdadeira. Qual delas é vem do seletor de quatro opções, e a escolha não é preferência: usar a distribuição normal onde cabe um t deixa todo valor p pequeno demais
df
Os graus de liberdade — uma propriedade de como a estatística foi calculada, e não dos dados, e exigida por t, qui-quadrado e F. O F precisa de dois: os graus de liberdade do numerador, que é o número de grupos ou termos comparados, e os do denominador, que vêm do tamanho residual da amostra
α
O nível de significância, o limiar com que o valor p será comparado. Ele não é um campo desta página porque não faz parte do cálculo: pertence à decisão que você está prestes a tomar, e imprimir um veredito contra um padrão de 0,05 seria escolher esse limiar no seu lugar
p
A probabilidade da cauda, informada em porcentagem e não como decimal. Um valor p de 0,05 aparece como 5,0000, para que o número na tela possa ser comparado direto com um nível de significância citado, sem deslocar a vírgula antes

Use-a quando você já tem uma estatística e quer a probabilidade presa a ela — de um exercício de livro em que a estatística é dada, de um programa que imprimiu a estatística mas não o valor p, ou de uma conta feita à mão que você quer conferir. A escolha que mais importa é a das caudas, e a regra é fixada antes de ver os dados, não depois: use duas caudas quando qualquer direção contaria como afastamento da hipótese nula, que é o caso comum, e uma cauda só quando um resultado na direção oposta não teria interesse nenhum e você disse isso de antemão. A segunda escolha é a distribuição. Combine-a com a forma como a estatística foi construída, e não com o valor p que você espera: um z pertence a uma proporção ou a uma média de variância conhecida, um t a uma média cuja dispersão veio da mesma amostra pequena, um qui-quadrado a categorias contadas e um F a uma comparação de variâncias. Errar esse par é a maneira mais comum de uma aritmética correta produzir um número sem sentido.

Exemplos resolvidos

  1. Um z de 1,96, o limiar clássico de duas caudas

    1. Cauda superior: P(Z ≥ 1,96) = 0,025002, calculada a partir da distribuição normal padrão
    2. A curva normal é simétrica, então a cauda inferior é a mesma: P(Z ≤ −1,96) = 0,025002
    3. Duas caudas: 2 × 0,025002 = 0,050004
    4. Em porcentagem: 5,0000%, que é o 5% que todo mundo cita

    1,96 é o valor escolhido justamente para que isso dê 5%, e ver 4,9996 em vez de um 5,0000 redondo não é erro — o quantil verdadeiro é 1,959964, então o próprio 1,96 já é um arredondamento. Os três campos de graus de liberdade estão preenchidos e só o valor da estatística de teste e a escolha de caudas são lidos, porque o z não precisa de grau de liberdade nenhum: os dois campos que não são usados ficam sempre na tela, e um valor em branco ou sem uso neles não muda nada.

  2. Um t de 2,2281 com 10 graus de liberdade

    1. A distribuição t com 10 graus de liberdade tem caudas mais pesadas que a curva normal
    2. Cauda superior: P(T ≥ 2,2281) = 0,0250015
    3. Duas caudas: 2 × 0,0250015 = 0,050003, ou 5,0003%

    Compare com o exemplo do z e o sentido da distribuição t fica visível: a mesma área de cauda de 5% fica em 2,2281 e não em 1,96, porque uma amostra pequena precisa ir mais longe antes que a evidência seja tão incomum. Essa diferença é exatamente o que o tamanho da amostra controla — com 1.000 graus de liberdade o valor crítico de t é 1,962 e as duas distribuições são praticamente a mesma curva.

  3. Um qui-quadrado de 20 com três graus de liberdade, só a cauda superior

    1. A distribuição qui-quadrado não tem metade negativa, então aqui só a cauda superior está disponível
    2. P(χ² ≥ 20) com 3 graus de liberdade = 0,00016975
    3. Em porcentagem: 0,017%

    Esta é a estatística que a página do qui-quadrado produz a partir das contagens 30, 10, 20 e 40 contra uma expectativa uniforme. O valor p saiu pequeno — 0,017% —, então as quatro categorias não são igualmente prováveis. Repare no que falta e precisa ser pedido à parte: esta página diz o quão incomum é a estatística, e não diz nada sobre a menor contagem esperada, que é a checagem que decide se a aproximação pelo qui-quadrado era adequada desde o começo.

Limitações

Um valor p responde a uma pergunta estreita e é lido rotineiramente como se respondesse a várias outras que ele não responde. Ele não é a probabilidade de a hipótese nula ser verdadeira, nem a probabilidade de o resultado ter acontecido por acaso, nem uma medida do tamanho de um efeito — uma diferença trivial fica esmagadoramente significativa se a amostra for grande o bastante, e uma diferença importante pode ficar em p = 0,20 numa amostra de doze. Ele também vale o que vale o modelo por trás da estatística: as quatro distribuições daqui supõem observações independentes, e uma estatística calculada a partir de medidas agrupadas ou repetidas carrega menos observações independentes do que a fórmula acredita, o que deixa todo valor p informado para ela pequeno demais. Duas guardas são impostas em vez de deixadas para o leitor. Uma estatística negativa é recusada para o qui-quadrado e para o F, porque essas distribuições vivem na metade positiva da reta e um valor negativo significa que a estatística foi calculada errado. E um qui-quadrado ou um F de duas caudas é recusado, porque essas distribuições são assimétricas e não existe uma única convenção bilateral aceita para elas.

Perguntas frequentes

O que é um valor p?
A probabilidade de obter uma estatística de teste pelo menos tão extrema quanto a sua, supondo que a hipótese nula seja verdadeira e que o modelo por trás da estatística esteja certo. Ele descreve os dados, não a hipótese: um valor p pequeno diz que o resultado observado seria incomum se nada estivesse acontecendo, o que não é o mesmo que dizer que algo está acontecendo. O passo daí até uma conclusão passa por um nível de significância que você escolhe de antemão, mais tudo o que você sabe sobre o assunto e que não está nos números.
Devo usar uma cauda ou duas?
Duas, a menos que você tenha decidido o contrário antes de ver os dados e consiga dizer qual direção previu. Um teste de duas caudas conta um resultado em qualquer das direções como evidência contra a hipótese nula, o que corresponde à forma como a maioria das perguntas é de fato formulada: um medicamento que piora as coisas também é um achado. Testar com uma cauda é legítimo, mas corta o valor p pela metade, e escolher a cauda depois de olhar os dados é a maneira mais comum de fabricar um resultado significativo a partir do nada. Se você não tem certeza, use duas caudas — é a escolha conservadora e a que um revisor vai esperar.
Com que nível de significância o valor p deve ser comparado?
Com aquele que você fixou antes de coletar os dados — por convenção 0,05, mas a convenção é um hábito, não um resultado. Ele deliberadamente não é um campo aqui, e nenhum veredito é impresso, porque o mesmo valor p de 0,04 é uma descoberta num contexto e ruído em outro: rastrear dez mil genes atrás de um sinal, ou testar uma hipótese que uma década de trabalho anterior sustenta, pede limiares muito diferentes. A convenção que vale manter é que o nível seja escolhido de antemão e relatado junto com o valor p, em vez de ajustado depois que o número está na tela.
Por que não posso escolher duas caudas para o qui-quadrado ou o F?
Porque essas duas distribuições são assimétricas e não existe uma única forma aceita de torná-las bilaterais. A receita usual — dobrar a menor das caudas — se comporta mal justamente onde mais importa: num qui-quadrado de exatamente 0, que é um ajuste perfeito entre observação e expectativa e portanto o resultado menos significativo possível, ela devolve um valor p de 0%. Um ajuste perfeito informado como significância máxima não é um artefato de arredondamento, é uma resposta errada, e apareceria na tela com aparência totalmente normal. As duas caudas são inequívocas para uma distribuição simétrica, em que dobrar uma delas é exato, e para uma assimétrica somente a cauda superior responde à pergunta que de fato se faz: quão surpreendente é uma estatística deste tamanho?
Por que a página recusa uma estatística qui-quadrado ou F negativa?
Porque nenhuma das duas estatísticas pode ser negativa, então um valor negativo significa que o número veio de outro lugar que não o teste ao qual está sendo atribuído. As duas são construídas a partir de grandezas ao quadrado — o qui-quadrado a partir de diferenças ao quadrado entre contagens, o F a partir de uma razão entre duas variâncias — e uma grandeza ao quadrado nunca fica abaixo de zero. A página poderia devolver 100%, e seria aritmeticamente coerente, mas também aceitaria um valor calculado errado e o vestiria como resultado real. Recusar não custa nada aqui, porque não existe qui-quadrado negativo legítimo para a recusa bloquear.
Por que não há uma tabela de valores críticos nesta página?
Porque uma tabela de valores p teria de ser indexada pela estatística de teste, e a estatística pode ser qualquer número, então essa tabela precisaria de infinitas linhas. As tabelas impressas no fim dos livros funcionam ao contrário: algumas poucas linhas para os níveis de significância convencionais e colunas para os graus de liberdade que você pode precisar, e isso cabe numa página só porque os níveis de significância são poucos e acordados de antemão. Esta página avalia a área da cauda exatamente na estatística que você digitou, que é a única coisa que uma tabela não consegue fazer — uma tabela só sabe dizer se a sua estatística ficou acima ou abaixo dos valores que ela por acaso lista. A tabela mais próxima neste conjunto está na página do valor crítico, onde as linhas são os níveis de significância e as colunas dão o z correspondente. As duas páginas são o mesmo fato lido pelas duas pontas, e é por isso que cada uma delas aponta para a outra em primeiro lugar entre as ferramentas relacionadas.

Referências

Calculadoras relacionadas