Pular para o conteúdo principal
CalcMax

Calculadora de teste t

Mínimo: 0

Mínimo: 2

Mínimo: 0

Mínimo: 2

Resultado

1,0000

Estatística t

Valor p
34,6594%
Graus de liberdade
8
Erro padrão
1,0000

Uma calculadora de teste t executa o teste de média mais comum: ela transforma uma média, um desvio padrão e um tamanho de amostra numa estatística t, num valor p e nos graus de liberdade em que os outros dois são lidos. O modo de uma amostra compara uma média com um valor fixo — um alvo, uma especificação, uma média histórica. O modo de duas amostras compara dois grupos entre si, e a versão implementada aqui é o teste t de duas amostras com variância agrupada, que supõe que os dois grupos compartilham a mesma variância: os dois desvios padrão são combinados com pesos de n − 1, e essa variância agrupada única alimenta o erro padrão. A alternativa, o teste de Welch, dispensa a suposição de variâncias iguais e é o padrão mais seguro quando os grupos diferem em tamanho e em dispersão, mas os graus de liberdade dele saem fracionários e é outra conta; esta página faz o teste de variâncias iguais e diz isso, em vez de aproximá-lo em silêncio. O valor p é a área da cauda da distribuição t além da estatística, e ele é impresso em porcentagem.

Fórmula

t = (x̄ − μ₀) / (s / √n) t = (x̄₁ − x̄₂) / √(s_p²(1/n₁ + 1/n₂)) s_p² = ((n₁−1)s₁² + (n₂−1)s₂²) / (n₁ + n₂ − 2)

t
A estatística de teste — quantos erros padrão a média observada está distante do valor sendo testado. O sinal dela carrega a direção, e é por isso que um teste de uma cauda na direção errada devolve um valor p grande em vez de um erro: um t de −1 contra uma hipótese de cauda superior não é um efeito pequeno, é evidência apontando para o outro lado, e a área da cauda diz exatamente isso
x̄, μ₀
A média da amostra e o valor contra o qual ela está sendo testada, no modo de uma amostra. O numerador é a diferença entre os dois, então a estatística mede uma distância nas unidades dos dados — a mesma diferença conta muito menos se a dispersão for larga ou a amostra pequena, e é o denominador que fornece essa escala
s
O desvio padrão da amostra, estimado a partir dos dados em vez de conhecido de antemão. Essa estimação é a razão inteira de usar a distribuição t em vez da normal: a incerteza extra que ela introduz deixa as caudas mais pesadas, e são as caudas mais pesadas que o valor crítico de t leva em conta. Ele precisa ser maior que zero — uma amostra sem variação não tem denominador por onde dividir
n
O tamanho da amostra, que dá n − 1 graus de liberdade no modo de uma amostra. No teste de duas amostras os dois tamanhos somam um a mais que qualquer um deles sozinho: n₁ + n₂ − 2, porque a variância agrupada gasta um grau de liberdade na média de cada grupo antes de medir a dispersão em torno dela
s_p²
A variância agrupada — a média ponderada das variâncias dos dois grupos, cada uma pesada pelos próprios graus de liberdade. É aqui que entra a suposição de variâncias iguais: os dois grupos são tratados como duas amostras de uma única dispersão populacional, então um grupo com mais observações, ou com variância própria menor, contribui proporcionalmente para uma única estimativa compartilhada. Se as duas variâncias diferirem bastante, é o agrupamento que dá errado, e o teste de Welch é o conserto
p-value
A probabilidade de uma estatística pelo menos tão distante de zero, na direção que o teste pergunta, se as duas médias fossem realmente iguais. Duas caudas dobram a área além de |t|; as hipóteses de cauda superior e de cauda inferior ficam com uma cauda cada uma. Ele é informado aqui em porcentagem, então 5% é o familiar 0,05, e é uma afirmação sobre os dados dada a hipótese, e não sobre a hipótese dados os dados

Use-a quando você tem uma média e um desvio padrão de uma amostra e quer saber se a diferença em relação a um alvo, ou em relação a outro grupo, é maior do que o ruído de amostragem explicaria. O modo de uma amostra dá conta do caso em que o valor de comparação é um número fixo — uma máquina ajustada para encher 500 gramas, uma especificação de 5 mm, a média do ano passado —, e o modo de duas amostras dá conta do caso em que as duas grandezas foram medidas e nenhuma delas é privilegiada. Vale decidir duas coisas antes de ler a resposta. A primeira é uma cauda ou duas: um teste de duas caudas pergunta se os grupos diferem em qualquer direção e é o padrão correto, enquanto um teste de uma cauda faz uma pergunta direcional e deve ser escolhido porque a direção foi especificada de antemão, e não porque a resposta ficaria mais favorável. A segunda é a suposição de variâncias iguais, que o modo de duas amostras faz e não consegue verificar por você. A pista está no painel: se os dois desvios padrão que você digitou são próximos, agrupá-los custa pouco, e se diferem por um fator de dois ou mais o teste de Welch é o que você quer. Esta página calcula o teste com variância agrupada, que é aquilo que a maioria dos livros e da maioria dos estatísticos chama de teste t no caso de variâncias iguais, e informa os dois desvios padrão que você forneceu para que a suposição possa ser julgada em vez de assumida.

Exemplos resolvidos

  1. O padrão: uma média amostral de 6 contra um alvo de 5

    1. Erro padrão: s / √n = 3 / 3 = 1
    2. Estatística t: (6 − 5) / 1 = 1 — a média amostral está um erro padrão acima do alvo
    3. Graus de liberdade: n − 1 = 8
    4. Valor p bilateral: a área além de ±1 numa distribuição t com 8 graus de liberdade, que é 34,66%

    Uma diferença de uma unidade inteira soa grande até o erro padrão ser colocado ao lado dela: um erro padrão está bem dentro da faixa que o ruído de amostragem produz, e o valor p diz isso. A comparação com a curva normal é instrutiva — o mesmo t de 1 daria 31,7% se a distribuição fosse normal, e os três pontos extras são o preço de ter estimado o desvio padrão a partir de nove observações em vez de conhecê-lo.

  2. Uma estatística t de 2,306 dá exatamente 5%

    1. Erro padrão: 3 / √9 = 1, então a estatística t é a própria média
    2. Estatística t: (2,306 − 0) / 1 = 2,306
    3. O limite t bilateral de 95% com 8 graus de liberdade é 2,306
    4. Estar exatamente sobre o limite significa que o valor p bilateral é exatamente 5%

    Este é o par que a página do valor crítico produz na outra direção, e juntar os dois é a demonstração mais clara de que são um único fato lido pelas duas pontas. Peça a essa página o limite t bilateral de 95% com 8 graus de liberdade e ela devolve 2,306; coloque 2,306 nesta e o valor p volta exatamente em 5%. Nada no meio é arredondado — o número foi escolhido porque o desvio padrão de 3 e o tamanho de amostra de 9 fazem o erro padrão ser exatamente 1, e então a estatística e o limite são a mesma figura. Uma estatística um pouco abaixo dele cairia acima de 5%, e uma um pouco acima cairia abaixo de 5%.

  3. Dois grupos de dez com a mesma dispersão

    1. Variância agrupada: ((9 × 4) + (9 × 4)) / 18 = 72 / 18 = 4, então o desvio padrão agrupado é 2
    2. Erro padrão: √(4 × (1/10 + 1/10)) = √0,8 = 0,8944
    3. Estatística t: (5 − 4) / 0,8944 = 1,118
    4. Graus de liberdade: 10 + 10 − 2 = 18, dando um valor p bilateral de 27,83%

    Quando as duas variâncias são iguais o agrupamento não faz diferença — a variância agrupada dá 4, exatamente o valor que os dois grupos forneceram — e o erro padrão fica menor que o desvio padrão de cada grupo dividido pela própria √n. Comparar duas médias de dez é menos preciso do que estimar uma única média de dez — um erro padrão de 0,8944 contra 0,6325 —, porque duas grandezas incertas estão sendo subtraídas em vez de uma sendo medida, e esse custo só vale a pena quando a comparação responde a uma pergunta que uma amostra sozinha não responde. Repare que o campo da média da população está na tela e sem uso neste modo; as duas grandezas são medidas, então nenhuma delas é o alvo fixo.

  4. Dispersões e tamanhos desiguais, onde o agrupamento precisa ser vigiado

    1. Variância agrupada: ((9 × 4,41) + (11 × 3,24)) / 20 = (39,69 + 35,64) / 20 = 3,7665
    2. Erro padrão: √(3,7665 × (1/10 + 1/12)) = √0,6905 = 0,831
    3. Estatística t: (5,2 − 4,1) / 0,831 = 1,3237
    4. Graus de liberdade: 10 + 12 − 2 = 20

    A variância agrupada é 3,7665, que não é o ponto médio entre 4,41 e 3,24 — o grupo de doze pesa mais porque contribui com onze graus de liberdade contra os nove do grupo de dez. Essa ponderação é todo o conteúdo da palavra agrupada, e é por isso que a resposta não pode ser reproduzida tirando a média dos dois desvios padrão. As duas dispersões aqui são próximas o bastante para que a suposição de variâncias iguais fique confortável; um par como 2,1 e 0,6 com estes tamanhos de grupo não seria, e o teste de Welch daria um valor p visivelmente diferente.

  5. Um t de 1,96 vindo de 900 observações, onde t e z já convergiram

    1. Erro padrão: 3 / √900 = 3 / 30 = 0,1
    2. Estatística t: (5,196 − 5) / 0,1 = 1,96
    3. Graus de liberdade: 899
    4. Valor p bilateral: 5,0304% — um pouco acima de 5, e não exatamente em 5

    O famoso 1,96 dá 5% na curva normal e 5,0304% aqui, e a diferença entre os dois é o ponto do exemplo. Com 899 graus de liberdade a distribuição t é quase indistinguível da normal, mas não exatamente — ela ainda é um pouco mais pesada nas caudas, então a mesma estatística fica um pouco mais para fora. É também por isso que um t de 1,96 não é automaticamente significativo a 5% numa amostra grande, e por que um software que informa 0,0499 e um que informa 0,0501 podem discordar sobre o mesmo estudo na terceira casa decimal.

Limitações

O modo de duas amostras supõe que os dois grupos compartilham uma variância, e essa suposição está fazendo trabalho de verdade, não apenas arrumando a notação. Quando os tamanhos dos grupos são iguais, o teste com variância agrupada é razoavelmente robusto mesmo que as variâncias difiram, mas quando os tamanhos são desiguais e as variâncias também diferem, o teste pode errar seriamente nas duas direções — este é o problema de Behrens–Fisher, e o teste de Welch existe para resolvê-lo. Os dois desvios padrão estão no painel por esse motivo: compare-os antes de confiar no valor p, e se um for mais de aproximadamente o dobro do outro enquanto os tamanhos dos grupos diferem, o teste de variâncias iguais não é o que você quer. O modo de uma amostra não tem esse problema, mas supõe que as observações são independentes, o que falha em medições repetidas no mesmo indivíduo e em dados casados ou agrupados, onde é preciso um modelo pareado ou misto. Os dois modos supõem que os dados de fundo são aproximadamente normais, e ambos ficam menos sensíveis a isso conforme a amostra cresce — é o teorema central do limite que torna razoável um teste t sobre 900 observações assimétricas e questionável um teste t sobre 9. Por fim, a página informa uma estatística e um valor p, e nenhuma conclusão. Ela não tem um nível de significância com que comparar, e o número 0,05 é uma convenção e não um resultado, então a decisão fica onde deve ficar.

Perguntas frequentes

Esta página usa o teste t de duas amostras com variância agrupada ou o de Welch?
O com variância agrupada — o teste de variâncias iguais, com n₁ + n₂ − 2 graus de liberdade. O teste de Welch é a escolha melhor quando os dois grupos diferem em dispersão e em tamanho, e os dois campos de desvio padrão estão no painel justamente para você conferir: se um for mais de aproximadamente o dobro do outro e os tamanhos das amostras forem diferentes, Welch é o que você quer e esta página vai dar um valor p errado, às vezes bastante. A versão de variâncias iguais está implementada aqui porque é o teste dos livros didáticos, porque é o que um manual de referência chama de teste t de duas amostras para médias iguais, e porque os graus de liberdade inteiros dela mantêm a aritmética desta página exata em vez de aproximada.
Devo usar um teste de uma cauda ou de duas caudas?
De duas caudas, a menos que a direção tenha sido especificada antes de os dados serem vistos. Um teste de duas caudas pergunta se os grupos diferem de algum modo e reparte o nível de significância entre as duas pontas; um teste de uma cauda pergunta se um grupo é maior e coloca o nível inteiro naquela cauda, o que torna mais fácil atingir significância — exatamente duas vezes mais fácil no mesmo nível, já que 1,96 vira 1,645. Essa é uma escolha legítima quando a pergunta é de fato direcional, e é uma forma de caça ao resultado quando a direção foi escolhida depois de ver para que lado a diferença foi.
Qual é a diferença entre a estatística t e o valor p?
A estatística t mede a diferença em erros padrão e carrega o tamanho da amostra dentro dela, enquanto o valor p converte essa figura numa probabilidade usando a distribuição t nos graus de liberdade correspondentes. Então o t responde a quantos erros padrão de distância essas coisas estão, e o valor p responde com que frequência só a amostragem produziria uma distância deste tamanho. Os dois são informados porque o primeiro é comparável entre estudos com o mesmo desenho e o segundo é o que se compara com um nível de significância. Nenhum dos dois é o tamanho do efeito — uma amostra grande consegue fazer uma diferença trivial produzir um t grande e um valor p minúsculo.
Por que uma estatística t de 1,96 não dá exatamente 5%?
Porque 1,96 é o limite de 5% da curva normal, e a distribuição t é um pouco mais pesada nas caudas em qualquer grau de liberdade finito. Com 899 graus de liberdade um t de 1,96 dá 5,0304%, logo acima da linha; com 8 graus de liberdade a mesma estatística dá 8,57%. A distribuição t converge para a normal conforme os graus de liberdade crescem, e é a mesma curva o tempo todo — só o peso das caudas muda. É por isso que um software pode informar um valor p de 0,0499 onde uma conta à mão contra 1,96 diz significativo, e nenhum dos dois está errado.
O que significa uma estatística t negativa?
Que a média da amostra ficou abaixo do valor contra o qual ela está sendo testada, ou abaixo da média do segundo grupo no modo de duas amostras. O sinal é informação de direção e nada mais — o tamanho dele em relação à distribuição é do que o valor p é calculado. Num teste de duas caudas o sinal é descartado, porque qualquer dos extremos conta. Num teste de uma cauda ele importa e pode ser informativo: um t de −2,5 contra uma hipótese de cauda superior dá um valor p perto de 99%, o que não é um resultado nulo, e sim evidência apontando para o outro lado, e informá-lo como não significativo jogaria essa informação fora.
De quantas observações eu preciso para um teste t?
A página exige pelo menos duas por grupo, porque o desvio padrão de uma única observação é indefinido. Esse é um piso matemático, e não uma recomendação prática — um teste t com duas observações por grupo tem um grau de liberdade e quase nenhum poder de detectar qualquer coisa que não seja uma diferença enorme, e o valor p vai ser grande a menos que os dois grupos mal se sobreponham. A pergunta útil não é o mínimo que a fórmula permite, e sim o tamanho de amostra necessário para detectar a diferença que lhe interessa, o que depende da dispersão dos dados e do tamanho de efeito que você gostaria de notar; é na página do tamanho da amostra que essa conta mora, e ela trabalha para trás a partir de uma margem de erro, e não para frente a partir de um conjunto de dados.
Onde está a tabela de valores críticos de t?
Na página do valor crítico, e só lá neste conjunto — esta página não imprime uma porque ela teria de ser indexada pelos graus de liberdade além do nível de significância, o que dá uma página de livro por nível de significância em vez de uma tabela. É também por isso que a resposta é calculada aqui em vez de consultada: uma tabela só consegue listar os graus de liberdade que alguém escolheu imprimir, e os graus de liberdade que um teste de duas amostras produz, n₁ + n₂ − 2, quase nunca estão entre eles. O único limite que vale carregar na cabeça é que os valores de t convergem para 1,96 conforme a amostra cresce, então a tabela que você procura é a normal com uma penalidade atrelada que encolhe conforme os graus de liberdade sobem.

Referências

Calculadoras relacionadas