Calculadora de erro padrão
Resultado
Erro padrão
- Desvio padrão
- 2,1381
- Média
- 5,0000
- Contagem
- 8
Uma calculadora de erro padrão obtém o erro padrão da média ou de uma proporção, conforme os dados que você tem. No modo de média ela recebe a própria amostra — uma lista de números — e devolve o desvio padrão, a contagem e o erro padrão, que é o desvio padrão dividido por √n. No modo de proporção não há lista de onde partir: a variabilidade de uma pergunta de sim ou não decorre da própria porcentagem, então a página recebe o tamanho da amostra e a porcentagem, calcula o desvio padrão como √(p(1 − p)) × 100 e divide pela mesma √n. Os dois modos chegam assim à mesma grandeza pelo mesmo caminho, e as quatro linhas mostram a cadeia inteira em vez de só o fim dela. O que a página não consegue dizer é se o número que você está vendo é estável: isso depende do tamanho da amostra.
Fórmula
SE = s / √n s = √( Σ(xᵢ − x̄)² / (n − 1) ) s = √(p(1 − p)) × 100
- SE
- O erro padrão — o desvio padrão da estimativa, e o resultado principal da página. Ele responde a uma pergunta sobre a estimativa, e não sobre os dados: a que distância uma média amostral costuma ficar da média da população se a amostragem for repetida. É o número a partir do qual um intervalo de confiança é construído e pelo qual uma estatística de teste é dividida, e é por isso que vale calculá-lo sozinho
- s
- O desvio padrão da amostra, com denominador n − 1. É dele que o erro padrão é derivado no modo de média, e ele é impresso numa linha própria para que a divisão possa ser conferida. O n − 1 em vez de n é o que faz dele uma estimativa não viesada da dispersão da população — usar n subestimaria a variabilidade um pouco, e a subestimação é maior justamente onde as amostras são menores
- n
- Quantas observações a amostra tem — a contagem, também impressa numa linha própria. Ele aparece dentro de uma raiz quadrada, e é por isso que o erro padrão encolhe devagar: dez vezes mais dados compram um erro padrão cerca de três vezes menor. No modo de proporção este é o campo de tamanho da amostra, e não uma contagem vinda de uma lista, porque uma porcentagem não traz lista nenhuma consigo
- x̄
- A média amostral, impressa para que a aritmética do desvio padrão tenha um centro visível. Ela não participa do erro padrão em si — o erro padrão é uma propriedade da dispersão e do tamanho da amostra, não de onde os dados estão —, e é por isso que um conjunto de dados pode ser deslocado por qualquer constante e deixar o erro padrão inalterado
- p
- A proporção da amostra, como fração na fórmula e como porcentagem no painel. No modo de proporção ela substitui o desvio padrão por completo: numa pergunta de sim ou não a variabilidade é função da porcentagem, máxima quando a divisão é meio a meio e encolhendo até nada conforme a porcentagem se aproxima de 0 ou de 100. O × 100 converte o resultado de volta para pontos percentuais, para que ele possa ser lido ao lado da porcentagem de onde veio
Use-a quando você tem os dados em mãos e quer o erro padrão de uma estimativa — para montar um intervalo de confiança à mão, para conferir um número de um relatório ou para ver quanto da largura de um resultado vem da dispersão dos dados e quanto vem do tamanho da amostra. Imprimir o desvio padrão e a contagem ao lado torna essa divisão de trabalho visível: mude os dados e a linha do desvio padrão se move; mude apenas o tamanho da amostra e a linha do erro padrão se move enquanto o desvio padrão fica parado. Os dois modos existem porque as duas estimativas mais comuns precisam de entradas diferentes. Uma média precisa da amostra, já que nada prevê quão espalhadas as medições vão estar; uma proporção não precisa, já que a dispersão dela decorre do próprio valor, e é por isso que pesquisas conseguem citar uma margem de erro a partir só do tamanho da amostra. Nenhum dos dois modos verifica se a amostra é grande o bastante para a estimativa ser aproximadamente normal. Isso depende de quão assimétrica é a distribuição de fundo, e para o modo de proporção existe uma regra prática mais específica sobre n·p e n·(1 − p) que a página não impõe.
Exemplos resolvidos
O padrão: oito números com desvio padrão de aproximadamente 2,14
- Contagem: oito números. Média: (2 + 4 + 4 + 4 + 5 + 5 + 7 + 9) / 8 = 40 / 8 = 5
- Os desvios quadráticos em relação a 5 somam 32, então a variância da amostra é 32 / 7 = 4,5714
- Desvio padrão: √4,5714 = 2,1381
- Erro padrão: 2,1381 / √8 = 2,1381 / 2,8284 = 0,7559
Os números se espalham dos dois lados do 5 sem nenhum deles muito longe, e é isso que faz deste um padrão útil: a média é um número redondo e o desvio padrão não é, então as duas últimas linhas não podem ser confundidas uma com a outra. Ler o painel de cima para baixo é o ponto — 2,1381 é um fato sobre os dados e 0,7559 é um fato sobre a estimativa, e a única coisa entre os dois é a divisão por √8. Os campos de tamanho da amostra e de porcentagem ficam sem uso neste modo.
Nove números escolhidos para dar erro padrão exatamente 1
- Média: (3 × 4 + (−3) × 4 + 0) / 9 = 0
- Desvios quadráticos: quatro 9, quatro 9 e um 0, somando 72
- Variância da amostra: 72 / 8 = 9, então o desvio padrão é 3
- Erro padrão: 3 / √9 = 3 / 3 = 1
Nove observações é pouco o suficiente para que o denominador n − 1 importe de forma visível: dividir por 9 em vez de por 8 daria uma variância de 8 e um desvio padrão de 2,8284, e o erro padrão sairia em 0,9428 em vez de 1. É a correção fazendo o trabalho dela — com uma amostra pequena a dispersão observada subestima um pouco a da população, e dividir por um a menos que a contagem corrige isso. O par n = 9 e s = 3 é o mesmo que a página do intervalo de confiança usa, e o intervalo dela dá exatamente ±2,306 porque o valor de t com 8 graus de liberdade é 2,306.
Uma proporção não precisa de lista de dados
- Proporção como fração: 60% = 0,6
- Desvio padrão em pontos percentuais: √(0,6 × 0,4) × 100 = 0,4899 × 100 = 48,9898
- Erro padrão: 48,9898 / √100 = 48,9898 / 10 = 4,899
- A lista de dados é ignorada por completo — a linha da contagem informa o campo de tamanho da amostra em vez disso
O campo de dados continua na tela e continua guardando uma lista, e nada na resposta usa essa lista: neste modo a variabilidade vem da porcentagem, e o tamanho da amostra vem do campo próprio. É por isso que a linha do desvio padrão traz 48,99 — um número de aparência estranha para uma pergunta binária. Ele é o desvio padrão de uma variável de sim ou não codificada como 0 e 100, e sua única função aqui é ser dividido por √n. A mesma estrutura aparece na página do tamanho da amostra, onde o pior caso p = 0,5 é usado para planejar um estudo antes de qualquer porcentagem ser conhecida.
Duas observações, onde o denominador n − 1 trabalha mais
- Média: 5
- Desvios quadráticos: 25 e 25, somando 50
- Variância da amostra: 50 / 1 = 50, então o desvio padrão é √50 = 7,0711
- Erro padrão: 7,0711 / √2 = 7,0711 / 1,4142 = 5
Com duas observações o desvio padrão é simplesmente metade da distância entre elas — o denominador n − 1 deixa um único grau de liberdade, e a fórmula se reduz a algo que dá para ver em vez de calcular. O erro padrão é então o desvio padrão dividido por √2, que dá 5 aqui. Esta é a menor amostra que a página aceita no modo de média, e vale a pena tentar uma vez para ver quão larga é de fato uma estimativa vinda de dois números: o erro padrão sai na metade da amplitude dos dados.
Limitações
A página informa o erro padrão da estimativa e para antes de transformá-lo num intervalo ou num teste. Essa fronteira é deliberada: um intervalo precisa de um valor crítico, que depende de um nível de confiança e de a dispersão ter ou não sido estimada a partir da amostra, e um teste precisa de uma segunda estatística para comparar. Os dois estão nas páginas vizinhas, e a aritmética daqui é a entrada de ambos, e não um substituto de nenhum deles. O modo de média supõe que as observações são independentes, o que falha em medições repetidas no mesmo indivíduo, em pares casados e em dados agrupados como estudantes dentro de escolas; nos três casos o tamanho de amostra efetivo é menor que a contagem e o erro padrão sai pequeno demais. Ele também supõe que a lista contém todas as observações que você pretendia incluir — o erro padrão é calculado a partir do que estiver digitado, e deixar um valor atípico de fora por acidente o estreita. O modo de proporção carrega uma ressalva própria: a fórmula dele é uma aproximação de amostra grande que se comporta mal quando a contagem de sucessos ou de fracassos é pequena, então uma porcentagem perto de 0 ou de 100 vinda de uma amostra modesta é melhor servida por um intervalo exato do que por este erro padrão. Nenhum dos dois modos julga se a estimativa é viesada, e nenhum erro padrão consegue detectar isso.
Perguntas frequentes
- Qual é a diferença entre desvio padrão e erro padrão?
- O desvio padrão descreve a que distância os valores individuais ficam da média deles; o erro padrão descreve a que distância uma média amostral fica da média da população. O segundo é o primeiro dividido por √n, e essa divisão é toda a relação — e é por isso que os dois são impressos. O desvio padrão é uma propriedade dos dados e não muda conforme você coleta mais, enquanto o erro padrão continua encolhendo conforme a amostra cresce. Uma conferência útil no painel: altere os números e as duas linhas se movem; mude só a contagem e o desvio padrão fica onde estava enquanto o erro padrão cai.
- Por que a página divide por n − 1 em vez de n?
- Porque a própria média da amostra é usada como centro ao medir a dispersão, e essa média fica mais perto dos dados do que a média verdadeira da população — então a média ingênua dos desvios quadráticos é sistematicamente um pouco pequena demais. Dividir por um a menos que a contagem corrige isso. O efeito é maior em amostras pequenas: com duas observações ele dobra a variância, e com cem observações é um ajuste de 1%. Dividir por n não está errado para descrever a amostra que você tem; está errado para estimar a dispersão da população de onde ela veio, que é para o que serve um erro padrão.
- Como calcular o erro padrão de uma proporção sem nenhum dado?
- A proporção fornece a própria variabilidade, então nenhuma lista é necessária — apenas o tamanho da amostra e a porcentagem. Codifique os dois resultados como 0 e 100 e o desvio padrão dá √(p(1 − p)) × 100, que é máximo quando a divisão é meio a meio e encolhe em direção a zero conforme a porcentagem se aproxima de qualquer das pontas. Para 60% de 100 pessoas isso é √(0,6 × 0,4) × 100 = 48,9898, e dividir por √100 dá um erro padrão de 4,899 pontos percentuais. É o mesmo par de entradas que a página da margem de erro usa, onde o erro padrão é multiplicado por um valor crítico para dar um mais ou menos.
- O erro padrão fica menor conforme eu adiciono mais dados?
- Fica, mas só na proporção da raiz quadrada do tamanho da amostra. Sair de 100 observações para 400 corta o erro padrão pela metade; conseguir outro corte pela metade custa 1.600. É por isso que o erro padrão é o número a acompanhar ao planejar um estudo, e por que a melhora de uma amostra muito grande sobre uma apenas grande é fácil de superestimar. A linha do desvio padrão, em contraste, fica mais ou menos onde está — mais dados não tornam a população de fundo menos variável, apenas tornam mais preciso o palpite sobre o centro dela.
- O que significa um erro padrão de 0?
- Ou que todas as observações da amostra eram idênticas, ou que a proporção era 0% ou 100% — nos dois casos a fórmula não encontra variação com que trabalhar e devolve zero. Lido ao pé da letra, um erro padrão de zero diz que a estimativa é exata, e essa é uma afirmação que os dados não sustentam: uma amostra de quatro leituras idênticas é evidência de que a dispersão é pequena, não prova de que ela é zero. A página devolve o zero em vez de um erro, porque a aritmética está correta e o motivo está visível nas outras linhas, mas um erro padrão exatamente zero deve ser tratado como sinal de que a amostra é pequena ou uniforme demais para dizer qualquer coisa sobre variabilidade.
- Isto é a mesma coisa que a calculadora do teorema central do limite?
- As duas calculam a mesma grandeza a partir de entradas diferentes, e qual delas você quer depende do que você tem. Esta página recebe a amostra — uma lista de números, ou uma porcentagem e um tamanho — e é a que se usa quando os dados já estão em mãos. A página do teorema central do limite recebe o desvio padrão da população e um tamanho de amostra, os valores que existem antes de qualquer coleta, e é a que se usa ao planejar um estudo ou ao ver como o erro padrão responde a n. As duas diferem exatamente pelo passo de estimação no meio, e é por isso que os resultados delas coincidem sempre que o desvio padrão da amostra por acaso for igual ao valor da população.
Referências
- 1.3.5.6. Measures of Scale — e-Handbook of Statistical Methods (the sample standard deviation and the n − 1 denominator the standard error is built from) — National Institute of Standards and Technology (NIST)
- 1.3.6.1. What is a Probability Distribution — e-Handbook of Statistical Methods (the sampling distribution of a statistic, whose spread is what the standard error measures) — National Institute of Standards and Technology (NIST)
- 1.3.5.1. Measures of Location — e-Handbook of Statistical Methods (the sample mean printed alongside the spread, and why the two are reported together) — National Institute of Standards and Technology (NIST)