Calculadora de tamanho da amostra
Resultado
Tamanho de amostra necessário
- Valor crítico
- 1,9600
Uma calculadora de tamanho da amostra responde à pergunta que vem antes da pesquisa: quantas respostas são necessárias para atingir a margem de erro que você aceita? Informe um nível de confiança, uma margem de erro desejada e uma ideia aproximada da proporção que você espera encontrar, e ela devolve a menor amostra que cumpre esse alvo. A fórmula é a margem de erro virada do avesso — a mesma relação que a página da margem de erro aplica na outra direção, resolvida para o tamanho da amostra em vez de para a largura. Quando a pesquisa cobre uma população pequena, a correção de população finita encolhe a resposta, e para o quadro de funcionários de uma empresa ou para uma única escola ela encolhe bastante.
Fórmula
n₀ = z² · p (1 − p) / e² população pequena: n = n₀ / ( 1 + (n₀ − 1) / N )
- z
- O valor crítico do nível de confiança — 1,9600 a 95%, 1,6449 a 90% e 2,5758 a 99%. Ele aparece impresso numa linha própria porque é o único número da fórmula que vem do nível de confiança, e não das suas suposições sobre a população
- p
- A proporção que você espera encontrar, em decimal. É a única entrada que é um palpite, e ela entra como p(1 − p), que é máximo em p = 0,5 — então informar 50% é a suposição que produz a maior amostra e a mais segura
- e
- A margem de erro, em decimal — a meia largura que você aceita, na mesma unidade da proporção. Ela é elevada ao quadrado no denominador, e é por isso que dividi-la por dois quase quadruplica a amostra
- n₀
- O tamanho de amostra para uma população grande o bastante para que o tamanho dela não importe. É a resposta sempre que a população é desconhecida, e é a entrada da correção, e não a resposta final, quando não é
- N
- O tamanho da população, informado como 0 quando é desconhecido ou efetivamente ilimitado. A correção divide n₀ por um número maior que a fração n₀/N, então a amostra corrigida sai sempre abaixo de N — pedir mais gente do que existe não é um risco que esta fórmula consiga produzir
Use-a antes de coletar os dados, sempre que o custo da amostra for real: uma pesquisa com um incentivo por resposta, uma medição de laboratório com preço por amostra, um estudo clínico com meta de recrutamento. A ordem das decisões é esta: fixe a margem de erro com que você consegue conviver, fixe o nível de confiança, faça um palpite sobre a proporção e só então leia o tamanho da amostra. Apenas a primeira delas é um julgamento sobre o estudo; as outras duas são convenções ou palpites. Se a resposta não couber no orçamento, o movimento honesto é alargar a margem de erro e dizer isso no relatório, porque uma margem de erro que você não consegue financiar não é uma meta. Informe o tamanho da população sempre que ela for de fato pequena — abaixo de alguns milhares —, porque a correção é substancial nessa faixa e ignorá-la significa recrutar muito mais gente do que o estudo precisa.
Exemplos resolvidos
Uma pesquisa nacional com 95% de confiança e ±5 pontos
- Valor crítico a 95% de confiança: 1,96
- Com p = 0,5 o produto p(1 − p) é 0,25, o maior valor possível dele
- n₀ = 1,96² × 0,25 / 0,05² = 3,8416 × 0,25 / 0,0025 = 384,1459
- Arredondado para cima, para uma pessoa inteira: 385 respostas
385 é o número por trás da afirmação familiar de que uma pesquisa com cerca de mil pessoas acerta dentro de três pontos — aperte a margem para ±3 e a resposta vira 1.068, que é de onde esse número sai. O tamanho da população ficou em 0 porque uma pesquisa nacional é uma fração desprezível do país, e nessa razão a correção mudaria a resposta em menos de uma pessoa.
A mesma pesquisa com uma margem mais apertada, de ±3 pontos
- Valor crítico inalterado em 1,96, porque o nível de confiança não mudou
- n₀ = 1,96² × 0,25 / 0,03² = 0,9604 / 0,0009 = 1.067,0719
- Arredondado para cima: 1.068 respostas
- Compare com 385: a margem encolheu por um fator de 1,667 e a amostra cresceu por um fator de 2,78, que é 1,667²
A precisão é comprada ao quadrado. Sair de ±5 para ±3 pontos não é um aumento de 67% no trabalho, e sim de 178%, porque a margem de erro está elevada ao quadrado no denominador. A consequência prática é que existe um piso para o quão precisa uma pesquisa consegue ser sem ficar caríssima, e que anunciar uma margem mais apertada que cerca de ±3 pontos significa uma amostra na casa dos milhares — que é justamente a faixa em que o viés de não resposta começa a pesar mais do que o erro amostral que a fórmula está controlando.
Uma pesquisa interna numa empresa com 1.000 funcionários
- O número sem correção continua sendo 384,1459, já que ele ainda não sabe da população
- Correção: 384,1459 / ( 1 + 383,1459 / 1.000 ) = 384,1459 / 1,3831459 = 277,73
- Arredondado para cima: 278 funcionários
- Isso é 28% do quadro de funcionários, e não os 38% que o número sem correção teria sugerido
A correção é o que torna a pesquisa em população pequena viável: 278 em vez de 385, uma economia de mais de cem entrevistas pela mesma margem declarada. Ela cresce conforme a amostra vira uma fatia maior da população. Com 100 funcionários a resposta é 80 — você não consegue amostrar mais gente do que existe —, e com um milhão de funcionários a correção vale uma única pessoa, que é por que informar 0 para uma população desconhecida é um padrão razoável, e não um atalho.
Limitações
A fórmula dimensiona uma amostra de respostas, não uma lista de convites. Se um terço das pessoas convidadas não responder, 385 respostas significam convidar cerca de 580, e se quem responde difere sistematicamente de quem não responde, nenhum tamanho de amostra conserta o viés resultante — ele só faz o erro amostral ficar menor do que o erro total. O modelo também supõe que cada resposta é um sorteio independente da população, o que falha em desenhos por conglomerados: uma pesquisa com 400 estudantes tirados de 8 turmas tem uma amostra efetiva muito mais próxima de 8, e o número desta página deve ser multiplicado por um efeito de desenho antes de ser usado. A estimativa é para uma única proporção; uma média exige um desvio padrão em vez disso, que esta página não recebe, e uma pesquisa que será aberta em subgrupos precisa de uma amostra dimensionada para o menor subgrupo, e não para o conjunto. Por fim, os três níveis de confiança oferecidos são convenções, e nenhum deles leva em conta as diversas comparações que uma análise real costuma fazer.
Perguntas frequentes
- De quantas respostas de pesquisa eu preciso?
- Para os convencionais ±5 pontos percentuais a 95% de confiança, 385 — e 1.068 se você quiser ±3 pontos. Esses dois números cobrem a grande maioria das pesquisas publicadas, e supõem uma população grande o bastante para que o tamanho dela seja irrelevante. Se a população é pequena a ponto de você conseguir ouvir uma boa parte dela, informe o tamanho e a correção vai baixar o número: 1.000 funcionários precisam de 278 respostas em vez de 385, e 200 funcionários precisam de 132. Ancore primeiro na margem de erro, porque é esse o número que o seu público de fato vai ler.
- Por que a proporção esperada vem 50% por padrão?
- Porque p(1 − p) é máximo em p = 0,5, e o tamanho da amostra é proporcional a ele, então informar 50% dá a maior resposta que qualquer proporção poderia exigir. Isso faz de 50% a suposição segura quando você genuinamente não sabe: uma pesquisa que voltar com 60% terá uma margem de erro um pouco melhor do que a que você planejou. Ser mais específico compensa — com p = 90% o termo cai de 0,25 para 0,09, então a mesma margem de erro precisa de 36% da amostra. Só use um valor diferente de 50% se você tiver uma expectativa defensável, como uma onda anterior da mesma pesquisa.
- O que a correção de população finita faz?
- Ela encolhe a amostra quando a população é pequena o bastante para que sortear dela sem reposição reduza a incerteza de forma mensurável. O efeito depende de que fatia da população você está amostrando: com 10% a correção vale alguns por cento da amostra, com 28% vale cerca de um quarto e com 50% vale quase um terço. Informe 0 no tamanho da população quando ele for desconhecido ou muito grande, e informe o número real quando a população estiver abaixo de alguns milhares — é este o campo que com mais frequência muda uma resposta que a pessoa já tinha calculado.
- Que margem de erro e que nível de confiança eu devo buscar?
- ±5 pontos a 95% é o padrão na maior parte do que se publica, ±3 pontos quando uma decisão depende de um resultado apertado, e ±10 pontos para trabalho exploratório em que só uma diferença grande importa. Quanto ao nível de confiança, 95% é a convenção e 99% custa cerca de 73% mais amostra para um intervalo só um terço mais estreito. Antes de apertar qualquer um dos dois, veja quanto custa a resposta: ±3 pontos a 99% de confiança precisa de 1.843 respostas, mais ou menos cinco vezes o padrão. Se isso não couber no orçamento, relate a margem mais larga em vez de recrutar uma amostra que você não consegue completar.
- Por que a resposta é arredondada para cima, para uma pessoa inteira?
- Porque o número fracionário é a aritmética exata e um número inteiro é o que dá para recrutar, e as duas convenções para transformar um no outro apontam em direções opostas. Arredondar para o mais próximo poderia arredondar 384,1459 para baixo, para 384, e aí a margem de erro alvo seria perdida por um fio — e o alvo é justamente o que você pediu. Arredondar para cima garante que a margem seja atingida ou superada, custa no máximo uma entrevista a mais e é como os tamanhos de amostra são especificados num protocolo, em que 385 é um compromisso e 384,1459 é um valor intermediário.
- Por que não há uma tabela de tamanhos de amostra nesta página?
- Porque a tabela que se quer aqui é uma grade de nível de confiança contra margem de erro, e essa grade é o que o painel já calcula. Uma tabela impressa a 95% fixos contradiria o painel no instante em que você mudasse para 99%, e a página discordar de si mesma é pior do que não ter tabela — a pessoa teria de decidir em qual dos dois números acreditar. O segundo motivo é que a tabela teria de escolher também uma proporção, e 50% só é a escolha certa enquanto continuar sendo o padrão seguro. Mude o nível de confiança, a margem de erro, a proporção ou o tamanho da população e a resposta se recalcula, que é todo o conteúdo da tabela que se está procurando.
Referências
- 3.1 Terminology — Introductory Statistics 2e (relative frequency approaching probability as a sample grows, which is the property that makes a target margin of error meaningful in advance) — OpenStax (Rice University)
- 1.3.6.1. What is a Probability Distribution — e-Handbook of Statistical Methods (the distribution of an estimate, which is what the margin of error is a quantile of) — National Institute of Standards and Technology (NIST)
- 1.3.6.7.1. Cumulative Distribution Function of the Standard Normal Distribution — e-Handbook of Statistical Methods (the cumulative function the critical values come from; the same values, used in reverse here to size a sample rather than to bound an estimate) — National Institute of Standards and Technology (NIST)