Stichprobengröße-Rechner
Ergebnis
Benötigter Stichprobenumfang
- Kritischer Wert
- 1,9600
Der Rechner für den Stichprobenumfang beantwortet die Frage, die vor jeder Erhebung steht: Wie viele Antworten braucht es, damit die Fehlermarge eingehalten wird, die Sie zulassen können? Geben Sie das Konfidenzniveau, die angestrebte Fehlermarge und eine grobe Schätzung des erwarteten Anteils an, und Sie erhalten den kleinsten Stichprobenumfang, der dieses Ziel erfüllt. Die Formel ist die Fehlermarge in umgekehrter Richtung – dieselbe Beziehung, die auch hinter dem Konfidenzintervall steht, nur nach dem Umfang statt nach der Breite aufgelöst. Ist die Grundgesamtheit klein, etwa ein Unternehmen oder eine Schule, senkt die Endlichkeitskorrektur die Antwort spürbar.
Formel
n₀ = z² · p (1 − p) / e² kleine Grundgesamtheit: n = n₀ / ( 1 + (n₀ − 1) / N )
- z
- Der kritische Wert zum gewählten Konfidenzniveau – 1,9600 bei 95 %, 1,6449 bei 90 % und 2,5758 bei 99 %. Er steht in einer eigenen Zeile, weil er die einzige Zahl der Formel ist, die das Konfidenzniveau festlegt und nicht eine Annahme über die Grundgesamtheit
- p
- Der Anteil, den Sie erwarten, als Dezimalzahl. Er ist die einzige Eingabe, die geschätzt wird, und er geht als p(1 − p) in die Rechnung ein; dieses Produkt ist bei p = 0,5 am größten, ein Anteil von 50 % liefert also den größten Stichprobenumfang und ist damit die vorsichtigste Annahme
- e
- Die Fehlermarge als Dezimalzahl – die halbe Breite des Bereichs, die Sie zulassen, in derselben Einheit wie der Anteil. Sie steht im Nenner und wird dort quadriert, eine Halbierung der Fehlermarge vervierfacht den Stichprobenumfang also ungefähr. Im Panel wird sie in Prozentpunkten eingetragen (5 für ±5 Prozentpunkte), in der Formel steht dafür 0,05
- n₀
- Der Stichprobenumfang, wenn die Grundgesamtheit so groß ist, dass ihre Größe keine Rolle spielt. Bei unbekannter Grundgesamtheit ist das bereits die Antwort; ist die Grundgesamtheit bekannt, ist es nur die Eingabe für die Korrektur und noch nicht das Endergebnis
- N
- Die Zahl der Personen in der Grundgesamtheit, bei unbekannter oder praktisch unendlicher Grundgesamtheit 0. Die Korrektur teilt n₀ durch einen Wert, der etwas größer ist als n₀/N; der korrigierte Umfang liegt deshalb immer unterhalb von N – mehr Personen zu befragen, als es überhaupt gibt, kann diese Formel nicht liefern
Vor der Erhebung, sobald der Stichprobenumfang wirklich kostet – jede Antwort in einer Umfrage, die vergütet wird, jedes nach Stück abgerechnete Experiment, jede klinische Studie mit Rekrutierungsziel. Die Reihenfolge der Entscheidungen ist: erst die Fehlermarge festlegen, die Sie zulassen können, dann das Konfidenzniveau, dann einen Anteil schätzen, dann den Umfang ablesen. Von diesen drei Dingen ist nur das erste eine inhaltliche Entscheidung über die Untersuchung, die anderen beiden sind Konvention oder Vermutung. Ist die Antwort nicht bezahlbar, ist der ehrliche Weg, die Fehlermarge zu vergrößern und das im Bericht zu sagen, denn eine Fehlermarge, die Sie sich nicht leisten können, ist kein Ziel. Bei einer wirklich kleinen Grundgesamtheit, bis zu einigen tausend Personen, tragen Sie deren Umfang unbedingt ein: Die Korrektur ist dort erheblich, und sie zu übergehen bedeutet, weit mehr Personen rekrutieren zu müssen als die Untersuchung braucht.
Rechenbeispiele
Bundesweite Umfrage mit 95 % Konfidenzniveau und ±5 Prozentpunkten
- Kritischer Wert zum 95-%-Niveau: 1,9600
- p(1 − p) bei einem Anteil von 50 %: 0,5 × 0,5 = 0,25
- n₀ = 1,96² × 0,25 / 0,05² = 3,8416 × 0,25 / 0,0025 = 0,9604 / 0,0025 = 384,1459
- Keine Grundgesamtheit angegeben (0), 384,1459 ist also die Antwort vor dem Aufrunden – aufgerundet 385 Personen
Die 385 ist der bekannteste Wert dieser Seite: Sie steckt hinter dem Satz, dass eine Umfrage mit rund 1.000 Befragten auf etwa ±3 Prozentpunkte genau ist. Zu beachten ist, dass die Fehlermarge hier in Prozentpunkten eingetragen wird, also als 5 und nicht als 0,05 – das Feld sagt es im Namen, und wer 0,05 einträgt, bekommt einen Stichprobenumfang von über neun Millionen, der auf dem Bildschirm völlig normal aussieht.
Dieselbe Umfrage, die Fehlermarge auf ±3 Prozentpunkte verschärft
- Der kritische Wert bleibt 1,9600 – an der Stichprobe hat sich nichts geändert
- n₀ = 1,96² × 0,25 / 0,03² = 0,9604 / 0,0009 = 1.067,0719
- Aufgerundet 1.068 – das ist das übliche Maß einer Wahlumfrage
Der Vergleich mit dem ersten Kasten ist die wichtigste Lektion dieser Seite: Die Fehlermarge wird im Nenner quadriert, deshalb kostet die Verkleinerung von ±5 auf ±3 nicht 60 % mehr Aufwand, sondern das (1/0,6)²-fache. Von 385 auf 1.068 sind es 2,8-mal so viele Antworten für einen um zwei Fünftel kleineren Fehler.
Mitarbeiterbefragung in einem Unternehmen mit 1.000 Beschäftigten
- Ohne Korrektur wären es wieder 384,1459
- Endlichkeitskorrektur: 384,1459 / (1 + (384,1459 − 1) / 1.000) = 384,1459 / 1,3831 = 277,7401
- Aufgerundet 278 Personen – und das ist mehr als ein Viertel der Belegschaft
Der Unterschied zwischen 385 und 278 ist die Endlichkeitskorrektur, und sie ist hier keine Feinheit: Sobald ein großer Teil der Grundgesamtheit befragt wird, trägt die Ziehung ohne Zurücklegen zusätzliche Information, und der nötige Umfang sinkt. Dieses Feld ist zugleich das, das eine fertige Antwort am leichtesten umwirft – wer 1.000 stehen lässt, obwohl es 500 sind, bekommt eine andere Zahl. Die 0 darin bedeutet ausdrücklich »Grundgesamtheit unbekannt oder sehr groß« und nicht »Grundgesamtheit leer«.
Einschränkungen
Die Formel berechnet die Zahl der Antworten und nicht die Zahl der Einladungen. Wenn ein Drittel der Angesprochenen nicht antwortet, bedeuten 385 Antworten rund 580 versandte Einladungen; und wenn sich die Antwortenden systematisch von den Nichtantwortenden unterscheiden, ist diese Verzerrung durch keinen noch so große Stichprobenumfang zu beheben – ein größerer Umfang macht nur den Stichprobenfehler kleiner als den Gesamtfehler. Die Formel setzt außerdem voraus, dass jede Antwort unabhängig aus der Grundgesamtheit gezogen wird, was bei einer Klumpenstichprobe nicht gilt: 400 Schülerinnen und Schüler aus 8 Klassen sind eher 8 unabhängige Beobachtungen, und wer mit dieser Seite rechnet, muss den Wert zuvor mit einem Designeffekt multiplizieren. Die Schätzung gilt für einen einzelnen Anteil; für einen Mittelwert bräuchte man die Standardabweichung, die diese Seite nicht abfragt; und eine Umfrage, die in Untergruppen ausgewertet werden soll, muss ihren Umfang an der kleinsten Untergruppe ausrichten und nicht an der Gesamtheit. Die drei Konfidenzniveaus im Panel sind zuletzt alle Konvention, und keines von ihnen deckt die mehrfachen Vergleiche ab, die eine echte Auswertung üblicherweise mit sich bringt.
Häufige Fragen
- Wie viele Antworten braucht eine Umfrage überhaupt?
- Bei der üblichen Konvention von 95 % Konfidenzniveau und ±5 Prozentpunkten lautet die Antwort 385, für ±3 Prozentpunkte 1.068. Diese beiden Zahlen decken die weit überwiegende Zahl der veröffentlichten Umfragen ab, und beide setzen voraus, dass die Grundgesamtheit so groß ist, dass ihre Größe keine Rolle spielt. Ist sie klein genug, dass Sie einen erheblichen Teil davon befragen können, tragen Sie die Zahl ein, und die Korrektur senkt den Wert: Bei 1.000 Beschäftigten braucht es 278 Antworten statt 385, bei 200 Beschäftigten 132. Legen Sie zuerst die Fehlermarge fest, denn sie ist die Zahl, auf die die Leserinnen und Leser tatsächlich schauen.
- Warum ist der erwartete Anteil mit 50 % vorbelegt?
- Weil p(1 − p) bei p = 0,5 am größten ist und der Stichprobenumfang dazu proportional ist; 50 % liefert also den größten Umfang, den irgendein Anteil erfordern kann. Das macht diesen Wert zur vorsichtigen Annahme für den Fall, dass Sie es wirklich nicht wissen: Kommt die Umfrage bei 60 % heraus, ist die tatsächliche Fehlermarge sogar etwas besser als geplant. Eine genauere Schätzung zahlt sich aus – bei p = 90 % fällt dieser Term von 0,25 auf 0,09, und derselbe Fehler braucht nur noch 36 % des Umfangs. Tragen Sie einen anderen Wert nur ein, wenn Sie eine belastbare Vorinformation haben, etwa die vorige Welle derselben Umfrage.
- Was macht die Endlichkeitskorrektur?
- Sie senkt den nötigen Umfang, wenn die Grundgesamtheit so klein ist, dass das Ziehen ohne Zurücklegen die Unsicherheit spürbar verringert. Wie viel sie bewirkt, hängt davon ab, welchen Anteil der Grundgesamtheit Sie ziehen: Bei 10 % der Grundgesamtheit ist sie wenige Prozent wert, bei 28 % ein Viertel, bei der Hälfte fast ein Drittel. Tragen Sie 0 ein, wenn die Grundgesamtheit unbekannt oder sehr groß ist, und die tatsächliche Zahl, wenn sie unter einigen tausend liegt – dieses Feld ist das, das eine bereits fertige Antwort am leichtesten umwirft.
- Wie sollten Fehlermarge und Konfidenzniveau gewählt werden?
- Die große Mehrheit der veröffentlichten Untersuchungen arbeitet mit 95 % Konfidenzniveau und ±5 Prozentpunkten, ±3 Prozentpunkte dort, wo es auf feine Unterschiede ankommt, und ±10 Prozentpunkte in explorativer Arbeit, in der nur große Unterschiede zählen. Auf der Seite des Konfidenzniveaus ist 95 % Konvention; 99 % kostet etwa 73 % mehr Umfang und liefert dafür einen nur um ein Drittel schmaleren Bereich. Sehen Sie sich vor dem Verschärfen an, was die Antwort kostet: 99 % Konfidenzniveau mit ±3 Prozentpunkten verlangt 1.843 Antworten, etwa das Fünffache der Voreinstellung. Ist das nicht zu bezahlen, berichten Sie eine größere Fehlermarge, statt einen Umfang zu rekrutieren, den Sie nicht erreichen.
- Warum wird die Antwort auf ganze Personen aufgerundet?
- Weil die Zahl mit Nachkommastellen das exakte arithmetische Ergebnis ist und die ganze Zahl das, was sich rekrutieren lässt – und weil die beiden üblichen Wege, aus dem einen das andere zu machen, in entgegengesetzte Richtungen führen. Kaufmännisches Runden könnte 384,1459 zu 384 machen und damit genau die angestrebte Fehlermarge knapp verfehlen, und dieses Ziel ist ja gerade das, was Sie wollten. Das Aufrunden stellt sicher, dass die Fehlermarge eingehalten oder unterschritten wird; es kostet höchstens ein zusätzliches Interview und entspricht der Art, wie ein Studienprotokoll seinen Umfang nennt: 385 ist eine Zusage, 384,1459 ist ein Zwischenwert.
- Warum gibt es auf dieser Seite keine Tabelle der Stichprobenumfänge?
- Weil die Tabelle, die hier alle suchen, ein Raster aus Konfidenzniveau und Fehlermarge wäre – und genau dieses Raster rechnet das Panel darüber aus. Eine fest auf 95 % gedruckte Tabelle würde dem Panel widersprechen, sobald Sie auf 99 % umschalten, und eine Seite, die sich selbst widerspricht, ist deutlich schlechter als eine ohne Tabelle: Die Leserin müsste entscheiden, welcher der beiden Zahlen sie glaubt. Der zweite Grund ist, dass die Tabelle auch den Anteil für Sie festlegen müsste, und die 50 % sind nur so lange richtig, wie sie die vorsichtige Annahme sind. Ändern Sie Konfidenzniveau, Fehlermarge, Anteil oder Grundgesamtheit, wird die Antwort neu gerechnet – das ist der ganze Inhalt der Tabelle, nach der gesucht wird.
Quellen
- Befragungen mit R — Lehrmaterial zur Datenanalyse am Institut für Kommunikationswissenschaft und Medienforschung der LMU München: die Stichprobe als Auswahl aus einer Grundgesamtheit, die Rücklaufquote und die Repräsentativität – genau die drei Punkte, an denen diese Seite zwischen Antworten und Einladungen unterscheidet — Ludwig-Maximilians-Universität München, Institut für Kommunikationswissenschaft und Medienforschung
- 3.1 Terminology — Introductory Statistics 2e (englische Originalfassung; die Wahrscheinlichkeit als Langzeit-Häufigkeit, also das, wovon der Anteil p eine Schätzung ist und was die Fehlermarge um ihn herum begrenzt) — OpenStax (Rice University)
- 1.3.6.1. What is a Probability Distribution — e-Handbook of Statistical Methods (englische Originalfassung; eine Zählung geteilt durch einen Umfang als geschätzte Wahrscheinlichkeit und die Stichprobenstreuung, die diese Schätzung mit sich trägt) — National Institute of Standards and Technology (NIST)
- 1.3.6.7.1. Cumulative Distribution Function of the Standard Normal Distribution — e-Handbook of Statistical Methods (englische Originalfassung; die Quelle der kritischen Werte, mit denen diese Seite die drei Konfidenzniveaus in die Rechnung übersetzt) — National Institute of Standards and Technology (NIST)