Fehlermarge-Rechner
Ergebnis
Fehlermarge
- Standardfehler
- 1,2000
- Kritischer Wert
- 1,9842
Der Fehlermarge-Rechner übersetzt die Streuung einer Stichprobe in das Plusminus, das neben einem Umfrageergebnis steht. Er braucht dieselben drei Angaben wie jede solche Rechnung, und die Seite fragt genau nach ihnen: das Konfidenzniveau – 90 %, 95 % oder 99 % –, den Stichprobenumfang und die Angabe, wie stark der geschätzte Wert schwankt: die Standardabweichung beim Mittelwert, den Anteil selbst bei einem Prozentwert. Das Verfahren ist ein kritischer Wert mal ein Standardfehler, und beide Faktoren werden mit ausgegeben, weil die beiden häufigsten Fehler je in einem davon stecken: der t-Wert an einer Stelle, an der ein z-Wert gehört, oder eine Division durch den Stichprobenumfang statt durch dessen Wurzel. Das Ergebnis hängt überhaupt nicht an der Mitte der Stichprobe. Die Fehlermarge sagt, wie weit eine Schätzung danebenliegen kann, und nicht, wie hoch sie ist – eine Umfrage mit 60 % und drei Punkten Fehlermarge kann ebenso gut aus einer Grundgesamtheit mit 57 % oder mit 63 % stammen.
Formel
Fehlermarge = kritischer Wert × Standardfehler Standardfehler = s / √n Standardfehler = √(p(1 − p) / n)
- Fehlermarge
- Die halbe Breite des Konfidenzintervalls, in der Einheit des Schätzwerts. Sie ist die halbe und nicht die ganze Breite, weil das Intervall als »Schätzwert ± Fehlermarge« geschrieben wird – dieselbe Zahl wird einmal abgezogen und einmal addiert. Die Einheit folgt dem Schätzwert: Bei einem Anteil sind es Prozentpunkte, bei einem Mittelwert die Einheit der Daten selbst
- kritischer Wert
- Und in diesem Modus immer der t-Wert mit n − 1 Freiheitsgraden, nicht die allseits erinnerte 1,96. Gegen die Stichprobenumfänge üblicher Umfragen ist der Unterschied klein, aber er ist nicht null und ausgerechnet dort am größten, wo die Fehlermarge ohnehin am größten ist: Bei n = 2 beträgt der t-Wert 12,7062, und zwei Beobachtungen mit der Standardabweichung 4 liefern dann eine Fehlermarge von 35,94. Im Anteil-Modus stammt er dagegen aus der Normalverteilung und beträgt bei 95 % immer 1,9600 – dort gibt es keine Freiheitsgrade, an denen er sich aufhängen könnte
- Standardfehler
- Die Streuung des Schätzwerts, je Modus aus einer anderen Wurzel. Im Mittelwert-Modus ist er s / √n, im Anteil-Modus √(p(1 − p) / n) mal 100; beide Male steht der Stichprobenumfang unter der Wurzel im Nenner, und beide Male ist er die Größe, an der sich mit mehr Daten tatsächlich etwas ändern lässt. Er ist nicht die Streuung der Daten – die steckt in s –, sondern die Streuung dessen, was Sie schätzen
- s
- Standardabweichung der Stichprobe, nur im Mittelwert-Modus verwendet. In einer Umfrage ist diese Größe selten vorab bekannt, und genau das ist der Grund, warum Meinungsumfragen Anteile berichten und keine Mittelwerte: Die Schwankung einer Ja-Nein-Frage steckt bereits im Prozentwert und muss nicht eigens geschätzt werden
- p
- Anteil in der Stichprobe, nur im Anteil-Modus verwendet; in der Formel als Bruch, im Panel als Prozentwert. Seinen größten Beitrag zur Breite liefert er bei 50 %: die Hälfte dafür, die Hälfte dagegen ist der unentschiedenste Zustand einer Ja-Nein-Frage, deshalb zitieren Meinungsumfragen für ihre Fehlermarge meist den ungünstigsten Fall p = 0,5 und nicht den eigenen Wert dieser Erhebung
- n
- Stichprobenumfang, und zwar in Form von √n. Diese Wurzel ist der Grund, warum eine Verdopplung der Stichprobe die Fehlermarge nicht halbiert – sie teilt sie nur durch 1,41; um die Fehlermarge zu halbieren, braucht es die vierfache Stichprobe. Er ist zugleich der einzige Faktor, den die Forscherin oder der Forscher in der Hand hat, denn p kommt aus den Daten und das Konfidenzniveau ist eine Aussage darüber, wie sicher die Antwort sein soll
Wenn die Daten schon erhoben sind und Sie wissen wollen, wie viel von einer berichteten Zahl Rauschen ist – oder wenn Sie eine fremde Zahl lesen und nachvollziehen wollen, wie sie zusammengesetzt ist. Die beiden nützlichsten Angaben stehen dabei nicht im Hauptergebnis, sondern im Panel: der kritische Wert, der verrät, ob mit t oder mit z gerechnet wurde und damit auch, ob die auswertende Person für die geschätzte Streuung einen Aufschlag eingeräumt hat, und der Standardfehler, der das Wurzelgesetz sichtbar macht – viermal so viele Beobachtungen, und diese Zeile halbiert sich. Wer dagegen eine Untersuchung plant und nicht deutet, greift besser zur Seite für den Stichprobenumfang: Dort ist die Frage umgedreht, nämlich wie viele Antworten nötig sind, um die Fehlermarge auf einen vorher festgelegten Wert zu drücken. Beim Lesen von Umfrageergebnissen ist schließlich zu bedenken, dass die Fehlermarge nur den Stichprobenfehler abdeckt. Sie sagt nichts darüber, wen Sie befragt haben, ob die Frage suggestiv war und ob die Auswahl jedem Mitglied der Grundgesamtheit die gleiche Chance gegeben hat. Diese Probleme werden mit wachsendem n nicht kleiner, und gerade eine große Stichprobe mit kleiner Fehlermarge lässt eine verzerrte Umfrage seriös aussehen.
Rechenbeispiele
Der Ausgangsfall: ein Mittelwert aus 100 Beobachtungen
- Standardfehler: s / √n = 12 / 10 = 1,2
- Kritischer Wert: der t-Wert mit 99 Freiheitsgraden, 1,9842 – nicht 1,9600
- Fehlermarge: 1,9842 × 1,2 = 2,3811
- Die Schätzung selbst ist keine Eingabe, deshalb ist die Antwort die halbe Breite und kein Intervall
Lesenswert ist die Zeile mit dem kritischen Wert, weil genau hier der häufigste Fehler beim Nachrechnen mit der Hand sitzt: 100 Beobachtungen sind bereits eine große Stichprobe, und wer beiläufig 1,96 statt 1,9842 nimmt, weicht im Ergebnis um 1,2 % ab. Bei n = 2 ist der Unterschied dagegen riesig – dieselbe Ersetzung macht aus 35,94 den Wert 5,5 und unterschätzt die Unsicherheit auf ein Sechstel. Die Seite druckt den kritischen Wert ab, damit dieser Schritt nachprüfbar ist und nicht in einer Multiplikation verschwindet.
Ein Anteil aus 1.000 Antworten
- Den Anteil als Bruch schreiben: 50 % = 0,5
- Standardfehler in Prozentpunkten: √(0,5 × 0,5 / 1.000) × 100 = 1,5811
- Kritischer Wert: die 1,9600 der Normalverteilung, denn der Anteil-Modus rechnet mit z
- Fehlermarge: 1,96 × 1,5811 = 3,099 Prozentpunkte
Das ist die Gestalt der Zahl, die in der Zeitung zitiert wird, und drei Einzelheiten daran sind getrennt zu betrachten. Der kritische Wert ist hier 1,9600, während das Mittelwert-Beispiel darüber 1,9842 ergibt, weil die Schwankung eines Anteils vollständig von p bestimmt wird und keine Freiheitsgrade braucht. Das Feld für die Standardabweichung steht im Panel, wird aber nicht gelesen – in diesem Modus kommt die Streuung aus dem Prozentwert und nicht aus einer eigenen Schätzung. Und p = 50 % ist der ungünstigste Fall, weshalb sich die Zahl verallgemeinern lässt: Keine Frage dieser Erhebung hat eine größere Fehlermarge als diese.
Neun Beobachtungen, bei denen die Fehlermarge auf dem kritischen Wert landet
- Standardfehler: 3 / √9 = 1, und das geht glatt auf
- Kritischer Wert bei 8 Freiheitsgraden: 2,306
- Fehlermarge: 2,306 × 1 = 2,306
- Zwei der drei Zeilen zeigen dieselbe Zahl – ein Zufall dieser Eingaben und keine Regel
Dieser Zufall ist einen Blick wert, damit er später nicht für einen Zusammenhang gehalten wird: Der Standardfehler ist genau 1, die Multiplikation wird zum Leerlauf, und der kritische Wert steht unverändert als Antwort da. Neun Beobachtungen mit der Standardabweichung 3 sind ein natürliches kleines Beispiel, und der t-Wert, der hier auftritt, ist derselbe, den die Seite für das Konfidenzintervall bei n = 9 liefert – beide Seiten teilen die ganze Rechnung, und der Unterschied ist nur, dass dort zusätzlich ein Stichprobenmittelwert bekannt ist, mit dem sich der Bereich verschieben lässt.
Dieselben Daten, gelesen mit 99 %
- Der Standardfehler hat sich nicht bewegt, er ist weiterhin 1,2 – an den Daten wurde nichts geändert
- Kritischer Wert für 99 % bei 99 Freiheitsgraden: 2,6264
- Fehlermarge: 2,6264 × 1,2 = 3,1517
- Verglichen mit dem 95-%-Kasten: 2,3811 – die zusätzlich verlangte Sicherheit kostet 32 % mehr Breite
Von den drei Zeilen hat sich nur eine geändert, und genau dafür stehen alle drei da: Das Konfidenzniveau bewegt nur den kritischen Wert und sonst nichts, der Stichprobenumfang bewegt nur den Standardfehler und sonst nichts. Die beiden Regler sind voneinander unabhängig, und sie zu verwechseln ist ein häufiger Weg, die Frage »was hat sich eigentlich geändert« falsch zu beantworten. Auch das Geschäft selbst ist einen Hinweis wert: 99 % ist nicht genauer, sondern vorsichtiger. Es erkauft einen Bereich, der den wahren Wert häufiger überdeckt, und bezahlt dafür mit einer lockerer angehefteten Schätzung in jedem einzelnen Fall.
Einschränkungen
Die Fehlermarge deckt nur eine Quelle von Fehlern ab: die Schwankung, die dadurch entsteht, dass eine Stichprobe gezogen und nicht die ganze Grundgesamtheit gemessen wurde. Von einer Verzerrung weiß sie nichts, und die beiden sind nicht austauschbar – eine Stichprobe aus 1.000 Personen, die sich auf einer Website freiwillig gemeldet haben, hat eine winzige Fehlermarge und kann trotzdem um zwanzig Prozentpunkte danebenliegen, weil die Antwortenden nicht zufällig ausgewählt wurden. Ebenso wird vorausgesetzt, dass die Beobachtungen voneinander unabhängig sind. Wer in einem Haushalt mehrere Personen befragt oder dasselbe Objekt zweimal misst, drückt den wirksamen Stichprobenumfang weit unter die Zahl der Antworten, und die Formel sieht das nicht: Die berechnete Fehlermarge fällt zu schmal aus. Beide Formeln sind Näherungen für große Stichproben; die für den Anteil ist besonders unzuverlässig, wenn n·p oder n·(1 − p) klein ist, und genau das ist bei seltenen Merkmalen der Fall – eine Antwortquote von 2 % unter 100 Fällen sollte gar nicht erst mit einem symmetrischen Plusminus berichtet werden. Und schließlich beschreibt die Fehlermarge eine einzelne Schätzung. Sie zum Vergleich zweier Gruppen heranzuziehen, ist das falsche Werkzeug; dort gehört die Fehlermarge der Differenz hin, und die ist – außer die beiden Gruppen sind unabhängig – nicht die Summe der beiden einzelnen Fehlermargen.
Häufige Fragen
- Was bedeutet eine Fehlermarge von 3 % genau?
- Sie bedeutet: Würde dieselbe Umfrage sehr oft wiederholt, dann enthielten etwa 95 % der Intervalle »berichteter Wert ± 3 Prozentpunkte« den wahren Wert der Grundgesamtheit. Sie bedeutet nicht, dass der wahre Wert mit Sicherheit innerhalb von 3 Prozentpunkten liegt, und auch nicht, dass diese eine Erhebung höchstens um 3 Prozentpunkte danebenliegt. Daraus folgen zwei leicht übersehene Punkte. Der wahre Wert liegt entweder im Intervall oder nicht, die 95 % beschreiben also das Verfahren und nicht dieses eine Ergebnis. Und beim Vergleich zweier Gruppen addieren sich die Unsicherheiten: Liegen zwei Kandidaten in einer Umfrage mit je 3 Prozentpunkten Fehlermarge vier Punkte auseinander, ist dieses Rennen nicht einfach »innerhalb der Fehlermarge« – die Differenz hat ihre eigene Fehlermarge, und die ist größer als die jeder einzelnen Seite.
- Warum wird die Fehlermarge mit größerer Stichprobe kleiner, aber nicht proportional?
- Weil der Stichprobenumfang in der Formel unter der Wurzel steht. Von 100 auf 400 Antworten halbiert sich die Fehlermarge; von 400 auf 1.600 halbiert sie sich noch einmal – jede Halbierung kostet die vierfache Stichprobe. Das ist die folgenreichste Tatsache der Umfrageplanung und erklärt, warum sich die Stichprobenumfänge von Meinungsumfragen auf einige Hundert bis etwa zweitausend einpendeln: Die ersten 1.000 Antworten kaufen den größten Teil der erreichbaren Genauigkeit, die nächsten 1.000 nur noch die Hälfte davon. Es ist zugleich der Grund, warum sich die Fehlermarge nicht durch eine bessere Auswertung verbessern lässt – der einzige Hebel sind mehr Daten, und er wirkt über die Wurzel.
- Ist eine große Fehlermarge ein schlechtes Zeichen?
- Sie ist ehrlicher, nicht schlechter. Ein breiterer Bereich enthält den wahren Wert mit höherer Wahrscheinlichkeit, deshalb trifft eine Untersuchung mit ±5 Prozentpunkten bei 99 % eine vorsichtigere Aussage als eine mit ±3 Prozentpunkten bei 90 % – vergleichbar sind die beiden erst, wenn das Konfidenzniveau dabeisteht. Wirklich schlechter ist es, die Fehlermarge gar nicht zu berichten oder sie ohne Konfidenzniveau zu nennen, denn dann kann die Leserin nicht beurteilen, wie viel Gewicht die Zahl hat. Was eine große Fehlermarge sonst noch verrät, ist lediglich eine kleine Stichprobe, und das ist eine Information und kein Mangel: Sie sagt, dass diese Untersuchung feine Unterschiede nicht auflösen kann, und eine Untersuchung, die das nicht kann, sollte nicht so gelesen werden, als könnte sie es.
- Warum lehnt die Seite einen Anteil von 0 % oder 100 % ab?
- Weil die Formel dort zusammenbricht. Der Standardfehler eines Anteils ist √(p(1 − p)/n), und bei p = 0 oder p = 1 ist der Faktor p(1 − p) null, die Fehlermarge also genau null. Eine Angabe wie »60 % ± 0 Prozentpunkte« wäre eine Sicherheit, die keine Stichprobe stützen kann – sie behauptet, der Wert der Grundgesamtheit sei 60 %, während die Daten nur hergeben, dass in dieser Stichprobe niemand außerhalb der Kategorie liegt. Für Null- und Vollzählungen gibt es seriöse Verfahren, aber sie alle addieren etwas zu den Zählwerten, statt der leeren Zelle zu vertrauen; keine davon ist eine gewöhnliche Fehlermarge. Deshalb verweigert die Seite die Antwort, statt eine Zahl zurückzugeben, die als Sicherheit gelesen würde.
- Bildet die Fehlermarge eine verzerrte Stichprobe ab?
- Nein, und das ist die wichtigste Einschränkung des ganzen Begriffs. Die Fehlermarge misst die Stichprobenvariabilität – den Teil des Fehlers, der daraus entsteht, dass nur ein Teil der Grundgesamtheit betrachtet wird. Eine Verzerrung ist eine andere Art von Fehler, sie entsteht durch die Art der Auswahl oder durch die Formulierung der Frage, und sie wird mit wachsender Stichprobe nicht kleiner. Eine offene Online-Abstimmung mit 10.000 Teilnehmenden kann eine Fehlermarge von einem Prozentpunkt haben und trotzdem um 15 Prozentpunkte danebenliegen, weil die Abstimmenden nicht zufällig aus der Grundgesamtheit gezogen wurden. Eine große Stichprobe verkleinert den Stichprobenfehler und lässt die Verzerrung zugleich präziser aussehen. Wer eine berichtete Fehlermarge liest, sollte zuerst fragen, wie die Stichprobe gezogen wurde.
- Worin unterscheiden sich Standardfehler und Fehlermarge?
- Der Standardfehler ist die Streuung des Schätzers selbst, die Fehlermarge ist diese Streuung mal einem kritischen Wert, der vom Konfidenzniveau abhängt. Der Standardfehler ist damit eine Eigenschaft der Daten, die Fehlermarge eine Aussage darüber, wie viel Sicherheit Sie verlangen wollen. Bei 95 % liegt dieser Faktor ungefähr bei zwei, und genau deshalb unterscheiden sich die beiden Zahlen oft nur um den Faktor zwei und werden leicht verwechselt. Beide stehen im Panel, und zwar aus diesem Grund: Der Standardfehler sagt, wie viel Information diese Stichprobe trägt, die Fehlermarge sagt, was Sie mit ihr zu behaupten beschließen.
Quellen
- Konfidenzintervall — Glossar des Instituts für Qualität und Wirtschaftlichkeit im Gesundheitswesen: die Beziehung zwischen dem Intervall und der Fehlermarge, die diese Seite als dessen halbe Breite ausgibt — Institut für Qualität und Wirtschaftlichkeit im Gesundheitswesen (IQWiG)
- Binomialtest — Methodenberatung der Universität Zürich: die Streuung eines Anteils und der Weg über die Normalverteilung, den diese Seite im Anteil-Modus geht — Universität Zürich, Methodenberatung
- 1.3.5.6. Measures of Scale — e-Handbook of Statistical Methods (englische Originalfassung; die Standardabweichung, aus der der Standardfehler gebildet wird, und die Herkunft des Nenners n − 1) — National Institute of Standards and Technology (NIST)
- 6.2 Using the Normal Distribution — Introductory Statistics 2e (englische Originalfassung; der kritische Wert, der auf den Standardfehler multipliziert wird, und die beiden Randflächen, in die das Konfidenzniveau zerfällt) — OpenStax (Rice University)