Chi-Quadrat-Rechner
Ergebnis
Chi-Quadrat-Statistik
- P-Wert
- 0,0170 %
- Freiheitsgrade
- 3
- Kleinste erwartete Häufigkeit
- 25,0000
Der Chi-Quadrat-Rechner hält die ausgezählten Häufigkeiten einer Reihe von Kategorien gegen die Häufigkeiten, die Sie erwarten: ob diese Gruppen gleich groß sind. Ob ein Würfel fair ist, ob vier Antwortmöglichkeiten gleich oft gewählt werden, ob die beobachteten Häufigkeiten je Kategorie zu einer Erwartung passen, die aus früheren Daten oder aus einer Theorie stammt — hinter allen diesen Fragen steckt derselbe Chi-Quadrat-Test, ein Anpassungstest, und er liefert eine Prüfgröße, die Freiheitsgrade und einen p-Wert. Bleibt das Feld für die erwarteten Häufigkeiten leer, unterstellt die Seite gleich wahrscheinliche Kategorien; das ist der häufigste Fall und zugleich der einzige, für den man vorher nichts rechnen muss. Die kleinste erwartete Häufigkeit wird mit ausgegeben, weil genau dieser Wert über die Anwendungsvoraussetzungen des Tests entscheidet.
Formel
χ² = Σ ( O − E )² / E FG = k − 1 p = P( χ² ≥ χ²₀ )
- O
- Die beobachtete Häufigkeit je Kategorie — ein Zählwert und keine Messung, deshalb ganzzahlig, und in der Summe der Stichprobenumfang. Eine 0 ist erlaubt: Sie bedeutet, dass diese Kategorie kein einziges Mal aufgetreten ist, und das ist ein Ergebnis und kein Fehler
- E
- Die erwartete Häufigkeit je Kategorie, also der Wert, den die Nullhypothese vorhersagt, und nicht der Wert, den Sie sehen möchten. Bleibt das Feld leer, wird daraus die Gesamtzahl geteilt durch die Anzahl der Kategorien, und der Test fragt dann, ob alle Kategorien gleich wahrscheinlich sind
- k
- Die Anzahl der Kategorien, direkt aus der Länge der eingetippten Zahlenreihe abgelesen. Sie bestimmt die Freiheitsgrade und ist zugleich die Zahl, durch die bei leerem Erwartungsfeld geteilt wird — eine Reihe von Zählwerten legt also beides auf einmal fest
- FG
- Die Freiheitsgrade, gleich k − 1 und nicht k. Diese Subtraktion ist die Stelle, die man vergisst: Sobald die Gesamtzahl und alle Häufigkeiten bis auf eine feststehen, ist auch die letzte festgelegt, diese Kategorien tragen also eine Information weniger, als es Kategorien gibt
- χ²₀
- Die Prüfgröße, die diese Seite ausrechnet; sie wird in ihre eigene Nullverteilung eingesetzt, um die Fläche im oberen Rand abzulesen. Das ist dieselbe Operation wie das Ablesen einer Wahrscheinlichkeit von der Normalverteilungskurve, nur mit der Chi-Quadrat-Kurve statt der Normalverteilung — und genau deshalb braucht der p-Wert außer der Prüfgröße noch die Freiheitsgrade
Gebraucht wird er, wenn die Daten aus Zählwerten bestehen, die in Kategorien fallen, und die Frage lautet, ob diese Zählwerte zu einer Erwartung passen. Dass hier gezählt und nicht gemessen wird, ist der Unterschied zu den Rechnern für Mittelwerte und Anteile: Die Beobachtungen liegen nicht auf einer Skala, es zählt vielmehr, wie viele in jeden Topf gefallen sind, und nicht, wie groß eine einzelne davon ist. Diese Erwartung kann eine Gleichverteilung sein oder eine Reihe erwarteter Häufigkeiten aus früheren Daten — die bundesweiten Verhältnisse auf eine lokale Bevölkerung übertragen, Mendel-Verhältnisse, die Ausgabe eines Modells. Wie gut der Test ist, hängt vollständig an dieser Erwartung: Er hält das Ausgezählte gegen das, was Sie vorgeben, und merkt nichts davon, wenn die Vorgabe selbst falsch ist. Zwei Anwendungsvoraussetzungen lohnen einen Blick, bevor man dem p-Wert glaubt, und die erste hat die Seite bereits für Sie ausgedruckt, weil die kleinste erwartete Häufigkeit genau der Wert ist, auf den die gängige Faustregel zielt.
Rechenbeispiele
Vier Kategorien, ungleich ausgezählt, Erwartungsfeld leer gelassen
- Die Gesamtzahl ist 100; bleibt die Erwartung leer, werden je Kategorie 100 ÷ 4 = 25 erwartet
- Quadrate der Abweichungen von 25: (30 − 25)² = 25, (10 − 25)² = 225, (20 − 25)² = 25, (40 − 25)² = 225
- Jedes Quadrat durch seine Erwartung 25 teilen und addieren: 1 + 9 + 1 + 9 = 20
- Freiheitsgrade k − 1 = 3; die Fläche im oberen Rand oberhalb von 20 beträgt 0,017 %
Das sind die Vorgabewerte dieser Seite, und sie sind so gewählt, dass die Ungleichheit ins Auge fällt: 40 und 10 gegen je 25 erwartete Werte. Der p-Wert von 0,017 % sagt, dass diese Zählwerte weit von dem entfernt liegen, was eine Gleichverteilung erwarten ließe; die kleinste erwartete Häufigkeit von 25 liegt zugleich deutlich über jeder üblichen Schwelle, die Näherung hinter diesem p-Wert trägt hier also. Beachten Sie, dass die erwarteten Häufigkeiten überhaupt nicht eingetippt werden mussten — das Feld leer zu lassen ist die Schreibweise für „alle gleich“, und darin erschöpft sich der Grund, warum dieses Feld optional ist.
Drei Kategorien, gegen die Erwartung aus einer früheren Erhebung
- Beide Reihen ergeben 100, die Erwartung passt also zur Auszählung und der Test darf weiterrechnen
- Quadrate der Abweichungen: (50 − 60)² = 100, (30 − 30)² = 0, (20 − 10)² = 100
- Jeweils durch die eigene Erwartung teilen und addieren: 100/60 + 0/30 + 100/10 = 1,6667 + 0 + 10 = 11,6667
- Freiheitsgrade 3 − 1 = 2; die Fläche oberhalb von 11,6667 beträgt 0,2928 %
Beide Reihen müssen gleich viele Beobachtungen beschreiben, hier sind es jeweils 100 — genau das macht die zweite Reihe zu einer Annahme über die erste und nicht zu einem weiteren Experiment. Die Zeilen einzeln zu lesen lohnt sich: Die mittlere Kategorie passt exakt zu ihrer Erwartung und trägt nichts bei, während der dritte Term trotz der kleinsten Kategorie 10 der 11,67 beisteuert, weil er um volle 100 % von seiner Erwartung abweicht. Die kleinste erwartete Häufigkeit von 10 liegt weiterhin über dem üblichen Niveau.
20 Münzwürfe, gegen die Gleichverteilung geprüft
- Erwartete Zählwerte: 20 Würfe gleichmäßig auf zwei Ergebnisse verteilt, also je 10
- Quadrate der Abweichungen: (12 − 10)² = 4 und (8 − 10)² = 4
- Teilen und addieren: 4/10 + 4/10 = 0,8
- Freiheitsgrade 2 − 1 = 1; die Fläche oberhalb von 0,8 beträgt 37,1093 %
Zwölfmal Kopf bei 20 Würfen sieht nach einer gezinkten Münze aus, solange man die Randwahrscheinlichkeit nicht gelesen hat: Bei einer fairen Münze tritt eine mindestens so ungleiche Aufteilung in 37 % der Fälle auf, das Ergebnis ist also völlig unspektakulär. Es ist dieselbe Arithmetik wie im ersten Beispiel, nur auf der kleinsten brauchbaren Tafel, und es zeigt, warum eine Prüfgröße nie für sich allein gelesen werden darf — 0,8 und 20 sind keine Zahlen, die man nebeneinanderlegen kann, erst der p-Wert bringt sie auf dasselbe Maß. Für den Fall zweier Kategorien gibt es noch eine Abkürzung, die man kennen sollte: Die Chi-Quadrat-Statistik ist das Quadrat des z, mit dem der Test auf zwei Anteile arbeitet.
Einschränkungen
Dieser p-Wert beruht auf einer Näherung, die nicht zu kleine erwartete Häufigkeiten verlangt, und die mit ausgegebene kleinste erwartete Häufigkeit ist genau die Zahl, an der man das prüft — wo die Schwelle liegt, ist in der Literatur nicht einheitlich; „mindestens 5 je Kategorie“ und „mindestens 1 je Kategorie und mindestens 5 in den meisten Kategorien“ werden beide verwendet. Sind die Erwartungen zu klein, versagt die Näherung still und liefert einen p-Wert, der unauffällig aussieht. Die Zählwerte werden außerdem als voneinander unabhängig vorausgesetzt, was bei gepaarten oder wiederholten Messungen nicht gilt und bei Klumpenstichproben ebenfalls nicht — beides bläht die Prüfgröße auf. Die Erwartung selbst wird als gegeben hingenommen, ein Test gegen eine falsche Erwartung beantwortet also eine andere Frage. Und ein kleiner p-Wert sagt nur, dass die Zählwerte mit dieser Erwartung unvereinbar sind, nicht warum: Er verrät nicht, welche Kategorie dafür verantwortlich ist, und bei vielen Kategorien lohnt es sich, den Unterschied, der die Prüfgröße nach oben treibt, getrennt anzusehen.
Häufige Fragen
- Was sagt der Chi-Quadrat-Test eigentlich aus?
- Er sagt, ob die beobachteten Zählwerte zu den erwarteten Häufigkeiten passen, und setzt dabei voraus, dass bekannt ist, wie viele Beobachtungen es insgesamt gibt. Die Prüfgröße wächst mit der Summe der quadrierten Abweichungen zwischen Beobachtung und Erwartung und wird danach gewichtet, wie groß die jeweilige Erwartung ist; dieselbe prozentuale Abweichung wiegt bei einer kleinen Erwartung also schwerer. Der p-Wert sagt anschließend, wie oft eine mindestens so große Abweichung in einer Welt auftritt, in der nichts los ist. Geprüft wird die ganze Tafel und nicht eine einzelne Kategorie, und wenn eine Kategorie deutlich ausschert, werden diese beiden Dinge leicht verwechselt.
- Was passiert, wenn ich das Feld für die erwarteten Häufigkeiten leer lasse?
- Dann unterstellt die Seite gleich wahrscheinliche Kategorien und berechnet die erwarteten Häufigkeiten als Gesamtzahl geteilt durch die Anzahl der Kategorien. Das ist die häufigste Verwendung dieses Tests — ein Würfel, ein Glücksrad, vier Schaltflächen, die eigentlich ähnlich viel Verkehr abbekommen sollten — und erspart das Eintippen einer Reihe, die ohnehin überall denselben Wert hat. Ohne frühere Daten, aus denen sich eine Verteilung vorhersagen ließe, ist es zugleich die einzige mögliche Lesart. Liegt eine echte Erwartung vor, gegen die geprüft werden soll, etwa die Verteilung des Vorjahres oder ein theoretisches Verhältnis, dann tippen Sie sie ein: Ein Test gegen Gleichverteilung und ein Test gegen ein bestimmtes Modell beantworten verschiedene Fragen, und nur der zweite nutzt die Information, die Sie schon haben.
- Warum müssen beide Reihen dieselbe Summe ergeben?
- Weil die erwarteten Häufigkeiten in einem Anpassungstest aus der Gesamtzahl der Beobachtungen abgeleitet werden und nicht frei gewählt sind — sie beschreiben, wie sich dieselben Beobachtungen verteilen würden, wenn die Annahme zuträfe. Reihen mit verschiedenen Summen beschreiben zwei verschiedene Experimente, und die daraus berechnete Prüfgröße prüft nichts. Wenn die erwarteten Häufigkeiten als ganze Zahlen geschrieben werden, kann sich jede durch das Runden um eine halbe Einheit ändern, ohne die Aussage zu verändern; deshalb erlaubt die Seite eine Toleranz von 0,5 je Kategorie: Bei einer Gesamtzahl von 60 sind 20,5, 20,5 und 20,5 zulässig, weil das genau die gerundete Schreibweise der exakten Gleichverteilung auf je 20 ist.
- Darf eine Kategorie die Häufigkeit 0 haben?
- Als beobachtete Häufigkeit ja, als erwartete nicht, und diese Unsymmetrie folgt direkt aus der Formel. Eine Beobachtung von 0 ist ein gewöhnliches Ergebnis — diese Kategorie ist kein einziges Mal aufgetreten —, das Quadrat der Abweichung wird dabei sogar groß, und das ist genau richtig. Die erwartete Häufigkeit darf nicht 0 sein, weil sie im Nenner steht und der Term sonst unendlich würde: Die Vorhersage, dass eine Kategorie niemals auftreten kann, ist keine Vorhersage, die dieser Test gegen Zählwerte abwägen könnte. Ist die wahre Erwartung nur sehr klein und nicht 0, nimmt der Test sie an, und die darunter ausgegebene kleinste erwartete Häufigkeit ist die Stelle, an der man nachsieht, ob das ein Problem ist.
- Wo finde ich eine Tabelle mit Chi-Quadrat-Kritischen Werten?
- Nicht auf dieser Seite, aus demselben Grund wie beim p-Wert: Der Wert, den man tatsächlich braucht, steht schon da, weil Prüfgröße und Freiheitsgrade zusammen die Fläche im oberen Rand festlegen. Jede Tabelle müsste außerdem ein Signifikanzniveau wählen, und wer mit 1 % arbeitet, sähe dann eine Tabelle, die dem Panel widerspricht. Zum Nachschlagen ist der Rechner für kritische Werte die richtige Adresse. Diese Seite hat noch einen weiteren Grund, der sich gar nicht tabellieren lässt: Ihre Freiheitsgrade sind k − 1, und k ist die Anzahl der Kategorien, die der Leser eintippt — welche Zeile der Tabelle überhaupt einschlägig ist, steht also erst fest, wenn die Zählwerte eingetragen sind.
Quellen
- Pearson Chi-Quadrat-Test — Methodenberatung der Universität Zürich — der Test, der ausgezählte Häufigkeiten mit erwarteten Häufigkeiten vergleicht, samt Voraussetzungen und der Rolle der erwarteten Häufigkeiten — Universität Zürich, Methodenberatung
- 1.3.6.1. What is a Probability Distribution — e-Handbook of Statistical Methods — a test statistic is a quantity that only has a distribution under some null hypothesis, which is what makes a tail area computable at all — National Institute of Standards and Technology (NIST)
- 3.1 Terminology — Introductory Statistics 2e — treating a relative frequency as an estimate of a probability, which is the step that turns a category probability into the count it should produce — OpenStax (Rice University)
- 1.3.6.7.1. Cumulative Distribution Function of the Standard Normal Distribution — e-Handbook of Statistical Methods — the same operation this page performs, reading a tail area off a cumulative curve, only with the chi-square curve instead — National Institute of Standards and Technology (NIST)