T-Test-Rechner
Ergebnis
T-Statistik
- P-Wert
- 34,6594 %
- Freiheitsgrade
- 8
- Standardfehler
- 1,0000
Der t-Test-Rechner führt den gebräuchlichsten Mittelwertvergleich durch: Aus einem Mittelwert, einer Standardabweichung und einem Stichprobenumfang werden die T-Statistik, der p-Wert und die Freiheitsgrade, mit denen beides gelesen wird. Der Ein-Stichproben-Modus vergleicht einen Mittelwert mit einem festen Wert – einem Sollwert, einer Spezifikation, einem früheren Durchschnitt. Der Zwei-Stichproben-Modus vergleicht zwei Gruppen miteinander, und umgesetzt ist hier der t-Test mit gepoolter Varianz, der annimmt, dass beide Gruppen dieselbe Varianz teilen: Die beiden Standardabweichungen werden mit n − 1 gewichtet zu einer gepoolten Varianz zusammengefasst, und aus dieser einen Varianz stammt der Standardfehler. Der andere Weg, der Welch-Test, gibt die Annahme gleicher Varianzen auf und ist die sicherere Voreinstellung, wenn sich Umfang und Streuung der Gruppen unterscheiden; seine Freiheitsgrade sind jedoch gebrochene Zahlen und eine andere Rechnung an anderer Stelle. Diese Seite rechnet den Test für gleiche Varianzen und sagt das ausdrücklich, statt es stillschweigend zu unterstellen. Der p-Wert ist die Fläche im t-Verteilungsschwanz jenseits der Prüfgröße und wird als Prozentzahl ausgegeben.
Formel
t = (x̄ − μ₀) / (s / √n) t = (x̄₁ − x̄₂) / √(s_p²(1/n₁ + 1/n₂)) s_p² = ((n₁−1)s₁² + (n₂−1)s₂²) / (n₁ + n₂ − 2)
- t
- Die Prüfgröße – wie viele Standardfehler der beobachtete Mittelwert von dem Wert entfernt liegt, der geprüft wird. Ihr Vorzeichen trägt die Richtung, und das ist der Grund, warum eine einseitig falsch gewählte Richtung einen sehr großen p-Wert liefert statt eines Fehlers: Gegenüber der Alternative »größer« ist t = −1 kein kleiner Effekt, sondern ein Beleg, der in die andere Richtung zeigt, und die Schwanzfläche gibt das korrekt wieder
- x̄, μ₀
- Der Mittelwert der Stichprobe und der Wert, mit dem er im Ein-Stichproben-Modus verglichen wird. Der Zähler ist die Differenz der beiden, die Prüfgröße misst also eine Strecke in Einheiten der Daten selbst – dieselbe Differenz wiegt bei großer Streuung oder kleiner Stichprobe viel weniger, und der Nenner liefert genau diese Umrechnung
- s
- Die Standardabweichung der Stichprobe, aus den Daten geschätzt und nicht vorab bekannt. Erst diese Schätzung ist der Grund, warum die t-Verteilung an die Stelle der Normalverteilung tritt: Sie bringt eine zusätzliche Unsicherheit mit, die die Ränder schwerer macht, und genau das gleicht der t-kritische Wert aus. Sie muss größer als null sein – eine Stichprobe ganz ohne Streuung hat nichts, wodurch sich teilen ließe
- n
- Der Stichprobenumfang, der im Ein-Stichproben-Modus n − 1 Freiheitsgrade liefert. Im Zwei-Stichproben-Test werden die Umfänge beider Gruppen addiert und dann um eins mehr abgezogen als bei einer einzelnen Gruppe: n₁ + n₂ − 2, weil die gepoolte Varianz zuerst in jeder Gruppe einen Freiheitsgrad dafür verbraucht, den eigenen Mittelwert festzulegen, und danach die Streuung um ihn misst
- s_p²
- Die gepoolte Varianz – der mit den jeweiligen Freiheitsgraden gewichtete Mittelwert der beiden Gruppenvarianzen. Hier kommt die Annahme gleicher Varianzen ins Spiel: Beide Gruppen werden als zwei Stichproben aus derselben Streuung der Grundgesamtheit behandelt, die größere Gruppe oder die mit der kleineren eigenen Varianz trägt also anteilig zu einer gemeinsamen Schätzung bei. Wenn die beiden Varianzen weit auseinanderliegen, geht genau an dieser Zusammenfassung etwas schief, und der Welch-Test ist die Reparatur dafür
- p-Wert
- Die Wahrscheinlichkeit, unter der Annahme, dass die beiden Mittelwerte tatsächlich gleich sind, eine Prüfgröße zu erhalten, die mindestens so weit von null abweicht, und zwar in die Richtung, nach der der Test fragt. Zweiseitig wird die Fläche jenseits von |t| verdoppelt; »größer« und »kleiner« nehmen je einen Rand. Angegeben wird sie als Prozentzahl, 5 % sind also die vertrauten 0,05; sie sagt, wie selten diese Daten unter der Annahme sind, und nicht, wie glaubwürdig die Annahme angesichts der Daten ist
Wenn Mittelwert und Standardabweichung einer Stichprobe vorliegen und die Frage ist, ob ihr Abstand zu einem Sollwert oder zu einer zweiten Gruppe größer ist, als das Zufallsrauschen erklären kann. Der Ein-Stichproben-Modus behandelt den Fall, dass der Vergleichswert eine feste Zahl ist – eine Maschine, die auf 500 Gramm eingestellt ist, eine Spezifikation von 5 Millimetern, der Durchschnitt des Vorjahres; der Zwei-Stichproben-Modus behandelt den Fall, dass beide Größen gemessen wurden und keine von beiden mehr Gewicht hat als die andere. Zwei Dinge sollten vor dem Lesen der Antwort feststehen. Das erste ist ein- oder zweiseitig: Ein zweiseitiger Test fragt, ob sich die beiden unterscheiden, unabhängig von der Richtung, und ist die passende Voreinstellung; ein einseitiger Test fragt eine gerichtete Frage und sollte gewählt werden, weil die Richtung vorab feststand, und nicht, weil die Antwort dann besser aussieht. Das zweite ist die Annahme gleicher Varianzen, die der Zwei-Stichproben-Modus macht und nicht für Sie prüfen kann. Der Hinweis steht im Panel: Liegen die beiden eingetragenen Standardabweichungen nah beieinander, kostet das Zusammenfassen wenig; unterscheiden sie sich um mehr als das Doppelte, ist der Welch-Test der richtige. Diese Seite rechnet den Test mit gepoolter Varianz, also den, den die meisten Lehrbücher und die meisten Statistikwerkzeuge meinen, wenn sie im Fall gleicher Varianzen von »t-Test« sprechen, und sie druckt die beiden von Ihnen eingetragenen Standardabweichungen mit ab, damit diese Annahme beurteilt werden kann, statt vorausgesetzt zu werden. Die beiden Formeln unterscheiden sich nur darin, woher der Standardfehler kommt: In der Ein-Stichproben-Variante ist es die Standardabweichung einer Stichprobe geteilt durch √n, in der Zwei-Stichproben-Variante werden zuerst die beiden Varianzen zu einer zusammengefasst und dann mit (1/n₁ + 1/n₂) multipliziert; die Prüfgröße selbst wird immer gleich gebildet – Differenz geteilt durch Standardfehler.
Rechenbeispiele
Der Vorgabefall: Stichprobenmittelwert 6, Vergleichswert 5
- Standardfehler: 3 / √9 = 3 / 3 = 1
- T-Statistik: (6 − 5) / 1 = 1
- Freiheitsgrade: n − 1 = 9 − 1 = 8
- Zweiseitiger p-Wert bei 8 Freiheitsgraden: 34,6594 %
Der Standardfehler ist hier absichtlich genau 1, sodass die T-Statistik unmittelbar als Abstand in Standardfehlern lesbar ist: Der Mittelwert der Stichprobe liegt einen Standardfehler über dem Vergleichswert. Der p-Wert von 34,66 % sagt, dass ein Abstand dieser Größe bei acht Freiheitsgraden völlig gewöhnlich ist – in rund zwei von drei Fällen wäre er mindestens so groß. Die Felder der zweiten Gruppe stehen im Ein-Stichproben-Modus ungenutzt daneben.
T-Statistik 2,306, wo der p-Wert genau 5 % beträgt
- Standardfehler: 3 / √9 = 1
- T-Statistik: (2,306 − 0) / 1 = 2,306
- Freiheitsgrade: 9 − 1 = 8
- Zweiseitiger p-Wert bei 8 Freiheitsgraden: 5,0000 %
Dieser Kasten ist der Zwilling des Beispiels auf der Seite zum kritischen Wert: Dort war 2,306 der kritische t-Wert zum 95-%-Niveau bei 8 Freiheitsgraden, hier ist er die Prüfgröße, und der p-Wert kommt genau auf 5 % heraus. Das ist kein Zufall, sondern dieselbe Aussage von zwei Seiten: Ein Test ist genau dann auf dem 5-%-Niveau signifikant, wenn seine Prüfgröße den kritischen Wert überschreitet. Beide Werte sind hier auf vier Nachkommastellen gerundet, deshalb steht 5,0000 und nicht 5 – exakt stimmen sie nur bei unendlich vielen Stellen überein.
Zwei Gruppen mit je zehn Beobachtungen und gleicher Streuung
- Beide Gruppen haben dieselbe Streuung von 2, die gepoolte Varianz ist also ebenfalls 4
- Standardfehler: √(4 × (1/10 + 1/10)) = √0,8 = 0,8944
- T-Statistik: (5 − 4) / 0,8944 = 1,118
- Freiheitsgrade: 10 + 10 − 2 = 18, der zweiseitige p-Wert ist 27,8253 %
Zwei gleich große Gruppen mit gleicher Streuung sind der Fall, für den die gepoolte Varianz gebaut ist: Das Zusammenfassen ändert hier nichts, weil es nichts zu mitteln gibt. Der p-Wert von 27,83 % sagt, dass ein Unterschied von einem Punkt bei einer Streuung von 2 und zehn Beobachtungen je Gruppe nichts Auffälliges ist – um bei dieser Streuung auf 5 % zu kommen, bräuchte es einen Unterschied von knapp 1,8 Punkten. Die 18 Freiheitsgrade sind hier eine gerade Zahl, weil beide Gruppen gleich groß sind; das ist der Bequemlichkeit halber so gewählt und nicht nötig.
Ungleiche Streuungen und ungleiche Umfänge, wo das Zusammenfassen beobachtet werden muss
- Beide Streuungen quadrieren: 2,1² = 4,41 und 1,8² = 3,24
- Gepoolte Varianz: ((10 − 1) × 4,41 + (12 − 1) × 3,24) / (10 + 12 − 2) = (39,69 + 35,64) / 20 = 75,33 / 20 = 3,7665
- Standardfehler: √(3,7665 × (1/10 + 1/12)) = √0,690525 = 0,831
- T-Statistik: (5,2 − 4,1) / 0,831 = 1,3237, zweiseitiger p-Wert 20,0521 %
Hier ist das Zusammenfassen keine Formsache mehr: Die zweite Gruppe ist größer und hat die kleinere Streuung, sie zieht die gemeinsame Schätzung also nach unten. Genau darauf ist zu achten, bevor ein p-Wert aus diesem Modus geglaubt wird – 2,1 gegen 1,8 liegt noch nah beieinander, aber ein Verhältnis von zwei oder mehr bei ungleichen Gruppengrößen ist die Stelle, an der die Gleichheit der Varianzen bricht und der Welch-Test gebraucht wird. Die Seite druckt beide Standardabweichungen ab, damit dieser Vergleich möglich ist, ohne woanders nachzusehen.
Ein t von 1,96 aus 900 Beobachtungen, wo t und z zusammengefallen sind
- Standardfehler: 3 / √900 = 3 / 30 = 0,1
- T-Statistik: (5,196 − 5) / 0,1 = 1,96
- Freiheitsgrade: 900 − 1 = 899
- Zweiseitiger p-Wert bei 899 Freiheitsgraden: 5,0304 % – knapp über 5 %
Derselbe statistische Wert wie im ersten Kasten der Seite zum kritischen Wert, nur unter einer anderen Verteilung: Dort war 1,96 die 5-%-Schwelle der Normalverteilung, hier ist es eine T-Statistik mit 899 Freiheitsgraden, und ihr p-Wert liegt mit 5,0304 % knapp über 5 %. Bei 899 Freiheitsgraden sind die beiden Verteilungen praktisch nicht mehr zu unterscheiden, aber nicht genau gleich – die t-Verteilung ist in den Rändern noch etwas schwerer, deshalb sitzt dieselbe Prüfgröße ein wenig weiter außen. Das ist auch der Grund, warum ein t von 1,96 in einer großen Stichprobe nicht automatisch auf dem 5-%-Niveau signifikant ist und warum Software, die 0,0499 meldet, und Software, die 0,0501 meldet, sich in derselben Untersuchung in der dritten Nachkommastelle uneinig sein können.
Einschränkungen
Der Zwei-Stichproben-Modus setzt voraus, dass beide Gruppen dieselbe Varianz teilen, und diese Annahme arbeitet wirklich, sie räumt nicht nur die Schreibweise auf. Sind die beiden Stichproben gleich groß, bleibt der gepoolte Test auch bei unterschiedlichen Varianzen noch recht robust; unterscheiden sich aber die Umfänge und die Varianzen zugleich, kann der Test in jede Richtung erheblich danebenliegen – das ist das Behrens-Fisher-Problem, für das der Welch-Test existiert. Die beiden Standardabweichungen stehen im Panel genau deshalb da: Vergleichen Sie sie, bevor Sie dem p-Wert glauben, und liegt eine um etwa das Doppelte über der anderen, während die Gruppengrößen verschieden sind, dann ist der Test für gleiche Varianzen nicht der richtige. Der Ein-Stichproben-Modus hat dieses Problem nicht, er setzt aber voraus, dass die Beobachtungen voneinander unabhängig sind, was bei wiederholten Messungen am selben Objekt sowie bei gepaarten oder geklumpten Daten nicht gilt; dort braucht es einen Test für gepaarte Stichproben oder ein gemischtes Modell. Beide Modi setzen voraus, dass die zugrunde liegenden Daten einigermaßen normalverteilt sind, und je größer die Stichprobe, desto unempfindlicher wird der Test gegen diese Annahme – der zentrale Grenzwertsatz ist genau der Grund, warum ein t-Test auf 900 schiefen Beobachtungen vertretbar ist und einer auf 9 schiefen Beobachtungen fragwürdig. Zuletzt gibt die Seite eine Prüfgröße und einen p-Wert aus und keine Schlussfolgerung. Sie hat kein Signifikanzniveau, mit dem sie vergleichen könnte, und 0,05 ist eine Übereinkunft und kein Ergebnis, deshalb bleibt diese Entscheidung dort, wo sie hingehört.
Häufige Fragen
- Rechnet diese Seite mit gepoolter Varianz oder mit dem Welch-Test?
- Mit der gepoolten Varianz – dem Test für gleiche Varianzen, mit n₁ + n₂ − 2 Freiheitsgraden. Unterscheiden sich die beiden Gruppen in Streuung und Umfang, ist der Welch-Test die bessere Wahl, und die beiden Felder für die Standardabweichung stehen im Panel, damit Sie das prüfen können: Liegt eine um etwa das Doppelte über der anderen und sind die Gruppengrößen verschieden, brauchen Sie Welch, und der p-Wert dieser Seite ist dann verzerrt, mitunter deutlich. Umgesetzt ist die Version für gleiche Varianzen, weil sie die aus dem Lehrbuch ist, weil sie im Referenzhandbuch »Two-Sample t-Test for Equal Means« heißt und weil ihre ganzzahligen Freiheitsgrade die Arithmetik dieser Seite exakt halten statt nur ungefähr.
- Soll ich einseitig oder zweiseitig testen?
- Zweiseitig, außer die Richtung stand bereits vor dem Blick auf die Daten fest. Ein zweiseitiger Test fragt, ob sich die beiden überhaupt unterscheiden, und verteilt das Signifikanzniveau auf beide Ränder; ein einseitiger Test fragt, ob eine der beiden größer ist, und legt das ganze Niveau auf diesen einen Rand, sodass er leichter signifikant wird – bei gleichem Niveau genau doppelt so leicht, weil aus 1,96 dann 1,645 wird. Ist die Frage selbst gerichtet, ist das eine berechtigte Wahl; ist die Richtung aber erst festgelegt worden, nachdem man gesehen hat, wohin der Unterschied läuft, dann ist es eine Art, sich das Ergebnis auszusuchen.
- Worin unterscheiden sich T-Statistik und p-Wert?
- Die T-Statistik misst den Abstand in Einheiten des Standardfehlers, der Stichprobenumfang steckt also in ihr mit drin; der p-Wert rechnet diese Zahl mit der t-Verteilung zu der passenden Anzahl von Freiheitsgraden in eine Wahrscheinlichkeit um. Die T-Statistik antwortet daher auf die Frage »um wie viele Standardfehler liegen die beiden auseinander«, der p-Wert auf die Frage »wie häufig entsteht ein so großer Abstand allein durch die Stichprobenziehung«. Beide werden berichtet, weil sich die erste zwischen Untersuchungen mit gleichem Design direkt vergleichen lässt und die zweite die ist, die man gegen ein Signifikanzniveau hält. Keine von beiden ist eine Effektstärke – eine große Stichprobe macht aus einem belanglosen Unterschied eine große T-Statistik und einen winzigen p-Wert.
- Warum beträgt der p-Wert bei einer T-Statistik von 1,96 nicht genau 5 %?
- Weil 1,96 die 5-%-Grenze der Normalverteilung ist und die t-Verteilung bei jeder endlichen Zahl von Freiheitsgraden etwas schwerere Ränder hat. Bei 899 Freiheitsgraden liefert t = 1,96 einen p-Wert von 5,0304 %, also knapp über der Grenze; bei 8 Freiheitsgraden liefert dieselbe Prüfgröße 8,57 %. Die t-Verteilung nähert sich mit wachsenden Freiheitsgraden der Normalverteilung an, es ist durchweg dieselbe Kurve, nur der Anteil in den Rändern ändert sich. Das ist auch der Grund, warum eine Software 0,0499 melden kann, während jemand, der von Hand gegen 1,96 vergleicht, das Ergebnis für signifikant hält – beide haben recht.
- Was bedeutet eine negative T-Statistik?
- Dass der Mittelwert der Stichprobe unter dem Vergleichswert liegt, im Zwei-Stichproben-Modus unter dem Mittelwert der zweiten Gruppe. Das Vorzeichen ist reine Richtungsinformation und sonst nichts – der p-Wert richtet sich danach, wie weit die Prüfgröße im Verhältnis zur Verteilung draußen liegt. Im zweiseitigen Test fällt das Vorzeichen weg, weil beide Enden als extrem zählen. Im einseitigen Test ist es bedeutsam und informativ: Gegenüber der Alternative »größer« ergibt t = −2,5 einen p-Wert nahe 99 %, und das ist kein »kein Ergebnis«, sondern ein Beleg, der in die andere Richtung zeigt; es als »nicht signifikant« zu berichten, wirft diese Information weg.
- Wie viele Beobachtungen braucht ein t-Test?
- Die Seite verlangt mindestens zwei je Gruppe, weil die Standardabweichung einer einzelnen Beobachtung nicht definiert ist. Das ist eine mathematische Untergrenze und keine praktische Empfehlung – ein t-Test mit zwei Beobachtungen je Gruppe hat einen einzigen Freiheitsgrad und kann außer sehr großen Unterschieden praktisch nichts nachweisen; der p-Wert bleibt groß, sofern sich die beiden Gruppen nicht fast überhaupt nicht überlappen. Die eigentlich nützliche Frage ist nicht, wie wenig die Formel zulässt, sondern wie groß die Stichprobe sein muss, um den Unterschied nachzuweisen, auf den es ankommt, und das hängt von der Streuung der Daten und der Größe des Effekts ab, den man erkennen möchte. Diese Rechnung steht auf der Seite zum Stichprobenumfang, die von einer Fehlermarge rückwärts rechnet und nicht von einem Datensatz vorwärts.
- Wo ist die Tabelle der kritischen Werte?
- Auf der Seite zum kritischen Wert, und es gibt in dieser Gruppe nur diese eine Tabelle. Hier wird sie nicht abgedruckt, weil eine solche Tabelle außer nach dem Signifikanzniveau auch nach den Freiheitsgraden zu ordnen wäre – das wäre pro Signifikanzniveau ein eigenes Buch und keine Tabelle. Genau deshalb wird die Antwort hier gerechnet und nicht nachgeschlagen: Eine Tabelle kann nur die Freiheitsgrade auflisten, die jemand abzudrucken beschlossen hat, und die Freiheitsgrade eines Zwei-Stichproben-Tests, n₁ + n₂ − 2, stehen fast nie darin. Die einzige Grenze, die es wert ist, im Kopf behalten zu werden: Der t-Wert nähert sich mit wachsender Stichprobe der 1,96 an, die gesuchte Tabelle ist also die Normalverteilungstabelle mit einem Zuschlag, der mit den Freiheitsgraden schwindet.
Quellen
- DA_Sitzung 06 – t-Test — Lehrmaterial zur Datenanalyse am Institut für Kommunikationswissenschaft und Medienforschung der LMU München: der t-Test als Mittelwertvergleich, die Freiheitsgrade und der gepoolte Zwei-Stichproben-Fall — Ludwig-Maximilians-Universität München, Institut für Kommunikationswissenschaft und Medienforschung
- 1.3.5.3. Two-Sample t-Test for Equal Means — e-Handbook of Statistical Methods (englische Originalfassung; der gepoolte Zwei-Stichproben-Test, den diese Seite umsetzt, samt gepoolter Standardabweichung und ihren n₁ + n₂ − 2 Freiheitsgraden) — National Institute of Standards and Technology (NIST)
- 1.3.5.1. Measures of Location — e-Handbook of Statistical Methods (englische Originalfassung; der Stichprobenmittelwert und der Standardfehler, aus denen die Ein-Stichproben-Prüfgröße gebaut ist) — National Institute of Standards and Technology (NIST)
- 1.3.6.7.1. Cumulative Distribution Function of the Standard Normal Distribution — e-Handbook of Statistical Methods (englische Originalfassung; die Kurve, der sich die t-Verteilung mit wachsenden Freiheitsgraden nähert, und damit der Grund, warum 1,96 und 5 % nur ungefähr zueinander passen) — National Institute of Standards and Technology (NIST)