Zum Hauptinhalt springen
CalcMax

p-Wert-Rechner

Minimum: 1

Minimum: 1

Ergebnis

4,9996 %

P-Wert

Der p-Wert-Rechner verwandelt eine Prüfgröße in den p-Wert: die Wahrscheinlichkeit, unter der Annahme der Nullhypothese einen mindestens so extremen Wert zu erhalten. Unterstützt werden die vier Prüfgrößen z, t, Chi-Quadrat und F; gebraucht werden nur die Prüfgröße selbst, ihre Freiheitsgrade und die Wahl der Seite. Am leichtesten geht dabei die Seite daneben: ein- oder zweiseitig ist keine Formalie, ein zweiseitiger Test zählt beide Richtungen und ein einseitiger nur die eine, die vorher festgelegt wurde. Ausgegeben wird genau eine Zahl, in Prozent. Ein Urteil fällt diese Seite bewusst nicht, denn das Signifikanzniveau bringen Sie mit – ob das Ergebnis signifikant ist oder nicht, hängt davon ab, ob Sie vorher 0,05 festgelegt haben oder etwas anderes.

Formel

obere Seite: p = P(T ≥ t) untere Seite: p = P(T ≤ t) zweiseitig: p = 2 · min( obere, untere ) – nur bei symmetrischer Verteilung

t
Die Prüfgröße, die Sie bereits ausgerechnet haben – der z-Wert bei großer Stichprobe, der t-Wert bei kleiner, Chi-Quadrat beim Auszählen von Häufigkeiten oder F beim Verhältnis zweier Varianzen. Diese Seite berechnet sie nicht, sie rechnet sie nur um
T
Die Verteilung, die diese Prüfgröße unter der Nullhypothese hätte. Welche es ist, entscheidet das Auswahlfeld mit vier Einträgen, und diese Wahl ist keine Geschmacksfrage: Wird dort die Normalverteilung genommen, wo t gehört, fällt jeder p-Wert zu klein aus
FG
Die Freiheitsgrade – eine Eigenschaft davon, wie die Prüfgröße gebildet wurde, und nicht der Daten. t, Chi-Quadrat und F brauchen sie, F sogar zwei: Die Freiheitsgrade im Zähler sind die Zahl der verglichenen Gruppen oder Terme, die im Nenner stammen aus dem Stichprobenumfang der Residuen
α
Das Signifikanzniveau, also die Schwelle, mit der der p-Wert später verglichen wird. Sie steht hier nicht als Eingabe, weil sie nicht zum Rechenweg gehört: Sie gehört zu der Entscheidung, die danach kommt, und eine mit dem Vorgabewert 0,05 ausgedruckte Schlussfolgerung würde diese Schwelle für Sie wählen
p
Die Randwahrscheinlichkeit, als Prozentzahl und nicht als Dezimalbruch angegeben. Ein p-Wert von 0,05 erscheint als 5,0000, sodass die Zahl auf dem Bildschirm unmittelbar mit einem zitierten Signifikanzniveau verglichen werden kann, ohne erst das Komma zu verschieben

Wenn eine Prüfgröße vorliegt und die zugehörige Wahrscheinlichkeit gesucht wird – eine Übungsaufgabe gibt die Prüfgröße direkt, eine Software druckt nur die Prüfgröße und keinen p-Wert, oder Sie haben mit der Hand gerechnet und wollen gegenprüfen. Die wichtigste Entscheidung ist die nach ein- oder zweiseitig, und diese Regel gehört festgelegt, bevor die Daten angesehen werden: zweiseitig, sobald beide Richtungen als Abweichung von der Nullhypothese zählen, und das ist die weit überwiegende Zahl der Fälle; einseitig nur dann, wenn das Ergebnis in die Gegenrichtung Sie überhaupt nicht interessiert und das vorher gesagt wurde. Die zweite Entscheidung ist die Verteilung. Passen Sie sie dazu, wie die Prüfgröße gebildet wurde, und nicht dazu, welcher p-Wert Ihnen lieber wäre: z für Anteile oder Mittelwerte mit bekannter Varianz, t, wenn Streuung und Mittelwert aus derselben kleinen Stichprobe stammen, Chi-Quadrat beim Auszählen von Häufigkeiten, F beim Vergleich zweier Varianzen. Ein Fehlgriff an dieser Stelle ist der häufigste Weg, aus einer richtigen Rechnung eine bedeutungslose Zahl zu machen.

Rechenbeispiele

  1. z = 1,96, die klassische zweiseitige Schwelle

    1. Oberer Rand: P(Z ≥ 1,96) = 0,025002, berechnet aus der Standardnormalverteilung
    2. Die Normalkurve ist symmetrisch, der untere Rand ist also genauso groß: P(Z ≤ −1,96) = 0,025002
    3. Zweiseitig: 2 × 0,025002 = 0,050004
    4. In Prozent sind das 5,0000 % – genau die 5 %, die alle im Kopf haben

    Der Wert 1,96 ist gerade deshalb gewählt, weil er auf die 5 % zielt; dass dort 4,9996 erscheint und nicht glatt 5,0000, ist kein Rechenfehler – das wahre Quantil ist 1,959964, und 1,96 ist selbst schon gerundet. Die beiden Freiheitsgrad-Felder sind hier gefüllt, gelesen werden aber nur die Prüfgröße und die Einstellung der Seite, denn z braucht keinen einzigen Freiheitsgrad: Die ungenutzten Felder stehen immer auf dem Bildschirm, und was darin steht, ändert am Ergebnis nichts.

  2. t = 2,2281 bei 10 Freiheitsgraden

    1. Die t-Verteilung mit 10 Freiheitsgraden hat schwerere Ränder als die Normalkurve
    2. Oberer Rand: P(T ≥ 2,2281) = 0,0250015
    3. Zweiseitig: 2 × 0,0250015 = 0,050003, also 5,0003 %

    Neben den z-Kasten darüber gestellt wird sichtbar, wozu die t-Verteilung da ist: Bei derselben Randfläche von 5 % liegt die Schwelle bei 2,2281 und nicht bei 1,96, weil eine kleine Stichprobe weiter hinausgehen muss, damit die Belege ebenso selten werden. Genau diese Lücke verwaltet der Stichprobenumfang – bei 1.000 Freiheitsgraden beträgt der kritische t-Wert 1,962, und dann sind die beiden Verteilungen praktisch dieselbe Kurve.

  3. χ² = 20 bei 3 Freiheitsgraden, nur der obere Rand

    1. Die Chi-Quadrat-Verteilung hat keine negative Hälfte, hier ist also nur der obere Rand berechenbar
    2. Bei 3 Freiheitsgraden ist P(χ² ≥ 20) = 0,00016975
    3. In Prozent: 0,017 %

    Diese Prüfgröße ist genau die, die die Chi-Quadrat-Seite aus den beobachteten Häufigkeiten 30, 10, 20 und 40 gegen eine gleichverteilte Erwartung errechnet; der p-Wert von 0,017 % sagt, dass diese vier Kategorien nicht gleich wahrscheinlich sind. Zu beachten ist, was hier fehlt und eigens nachgefragt werden muss: Diese Seite sagt, wie selten die Prüfgröße ist, und erwähnt mit keinem Wort, wie klein die kleinste erwartete Häufigkeit ist – und gerade sie entscheidet, ob die Chi-Quadrat-Näherung auf diesen Daten trägt.

Einschränkungen

Der p-Wert beantwortet eine sehr enge Frage, wird aber häufig so gelesen, als beantwortete er einige andere, die er nicht beantworten kann. Er ist nicht die Wahrscheinlichkeit, dass die Nullhypothese wahr ist, nicht die Wahrscheinlichkeit, dass dieses Ergebnis Zufall ist, und er misst auch nicht, wie groß ein Effekt ist – bei ausreichend großer Stichprobe wird ein belangloser Unterschied hochsignifikant, und bei zwölf Beobachtungen kann ein wichtiger Unterschied bei p = 0,20 stehen bleiben. Er ist außerdem nur so verlässlich wie das Modell hinter der Prüfgröße: Alle vier Verteilungen setzen unabhängige Beobachtungen voraus, und eine Prüfgröße aus einer Klumpenstichprobe oder aus wiederholten Messungen hat weniger unabhängige Beobachtungen, als ihre Formel annimmt, sodass jeder für sie berichtete p-Wert zu klein ausfällt. An zwei Stellen hält die Seite hart dagegen, statt es der Leserin zu überlassen: Chi-Quadrat und F lehnen negative Prüfgrößen ab, weil diese beiden Verteilungen nur auf der positiven Halbachse leben und ein negativer Wert bedeutet, dass die Prüfgröße falsch gerechnet wurde; Chi-Quadrat und F lehnen außerdem zweiseitig ab, weil sie unsymmetrisch sind und es für sie keine anerkannte einheitliche zweiseitige Fassung gibt.

Häufige Fragen

Was ist ein p-Wert?
Die Wahrscheinlichkeit, eine Prüfgröße zu erhalten, die mindestens so extrem ist wie die, die Sie in der Hand halten – und zwar unter der Annahme, dass die Nullhypothese gilt und das Modell hinter der Prüfgröße zutrifft. Er beschreibt die Daten und nicht die Hypothese: Ein kleiner p-Wert sagt, dass dieses Ergebnis sehr selten wäre, wenn nichts los wäre, und das ist nicht dasselbe wie »da ist etwas los«. Von hier zur Schlussfolgerung sind zwei Schritte zu gehen: der Schritt über das vorher festgelegte Signifikanzniveau und der Schritt über alles, was Sie über die Sache wissen und in den Zahlen nicht steht.
Soll ich einseitig oder zweiseitig testen?
Zweiseitig, außer Sie haben vor dem Blick auf die Daten einseitig festgelegt und können sagen, welche Richtung Sie vorhergesagt haben. Ein zweiseitiger Test zählt ein Ergebnis in jede Richtung als Beleg gegen die Nullhypothese, und das passt zu der Art, wie die meisten Fragen gestellt sind: Ein Medikament, das die Lage verschlechtert, ist ebenfalls ein Befund. Ein einseitiger Test ist für sich genommen zulässig, aber er halbiert den p-Wert, und die Seite erst nach dem Blick auf die Daten auszuwählen ist der häufigste Weg, ein nicht signifikantes Ergebnis nachträglich signifikant zu machen. Im Zweifel zweiseitig – das ist die konservative Wahl und die, die Gutachterinnen erwarten.
Mit welchem Signifikanzniveau soll ich den p-Wert vergleichen?
Mit dem, das Sie vor der Erhebung festgelegt haben – nach Übereinkunft 0,05, aber diese Übereinkunft ist Gewohnheit und keine Schlussfolgerung. Sie steht bewusst nicht als Eingabe auf dieser Seite, und die Seite druckt auch kein Urteil, weil derselbe p-Wert von 0,04 in einem Zusammenhang ein Fund und in einem anderen Rauschen ist: Wer aus 10.000 Genen ein Signal herausfiltert, braucht eine andere Schwelle als wer eine Hypothese prüft, hinter der zehn Jahre Forschung stehen. Die Übereinkunft, die es wert ist, beibehalten zu werden, lautet: die Schwelle vorher wählen und gemeinsam mit dem p-Wert berichten, statt sie zu justieren, nachdem die Zahl auf dem Bildschirm steht.
Warum lassen sich Chi-Quadrat und F nicht zweiseitig rechnen?
Weil diese beiden Verteilungen unsymmetrisch sind und es für sie keine anerkannte zweiseitige Fassung gibt. Das übliche Rezept – den kleineren Rand verdoppeln – versagt ausgerechnet an der wichtigsten Stelle: Bei χ² = 0 stimmen Beobachtung und Erwartung vollständig überein, das ist das denkbar unhäufigste Ergebnis, und das Rezept liefert dafür 0 % als p-Wert. Eine perfekte Anpassung als höchste Signifikanz auszugeben ist kein Rundungsfehler, sondern eine falsche Antwort, und sie erscheint auf dem Bildschirm völlig unauffällig. Bei symmetrischen Verteilungen sind die beiden Ränder eindeutig, und einen davon zu verdoppeln ist exakt; bei unsymmetrischen nimmt man den oberen Rand allein, und der beantwortet genau die Frage, die tatsächlich gestellt wird: Wie überraschend ist eine Prüfgröße dieser Größe?
Warum lehnt die Seite eine negative Chi-Quadrat- oder F-Prüfgröße ab?
Weil diese beiden Prüfgrößen nicht negativ sein können und ein negativer Wert bedeutet, dass diese Zahl nicht aus dem Test stammt, dem sie zugeordnet wurde. Beide sind aus quadrierten Größen gebaut – Chi-Quadrat aus den Quadraten der Abweichungen zwischen Zählwerten, F aus dem Verhältnis zweier Varianzen –, und quadrierte Größen werden nicht kleiner als null. Die Seite könnte natürlich 100 % zurückgeben, und das wäre arithmetisch in sich stimmig, aber damit hätte sie eine falsch gerechnete Eingabe hingenommen und als echtes Ergebnis ausgegeben. Die Ablehnung kostet hier nichts, denn es gibt keine zulässige negative Chi-Quadrat-Prüfgröße, die dadurch draußen bliebe.
Warum gibt es auf dieser Seite keine Tabelle der kritischen Werte?
Weil eine p-Wert-Tabelle nur über die Prüfgröße zu indexieren wäre, und die Prüfgröße kann jede Zahl sein – eine solche Tabelle bräuchte unendlich viele Zeilen. Die Tabellen in den Anhängen von Lehrbüchern sind andersherum aufgebaut: ein paar Zeilen für die üblichen Signifikanzniveaus, ein paar Spalten für die Freiheitsgrade, die man brauchen könnte. Auf eine Seite passt das nur, weil die Signifikanzniveaus wenige und vorher vereinbart sind. Diese Seite wertet an genau der Prüfgröße aus, die Sie eingetragen haben, und das ist das, was eine Tabelle nicht kann: Sie sagt Ihnen nur, auf welcher Seite der paar Zahlen Ihre Prüfgröße liegt, die sie gerade auflistet. Die nächste Tabelle dieser Gruppe steht auf der Seite für den kritischen Wert; dort sind die Zeilen die Signifikanzniveaus und die Spalten die zugehörigen z-Werte. Die beiden Seiten sind zwei Lesarten desselben Sachverhalts, deshalb zeigt das erste verwandte Werkzeug jeder Seite auf die andere.

Quellen

Verwandte Rechner