Schließende Statistik zieht aus einer Stichprobe Schlüsse auf eine Grundgesamtheit. Eine Studie mit 400 Patienten will nicht wissen, was bei diesen 400 geschah, sondern was bei künftigen Patienten zu erwarten ist. Weil jede Stichprobe zufällig von der Grundgesamtheit abweicht, braucht es Werkzeuge, die diese Unsicherheit beziffern. Die beiden wichtigsten sind der p-Wert und das Konfidenzintervall; beide werden in der Praxis häufig falsch gelesen.1
Nullhypothese und Teststatistik
Der klassische Signifikanztest beginnt mit einer Nullhypothese, meist „kein Unterschied zwischen den Gruppen“. Aus den Daten wird eine Teststatistik berechnet, die misst, wie weit das Beobachtete von der Nullhypothese entfernt liegt, zum Beispiel die Differenz zweier Mittelwerte geteilt durch ihren Standardfehler. Der p-Wert ist die Wahrscheinlichkeit, unter der Annahme, dass die Nullhypothese und alle Modellannahmen zutreffen, eine Teststatistik zu erhalten, die mindestens so extrem ist wie die beobachtete.1 Liegt er unter einer vorab festgelegten Schwelle α, meist 0,05, wird die Nullhypothese verworfen. Diese Logik geht auf das Konzept der Hypothesentests zurück, das Fehlentscheidungen auf lange Sicht begrenzt; über die einzelne Studie sagt sie weniger, als die Zahl vermuten lässt.2
Ein zweiseitiger Test fragt nach Abweichungen in beide Richtungen, ein einseitiger nur in eine. Einseitige Tests erreichen leichter Signifikanz und sind nur gerechtfertigt, wenn eine Abweichung in die andere Richtung vorab als bedeutungslos definiert wurde; das ist in der klinischen Forschung selten, denn eine Therapie kann auch schaden. Eine Ausnahme bilden Nichtunterlegenheitsstudien (Lektion 5).
Was der p-Wert nicht ist
Die Amerikanische Statistische Gesellschaft hat 2016 sechs Grundsätze formuliert, die bis heute die Grundlage für den Umgang mit p-Werten bilden. Der p-Wert kann anzeigen, wie unvereinbar die Daten mit einem bestimmten statistischen Modell sind. Er misst nicht die Wahrscheinlichkeit, dass die untersuchte Hypothese wahr ist, und nicht die Wahrscheinlichkeit, dass die Daten allein durch Zufall entstanden sind. Wissenschaftliche Schlüsse und klinische Entscheidungen sollten nicht allein davon abhängen, ob ein p-Wert eine Schwelle unterschreitet. Richtige Schlussfolgerungen verlangen vollständige Berichterstattung und Transparenz. Der p-Wert misst weder die Größe eines Effekts noch die Bedeutung eines Ergebnisses. Und für sich allein ist er kein gutes Maß für die Evidenz zugunsten eines Modells oder einer Hypothese.3
Exakte p-Werte statt Sternchen
Die Schwelle von 0,05 ist eine Konvention, keine Naturkonstante. Ein p-Wert von 0,049 und einer von 0,051 unterscheiden sich in ihrer Aussage kaum, werden aber oft als „positiv“ und „negativ“ gegensätzlich behandelt. Berichtet werden deshalb exakte p-Werte, etwa „p = 0,03“ statt „p < 0,05“ oder Sternchen, zusammen mit Effektschätzung und Konfidenzintervall. Die Schwelle behält ihre Aufgabe, wenn vor Studienbeginn eine Entscheidungsregel für den primären Endpunkt festgelegt wird; für alle anderen Analysen ist sie eher hinderlich. Transparenz verlangt außerdem, alle durchgeführten Analysen offenzulegen und nicht nur die signifikanten: Wer aus zehn Auswertungen die eine mit p unter 0,05 berichtet, erzeugt einen p-Wert, der seine Bedeutung verloren hat.3
| Fehldeutung | Richtig ist |
|---|---|
| p = 0,03 heißt: Mit 3 % Wahrscheinlichkeit ist die Nullhypothese wahr. | Der p-Wert wird unter der Annahme berechnet, dass die Nullhypothese wahr ist; über ihre Wahrscheinlichkeit sagt er direkt nichts. |
| p = 0,03 heißt: Mit 3 % Wahrscheinlichkeit ist das Ergebnis Zufall. | Er beschreibt, wie ungewöhnlich die Daten unter dem Nullmodell wären, nicht die Ursache der Daten. |
| p > 0,05 beweist, dass kein Unterschied besteht. | Ein nicht signifikantes Ergebnis kann mit relevanten Effekten vereinbar sein; das Konfidenzintervall zeigt, mit welchen. |
| Ein kleiner p-Wert zeigt einen großen, wichtigen Effekt. | Bei großen Stichproben werden auch belanglose Effekte signifikant. |
| p = 0,049 und p = 0,051 sind grundverschieden. | Beide Ergebnisse liefern fast dieselbe Evidenz. |
| Ein 95-%-KI enthält den wahren Wert mit 95 % Wahrscheinlichkeit. | Das Verfahren erfasst bei vielen Wiederholungen in 95 % den wahren Wert; für ein einzelnes berechnetes Intervall ist das keine Wahrscheinlichkeitsaussage im frequentistischen Sinn. |
Die Liste der Fehldeutungen ist lang; eine viel zitierte Übersicht führt mehr als zwanzig davon auf.4 Drei davon sind in Prüfungen und im Alltag besonders folgenreich: der p-Wert als Wahrscheinlichkeit der Nullhypothese, das nicht signifikante Ergebnis als Beweis der Gleichheit und die Gleichsetzung von statistischer Signifikanz mit klinischer Bedeutung. Wer diese drei vermeidet, liest die meisten Studien bereits deutlich besser als der Durchschnitt.