Weiterbildung, Statistik und Studienbewertung · Stufe WBJ 2

Schließende Statistik: Konfidenzintervall, p-Wert, Power und Fallzahl

Ein p-Wert beantwortet eine enge Frage; welche Entscheidung daraus folgt, zeigt erst das Konfidenzintervall.

Lernziele
  • Den p-Wert korrekt definieren und die häufigsten Fehldeutungen nach der ASA-Stellungnahme erkennen.
  • Konfidenzintervalle gegen Nullwert und klinische Relevanzgrenze lesen und nicht schlüssige von negativen Studien unterscheiden.
  • Fehler 1. und 2. Art, Power und ihre Einflussgrößen erklären.
  • Die Fallzahl für den Vergleich zweier Anteile berechnen und die Grenzen der Formel benennen.
  • Für häufige Fragestellungen den passenden Test wählen, einschließlich gepaarter und exakter Tests.
  • Das Problem multipler Tests quantifizieren und Korrekturverfahren einordnen.
  • Nichtunterlegenheits- und Äquivalenzstudien anhand der Marge und des Konfidenzintervalls deuten.
  • Fragility Index und bayesianische Kennzahlen als Ergänzung zur Signifikanz nutzen.
  • Die Anforderungen von SPIRIT 2025 und CONSORT 2025 an Fallzahl, Analyseplan und Analysepopulation benennen.

Zu dieser Lerneinheit

  1. Sechs Lektionen mit drei interaktiven Rechnern, drei Rechenaufgaben, sechs Übungen, ein klinischer Fall mit drei Fragen, Aufgaben und ein Abschlussquiz mit zehn Fragen.
  2. Voraussetzungen: Daten beschreiben und Diagnostische Tests (Bayes-Logik mit Odds).
  3. Anwendung beim Lesen von Studien: Publikationsupdates; eigene Studienplanung: Forschung und Translation; Einordnung in Empfehlungen: Aktuelle Leitlinien.

Lektion 1

Nullhypothese, p-Wert und seine Fehldeutungen

Schließende Statistik zieht aus einer Stichprobe Schlüsse auf eine Grundgesamtheit. Eine Studie mit 400 Patienten will nicht wissen, was bei diesen 400 geschah, sondern was bei künftigen Patienten zu erwarten ist. Weil jede Stichprobe zufällig von der Grundgesamtheit abweicht, braucht es Werkzeuge, die diese Unsicherheit beziffern. Die beiden wichtigsten sind der p-Wert und das Konfidenzintervall; beide werden in der Praxis häufig falsch gelesen.1

Nullhypothese und Teststatistik

Der klassische Signifikanztest beginnt mit einer Nullhypothese, meist „kein Unterschied zwischen den Gruppen“. Aus den Daten wird eine Teststatistik berechnet, die misst, wie weit das Beobachtete von der Nullhypothese entfernt liegt, zum Beispiel die Differenz zweier Mittelwerte geteilt durch ihren Standardfehler. Der p-Wert ist die Wahrscheinlichkeit, unter der Annahme, dass die Nullhypothese und alle Modellannahmen zutreffen, eine Teststatistik zu erhalten, die mindestens so extrem ist wie die beobachtete.1 Liegt er unter einer vorab festgelegten Schwelle α, meist 0,05, wird die Nullhypothese verworfen. Diese Logik geht auf das Konzept der Hypothesentests zurück, das Fehlentscheidungen auf lange Sicht begrenzt; über die einzelne Studie sagt sie weniger, als die Zahl vermuten lässt.2

Ein zweiseitiger Test fragt nach Abweichungen in beide Richtungen, ein einseitiger nur in eine. Einseitige Tests erreichen leichter Signifikanz und sind nur gerechtfertigt, wenn eine Abweichung in die andere Richtung vorab als bedeutungslos definiert wurde; das ist in der klinischen Forschung selten, denn eine Therapie kann auch schaden. Eine Ausnahme bilden Nichtunterlegenheitsstudien (Lektion 5).

Was der p-Wert nicht ist

Die Amerikanische Statistische Gesellschaft hat 2016 sechs Grundsätze formuliert, die bis heute die Grundlage für den Umgang mit p-Werten bilden. Der p-Wert kann anzeigen, wie unvereinbar die Daten mit einem bestimmten statistischen Modell sind. Er misst nicht die Wahrscheinlichkeit, dass die untersuchte Hypothese wahr ist, und nicht die Wahrscheinlichkeit, dass die Daten allein durch Zufall entstanden sind. Wissenschaftliche Schlüsse und klinische Entscheidungen sollten nicht allein davon abhängen, ob ein p-Wert eine Schwelle unterschreitet. Richtige Schlussfolgerungen verlangen vollständige Berichterstattung und Transparenz. Der p-Wert misst weder die Größe eines Effekts noch die Bedeutung eines Ergebnisses. Und für sich allein ist er kein gutes Maß für die Evidenz zugunsten eines Modells oder einer Hypothese.3

Exakte p-Werte statt Sternchen

Die Schwelle von 0,05 ist eine Konvention, keine Naturkonstante. Ein p-Wert von 0,049 und einer von 0,051 unterscheiden sich in ihrer Aussage kaum, werden aber oft als „positiv“ und „negativ“ gegensätzlich behandelt. Berichtet werden deshalb exakte p-Werte, etwa „p = 0,03“ statt „p < 0,05“ oder Sternchen, zusammen mit Effektschätzung und Konfidenzintervall. Die Schwelle behält ihre Aufgabe, wenn vor Studienbeginn eine Entscheidungsregel für den primären Endpunkt festgelegt wird; für alle anderen Analysen ist sie eher hinderlich. Transparenz verlangt außerdem, alle durchgeführten Analysen offenzulegen und nicht nur die signifikanten: Wer aus zehn Auswertungen die eine mit p unter 0,05 berichtet, erzeugt einen p-Wert, der seine Bedeutung verloren hat.3

Tabelle 1: Häufige Fehldeutungen von p-Wert und Konfidenzintervall
FehldeutungRichtig ist
p = 0,03 heißt: Mit 3 % Wahrscheinlichkeit ist die Nullhypothese wahr.Der p-Wert wird unter der Annahme berechnet, dass die Nullhypothese wahr ist; über ihre Wahrscheinlichkeit sagt er direkt nichts.
p = 0,03 heißt: Mit 3 % Wahrscheinlichkeit ist das Ergebnis Zufall.Er beschreibt, wie ungewöhnlich die Daten unter dem Nullmodell wären, nicht die Ursache der Daten.
p > 0,05 beweist, dass kein Unterschied besteht.Ein nicht signifikantes Ergebnis kann mit relevanten Effekten vereinbar sein; das Konfidenzintervall zeigt, mit welchen.
Ein kleiner p-Wert zeigt einen großen, wichtigen Effekt.Bei großen Stichproben werden auch belanglose Effekte signifikant.
p = 0,049 und p = 0,051 sind grundverschieden.Beide Ergebnisse liefern fast dieselbe Evidenz.
Ein 95-%-KI enthält den wahren Wert mit 95 % Wahrscheinlichkeit.Das Verfahren erfasst bei vielen Wiederholungen in 95 % den wahren Wert; für ein einzelnes berechnetes Intervall ist das keine Wahrscheinlichkeitsaussage im frequentistischen Sinn.

Die Liste der Fehldeutungen ist lang; eine viel zitierte Übersicht führt mehr als zwanzig davon auf.4 Drei davon sind in Prüfungen und im Alltag besonders folgenreich: der p-Wert als Wahrscheinlichkeit der Nullhypothese, das nicht signifikante Ergebnis als Beweis der Gleichheit und die Gleichsetzung von statistischer Signifikanz mit klinischer Bedeutung. Wer diese drei vermeidet, liest die meisten Studien bereits deutlich besser als der Durchschnitt.

Übung 1.1

Lektion 2

Konfidenzintervall und klinische Relevanz

Das Konfidenzintervall ist die informativere Schwester des p-Werts. Es zeigt nicht nur, ob ein Effekt mit „kein Effekt“ vereinbar ist, sondern auch, wie groß er plausiblerweise ist. Für die klinische Bewertung ist es deshalb die wichtigere Angabe; CONSORT 2025 verlangt für jeden Endpunkt die Effektschätzung mit ihrer Präzision.5

Was ein Konfidenzintervall ist

Ein 95-%-Konfidenzintervall entsteht aus einem Verfahren, das bei vielfacher Wiederholung der Studie in 95 % der Fälle den wahren Wert einschließt.1 Seine Breite hängt von der Streuung der Daten und von der Stichprobengröße ab: Große Studien liefern schmale, kleine Studien breite Intervalle. Praktisch lässt sich ein Intervall als Bereich der mit den Daten gut vereinbaren Effektgrößen lesen. Schließt das 95-%-Intervall den Nullwert aus (0 bei Differenzen, 1 bei Verhältnissen wie relativem Risiko oder Hazard Ratio), ist der entsprechende zweiseitige Test bei α = 0,05 signifikant; schließt es ihn ein, nicht.4

Signifikanz und klinische Relevanz

Klinische Relevanz wird nicht aus den Daten abgelesen, sondern vorher festgelegt: Welche Differenz würde die Behandlung ändern, unter Berücksichtigung von Nebenwirkungen, Aufwand und Kosten? Diese minimale klinisch relevante Differenz ist die Referenz, an der ein Konfidenzintervall gemessen wird. Abbildung 1 zeigt fünf typische Konstellationen für eine Risikodifferenz mit einer angenommenen Relevanzgrenze von 5 Prozentpunkten. Intervall A liegt vollständig im Bereich relevanten Nutzens. Intervall B ist signifikant, weil es die Null ausschließt, erreicht aber nirgends die Relevanzgrenze: ein Befund, wie er in sehr großen Studien oder Registerauswertungen häufig vorkommt. Intervall C ist nicht signifikant, aber so breit, dass es sowohl relevanten Nutzen als auch Schaden zulässt; die Studie ist nicht schlüssig und beweist nichts. Intervall D ist ebenfalls nicht signifikant, aber schmal und schließt relevanten Nutzen aus; hier ist die Aussage „kein relevanter Effekt“ gerechtfertigt. Intervall E zeigt einen Nutzen, dessen Größe offen bleibt.

-15-10-505Risikodifferenz in Prozentpunktenrelevanter Nutzenkein EffektArelevanter Nutzen belegtBsignifikant, aber kleinCnicht schlüssig, zu ungenauDrelevanter Nutzen ausgeschlossenENutzen, Größe unsicher
Abbildung 1: Fünf Konfidenzintervalle für eine absolute Risikodifferenz (negativ bedeutet weniger Ereignisse unter der Intervention). Durchgezogene Linie: kein Effekt; gestrichelt: angenommene Relevanzgrenze von 5 Prozentpunkten; grün hinterlegt: relevanter Nutzen. Eigene Darstellung

Der Vergleich von C und D ist der Kern vieler Missverständnisse. Beide Studien haben einen p-Wert über 0,05, aber nur D rechtfertigt die Aussage, die Intervention bringe keinen relevanten Nutzen. „Kein Nachweis eines Effekts“ ist nicht dasselbe wie „Nachweis, dass kein Effekt besteht“. Umgekehrt macht ein sehr kleiner p-Wert Intervall B nicht wichtiger: Bei großen Stichproben wird fast jede Abweichung signifikant.6 Wer Studien beurteilt, sollte deshalb zuerst nach dem Intervall und der Relevanzgrenze fragen und erst danach nach dem p-Wert. Absolute Effektmaße wie die Risikodifferenz sind für diese Bewertung besser geeignet als relative, weil sie die Ausgangsrate berücksichtigen; die Rechenwege zeigt die Einheit Effektmaße, Beispiele die Einheit Publikationsupdates.

Konfidenzintervall und Stichprobengröße

Weil die Breite eines Intervalls mit der Wurzel der Fallzahl abnimmt, braucht eine Halbierung der Breite die vierfache Zahl an Patienten. Kleine Studien können deshalb kaum je einen relevanten Effekt ausschließen, und ihre signifikanten Ergebnisse überschätzen die Effektgröße häufig: Nur große zufällige Abweichungen überschreiten bei kleiner Fallzahl die Signifikanzschwelle. Dieses Phänomen erklärt, warum eindrucksvolle Effekte aus kleinen Einzelstudien in größeren Folgestudien oft schrumpfen.7

Übung 2.1

Lektion 3

Fehler 1. und 2. Art, Power und Fallzahlplanung

Jede Testentscheidung kann auf zwei Arten falsch sein. Die Fallzahlplanung legt vor Studienbeginn fest, wie oft das höchstens geschehen darf, und bestimmt damit, wie viele Patienten nötig sind. Sie ist wissenschaftlich und ethisch geboten: Eine zu kleine Studie belastet Patienten, ohne eine Antwort liefern zu können, eine zu große setzt mehr Patienten als nötig einem Risiko aus.8

Tabelle 2: Testentscheidung und Wirklichkeit
Nullhypothese trifft zu (kein Effekt)Nullhypothese trifft nicht zu (Effekt vorhanden)
Nullhypothese verworfenFehler 1. Art, Wahrscheinlichkeit α (falsch positiv)richtige Entdeckung, Wahrscheinlichkeit 1 − β (Power)
Nullhypothese beibehaltenrichtige Entscheidung, Wahrscheinlichkeit 1 − αFehler 2. Art, Wahrscheinlichkeit β (falsch negativ)

Power

Die Power ist die Wahrscheinlichkeit, einen vorab festgelegten Effekt bei gegebenen Annahmen mit dem gewählten Test als signifikant zu erkennen. Sie steigt mit der Größe des angenommenen Effekts, mit der Stichprobengröße und mit dem Signifikanzniveau, und sie sinkt mit der Streuung der Daten oder, bei binären Endpunkten und gleichem relativem Effekt, mit sinkender Ereignisrate. Üblich sind 80 oder 90 %. Eine Power von 80 % bedeutet: Selbst wenn der angenommene Effekt tatsächlich besteht, verfehlt jede fünfte Studie dieser Größe die Signifikanz.2

Die Fallzahlformel für zwei Anteile

Für den Vergleich zweier Ereignisraten p1 und p2 mit gleich großen Gruppen gilt nach der Normalapproximation: n je Gruppe = [z1−α/2 × √(2 p̄ (1 − p̄)) + z1−β × √(p1(1 − p1) + p2(1 − p2))]² / (p1 − p2)², wobei p̄ der Mittelwert beider Raten ist. Für α = 0,05 zweiseitig ist z = 1,96, für 80 % Power 0,84, für 90 % Power 1,28. Entscheidend ist der Nenner: Die Fallzahl wächst mit dem Quadrat des Kehrwerts der Differenz. Eine halb so große Differenz verlangt etwa die vierfache Fallzahl.8

Fallzahl für den Vergleich zweier Anteile

Normalapproximation für zwei unabhängige Gruppen gleicher Größe, zweiseitiger Test, ohne Kontinuitätskorrektur. Nicht berücksichtigt: Cluster, Messwiederholungen, Zwischenauswertungen, ungleiche Gruppen, Nichtunterlegenheit, mehrere primäre Endpunkte. Bei kleinen Fallzahlen oder Ereignisraten nahe 0 sind exakte Verfahren genauer. Das Ergebnis ist eine Planungsgröße, kein Ersatz für statistische Beratung.

Signifikanzniveau α (zweiseitig)
Patienten je Gruppe (auswertbar)
je Gruppe einzuschließen (mit Ausfällen)
insgesamt einzuschließen
absolute Differenz und NNT

Probieren Sie mit dem Rechner aus, was eine optimistische Annahme bewirkt. Wird eine Senkung von 10 auf 3 % angenommen, genügen etwa 194 Patienten je Gruppe. Beträgt der tatsächliche Effekt nur 2 Prozentpunkte (10 auf 8 %), wären über 3200 je Gruppe nötig. Genau diese Lücke fand eine Analyse multizentrischer Anästhesiestudien großer Zeitschriften aus den Jahren 2011 bis 2021: Der Median der angenommenen absoluten Effekte lag bei 7 %, der beobachteten bei 2 %.7

Die Zielgröße ist die wichtigste Annahme

Die Wahl der Zielgröße, also des angenommenen Unterschieds, ist die folgenreichste Entscheidung der Fallzahlplanung.8 Sie sollte sich an einer klinisch relevanten Differenz und an realistischen Schätzungen aus Vorstudien orientieren, nicht an der verfügbaren Patientenzahl. Eine unrealistisch große Annahme erzeugt eine scheinbar ausreichend große, tatsächlich aber zu schwache Studie. Zusätzlich müssen Ausfälle, Protokollabweichungen, Cluster (Designeffekt, siehe Daten beschreiben) und Zwischenauswertungen berücksichtigt werden; dafür reicht die einfache Formel oft nicht. SPIRIT 2025 verlangt, dass das Protokoll die Grundlage der Fallzahlberechnung, die statistischen Methoden und den Umgang mit fehlenden Daten vorab beschreibt und den statistischen Analyseplan zugänglich macht.9

Zwischenauswertungen und vorzeitiger Abbruch

Große Studien werden oft mit geplanten Zwischenauswertungen durchgeführt, damit ein klarer Nutzen oder Schaden früh erkannt wird. Jede Zwischenauswertung ist ein zusätzlicher Test; ohne Anpassung stiege die Wahrscheinlichkeit eines falsch positiven Ergebnisses. Deshalb werden strenge Abbruchgrenzen verwendet, die zu frühen Zeitpunkten sehr kleine p-Werte verlangen und das Signifikanzniveau für die Endauswertung weitgehend erhalten (Lehrbuchwissen). Wird eine Studie wegen Nutzens vorzeitig beendet, ist der geschätzte Effekt dennoch häufig zu groß, weil der Abbruch gerade dann erfolgt, wenn der Zufall den Effekt vergrößert hat. Wird sie dagegen wegen langsamer Rekrutierung beendet, fehlt die geplante Power. In beiden Fällen gehören der Grund des Abbruchs und die erreichte Fallzahl in die Bewertung; SPIRIT 2025 verlangt, Abbruchregeln und Zwischenauswertungen vorab im Protokoll festzulegen.9

Nachträgliche Power

Nach einer nicht signifikanten Studie wird gelegentlich eine „beobachtete Power“ aus dem gefundenen Effekt berechnet. Diese Rechnung liefert keine neue Information: Sie ist eine direkte Umrechnung des p-Werts, und ein nicht signifikantes Ergebnis hat zwangsläufig eine niedrige beobachtete Power.4, 6 Aussagekräftig ist stattdessen das Konfidenzintervall: Es zeigt, welche Effekte die Studie ausschließen kann und welche nicht.

Übung 3.1

Übung 3.2, Rechenaufgabe

Rechenaufgabe: Eine Studie soll zeigen, dass eine Maßnahme die Rate postoperativer Pneumonien von 20 % auf 10 % senkt (α = 0,05 zweiseitig, Power 80 %). Wie viele auswertbare Patienten braucht jede Gruppe (Normalapproximation, aufgerundet), und wie viele müssen je Gruppe eingeschlossen werden, wenn 10 % Ausfälle erwartet werden?

Lektion 4

Testauswahl und multiples Testen

Die Wahl des Tests folgt aus drei Fragen: Welcher Datentyp liegt vor, wie viele Gruppen werden verglichen, und sind die Beobachtungen unabhängig oder verbunden? Verbunden (gepaart) sind Daten, wenn dieselben Patienten zweimal gemessen werden, wenn Patienten gezielt paarweise zugeordnet wurden oder wenn in einer Überkreuzstudie beide Behandlungen nacheinander erfolgen.2

Tabelle 3: Testauswahl für häufige Fragestellungen (Lehrbuchwissen)
FragestellungUnabhängige GruppenVerbundene Daten
Zwei Gruppen, metrisch, annähernd normalverteiltt-Test (Welch-Variante bei ungleichen Varianzen)gepaarter t-Test
Zwei Gruppen, ordinal oder schiefMann-Whitney-U-Test (Wilcoxon-Rangsummentest)Wilcoxon-Vorzeichen-Rang-Test
Mehr als zwei Gruppen, metrischVarianzanalysegemischtes Modell oder Varianzanalyse mit Messwiederholung
Mehr als zwei Gruppen, ordinal oder schiefKruskal-Wallis-TestFriedman-Test
Anteile (nominal)Chi-Quadrat-Test; exakter Test nach Fisher bei kleinen erwarteten HäufigkeitenMcNemar-Test
Zusammenhang zweier MerkmaleKorrelation nach Pearson (metrisch) oder Spearman (Ränge), Regressiongemischtes Modell
Zeit bis EreignisLog-Rank-Test, Cox-Regressiongeschichtete oder gemischte Modelle

Parametrisch oder nichtparametrisch

Parametrische Tests wie der t-Test setzen voraus, dass die Stichprobenmittelwerte annähernd normalverteilt sind; bei mittleren und großen Stichproben ist das dank des zentralen Grenzwertsatzes auch bei mäßig schiefen Rohdaten meist erfüllt. Rangbasierte Tests wie der Mann-Whitney-U-Test brauchen diese Annahme nicht und eignen sich für ordinale Daten wie Schmerzskalen. Sie vergleichen die Verteilungen über Ränge; nur wenn die Verteilungen dieselbe Form haben, lässt sich das Ergebnis als Unterschied der Mediane deuten. Der Chi-Quadrat-Test für Anteile ist eine Näherung; sind erwartete Zellhäufigkeiten klein (Faustregel: unter 5), ist der exakte Test nach Fisher vorzuziehen. Der häufigste Fehler in der Praxis ist nicht die Wahl zwischen diesen Tests, sondern das Übersehen verbundener Daten: Werden Vorher-Nachher-Messungen wie zwei unabhängige Gruppen ausgewertet, geht die Paarung verloren, und die Power sinkt, weil die Unterschiede zwischen Patienten die Veränderung innerhalb der Patienten überdecken.

Multiples Testen

Jeder Test mit α = 0,05 hat, wenn die Nullhypothese stimmt, eine Wahrscheinlichkeit von 5 % für ein falsch positives Ergebnis. Werden viele Tests durchgeführt, summiert sich dieses Risiko. Die familienweise Fehlerrate, also die Wahrscheinlichkeit mindestens eines falsch positiven Ergebnisses, beträgt bei k unabhängigen Tests 1 − 0,95k und steigt bei 20 Tests auf über 60 %.10 Viele sekundäre Endpunkte, Subgruppen, Zeitpunkte und alternative Auswertungen erzeugen so fast zwangsläufig „signifikante“ Befunde.

Wie oft trifft der Zufall bei vielen Tests?

Annahmen: k unabhängige Tests, jeweils mit α = 0,05, und alle Nullhypothesen sind wahr. Bei abhängigen Tests fällt die familienweise Fehlerrate niedriger aus, die Tendenz bleibt.

Wahrscheinlichkeit mindestens eines falsch positiven Ergebnisses
erwartete Zahl falsch positiver Tests
Schwelle je Test nach Bonferroni

Gegenmittel gibt es auf drei Ebenen. In der Planung wird ein einziger primärer Endpunkt festgelegt, alle weiteren gelten als sekundär oder explorativ; das Protokoll benennt die Analysen vorab.9 In der Auswertung korrigieren Verfahren das Signifikanzniveau: Die Bonferroni-Korrektur teilt α durch die Zahl der Tests und ist einfach, aber konservativ; das Verfahren nach Holm ist schrittweise und etwas mächtiger; Verfahren zur Kontrolle der Falschentdeckungsrate begrenzen den erwarteten Anteil falscher Befunde unter allen signifikanten und eignen sich für explorative Analysen mit vielen Tests.10 In der Deutung schließlich werden Subgruppenbefunde und sekundäre Endpunkte als hypothesengenerierend gelesen, besonders wenn der primäre Endpunkt neutral war.

Übung 4.1

Übung 4.2, Rechenaufgabe

Rechenaufgabe: Eine Studie testet 10 unabhängige sekundäre Endpunkte jeweils mit α = 0,05. Wie groß ist die Wahrscheinlichkeit mindestens eines falsch positiven Ergebnisses, wenn keine Intervention wirkt, und welche Schwelle je Test ergibt die Bonferroni-Korrektur?

Lektion 5

Nichtunterlegenheit und Äquivalenz

Nicht jede Studie will zeigen, dass eine Behandlung besser ist. Oft genügt der Nachweis, dass eine einfachere, billigere oder sicherere Behandlung nicht relevant schlechter ist (Nichtunterlegenheit) oder dass zwei Behandlungen praktisch gleichwertig sind (Äquivalenz). Dafür ist ein eigenes Design nötig, denn ein nicht signifikanter Überlegenheitstest beweist keine Gleichwertigkeit.11

Die Nichtunterlegenheitsgrenze

Kern jeder Nichtunterlegenheitsstudie ist die vorab festgelegte Grenze (Marge): der größte Nachteil, der für die Vorteile der neuen Behandlung noch hingenommen würde. Nichtunterlegenheit gilt als gezeigt, wenn die Grenze des Konfidenzintervalls auf der Seite des Nachteils die Marge nicht überschreitet. Üblich ist dafür ein zweiseitiges 95-%-Intervall, was einem einseitigen Test mit α = 0,025 entspricht. Die Marge muss klinisch und statistisch begründet sein, etwa aus dem bekannten Effekt der Vergleichsbehandlung gegenüber Placebo; eine großzügige Marge macht fast jede Behandlung „nicht unterlegen“.12

0,60,81,01,21,4Hazard Ratio (neue Therapie gegen Kontrolle)kein UnterschiedGrenze 1,125überlegennicht unterlegenPOISE-3, Sicherheitunterlegen
Abbildung 2: Schema zur Nichtunterlegenheit mit Hazard Ratios; rot hinterlegt der Bereich jenseits der Marge von 1,125. Die Zeile POISE-3 gibt den Sicherheitsendpunkt der Studie wieder, die übrigen Zeilen sind konstruierte Beispiele. Eigene Darstellung

Ein Beispiel aus der perioperativen Medizin

POISE-3 randomisierte 9535 Patienten mit nichtkardialen Eingriffen zu Tranexamsäure oder Placebo. Der primäre Wirksamkeitsendpunkt (zusammengesetzt aus lebensbedrohlicher, schwerer oder organkritischer Blutung) trat unter Tranexamsäure bei 9,1 % und unter Placebo bei 11,7 % auf, Hazard Ratio 0,76 (95-%-KI 0,67 bis 0,87). Der primäre Sicherheitsendpunkt, ein zusammengesetzter kardiovaskulärer Endpunkt, sollte Nichtunterlegenheit mit einer Marge von 1,125 für die Hazard Ratio zeigen. Er trat bei 14,2 % gegenüber 13,9 % auf, Hazard Ratio 1,02 (95-%-KI 0,92 bis 1,14). Weil die obere Grenze die Marge knapp überschritt, war die Nichtunterlegenheit formal nicht gezeigt.13 Das Beispiel zeigt die Logik: Nicht der Punktschätzer, sondern die ungünstige Grenze des Intervalls entscheidet, und ein fast identischer Punktschätzer ist noch kein Beleg der Sicherheit. Zugleich zeigt es, dass eine formal verfehlte Nichtunterlegenheit keinen Schaden beweist; das Intervall ist mit keinem und mit einem kleinen Nachteil vereinbar.

Äquivalenz und die Wahl der Analysepopulation

Äquivalenz verlangt, dass das gesamte Konfidenzintervall innerhalb einer oberen und einer unteren Grenze liegt; das entspricht zwei einseitigen Tests. In Überlegenheitsstudien ist die Auswertung nach randomisierter Zuteilung (Intention-to-treat) konservativ, weil Protokollverletzungen die Gruppen einander angleichen. In Nichtunterlegenheitsstudien wirkt dieselbe Angleichung zugunsten der Nichtunterlegenheit. Deshalb werden beide Analysen berichtet, die nach Zuteilung und die nach tatsächlicher Behandlung (per protocol), und beide sollten zum selben Schluss kommen.12, 11 CONSORT 2025 verlangt in jedem Fall eine klare Definition der Analysepopulation.5

Merke

Nichtunterlegenheit: Die ungünstige Intervallgrenze muss innerhalb der vorab begründeten Marge liegen. Ein nicht signifikanter Überlegenheitstest beweist weder Gleichwertigkeit noch Nichtunterlegenheit.

Übung 5.1

Lektion 6

Fragility Index und bayesianische Deutung

Ein signifikantes Ergebnis ist ein Hinweis, kein Beweis. Zwei Werkzeuge helfen, seine Belastbarkeit einzuschätzen: der Fragility Index, der nach der numerischen Stabilität fragt, und die bayesianische Deutung, die nach der Wahrscheinlichkeit eines echten Effekts fragt.

Fragility Index

Der Fragility Index (FI) ist die kleinste Zahl an Patienten, deren Ergebnis von „kein Ereignis“ zu „Ereignis“ wechseln müsste, damit ein signifikantes Ergebnis nicht mehr signifikant ist. Berechnet wird er für zweiarmige Studien mit binärem Endpunkt, indem in der Gruppe mit weniger Ereignissen schrittweise Ereignisse hinzugefügt und der exakte Test nach Fisher neu berechnet wird.14 Ein FI von 2 bedeutet: Hätten zwei Patienten ein anderes Ergebnis gehabt, wäre die Studie „negativ“. Liegt die Zahl der Patienten ohne Nachbeobachtung über dem FI, hängt das Ergebnis im Prinzip an den fehlenden Daten.

Fragility-Index-Rechner

Zweiarmige Studie mit binärem Endpunkt, zweiseitiger exakter Test nach Fisher, Schwelle p < 0,05. In der Gruppe mit weniger Ereignissen werden schrittweise Nichtereignisse in Ereignisse umgewandelt, bis p ≥ 0,05 erreicht ist. Ganze Zahlen, je Gruppe höchstens 5000 Patienten.

Beispiele
Ereignisraten
p-Wert (Fisher, zweiseitig)
Fragility Index
Fragility-Quotient (FI/N)

Eine methodische Untersuchung der randomisierten Studien, auf die sich nordamerikanische und europäische perioperative Leitlinien der Jahre 2012 bis 2022 stützen, fand für 161 Überlegenheitsstudien eine mediane Fallzahl von 120 Patienten und einen medianen FI von 4 (Interquartilsabstand 2 bis 8). In pädiatrischen Studien lag der Median bei 1, und monozentrische Studien waren fragiler als multizentrische.15 Der FI hat Grenzen: Er gilt nur für binäre Endpunkte, hängt an der willkürlichen Schwelle 0,05 und ist eng mit p-Wert und Fallzahl verknüpft. Er ergänzt deshalb die Bewertung von Qualität und Vertrauenswürdigkeit der Evidenz, ersetzt sie aber nicht.15

Bayesianische Deutung

Die frequentistische Statistik beantwortet die Frage: Wie wahrscheinlich sind diese Daten, wenn kein Effekt besteht? Klinisch interessiert meist die umgekehrte Frage: Wie wahrscheinlich besteht ein Effekt, gegeben diese Daten? Diese Frage beantwortet die bayesianische Statistik. Sie verbindet eine Vorabannahme (Prior) mit der Information der Daten (Likelihood) zu einer Nachher-Verteilung (Posterior), aus der sich etwa die Wahrscheinlichkeit eines Nutzens oder eines klinisch relevanten Nutzens ablesen lässt.16 Die Logik gleicht der Nachtestwahrscheinlichkeit eines diagnostischen Tests (siehe Diagnostische Tests): Der Bayes-Faktor spielt die Rolle der Likelihood-Ratio, er gibt an, wie viel wahrscheinlicher die Daten unter der einen Hypothese sind als unter der anderen, und Nachher-Odds sind Vorab-Odds mal Bayes-Faktor.

Ein Rechenbeispiel verdeutlicht, warum „p < 0,05“ weniger sicher ist, als es scheint. Angenommen, von 1000 geprüften Interventionen sind 100 tatsächlich wirksam, die Studien haben 80 % Power und α = 0,05. Dann werden 80 wirksame Interventionen richtig erkannt, aber auch 45 der 900 unwirksamen erscheinen signifikant. Von 125 „positiven“ Studien sind damit 45, also 36 %, falsch positiv. Bei 50 % Power wären es fast die Hälfte. Eine bayesianisch begründete Übersicht zeigt entsprechend, dass die Wahrscheinlichkeit einer unwirksamen Intervention trotz p ≤ 0,05 unter bestimmten Umständen über 25 % liegt, und schlägt Bayes-Faktoren und das Falsch-positiv-Risiko als Ergänzung zu p-Wert und Konfidenzintervall vor.17

Aktuelle Evidenz

Eine Analyse multizentrischer randomisierter Anästhesiestudien in fünf großen Zeitschriften (2011 bis 2021) fand bei 56 primären Endpunkten nur in 12 (21 %) einen als von null verschieden erklärten Effekt. Die angenommenen absoluten Effekte lagen im Median bei 7 % (IQR 3 bis 13), die beobachteten bei 2 % (IQR 1 bis 7). Die Autoren sehen zu geringe Power und die Sterblichkeit als Endpunkt als Hauptgründe; Bayes-Faktoren waren besonders bei p-Werten nahe der Schwelle aufschlussreich.7

Die randomisierten Überlegenheitsstudien hinter aktuellen perioperativen Leitlinien haben einen medianen Fragility Index von 4 (IQR 2 bis 8) bei einer medianen Fallzahl von 120.15

Bei 20 unabhängigen Tests mit α = 0,05 liegt die Wahrscheinlichkeit mindestens eines falsch positiven Ergebnisses über 60 %.10

SPIRIT 2025 umfasst 34 Mindestpunkte für Studienprotokolle, darunter Fallzahlbegründung, statistische Methoden, Umgang mit fehlenden Daten und Zugang zum Analyseplan; CONSORT 2025 umfasst 30 Punkte für den Studienbericht.9, 5

Typische Fehlannahmen
  • „p < 0,05 heißt, die Therapie wirkt mit 95 % Wahrscheinlichkeit.“ Diese Wahrscheinlichkeit hängt von der Vorabplausibilität und der Power ab.
  • „Nicht signifikant heißt gleich wirksam.“ Nur ein schmales Intervall innerhalb der Relevanzgrenzen belegt das.
  • „Die beobachtete Power erklärt ein negatives Ergebnis.“ Sie ist eine Umrechnung des p-Werts.
  • „Wer viele Endpunkte testet, findet mehr Wahrheit.“ Er findet vor allem mehr falsch positive Befunde.
  • „Eine große Studie mit p < 0,001 zeigt einen wichtigen Effekt.“ Die Größe steht im Konfidenzintervall, nicht im p-Wert.

Übung 6.1

Übung 6.2, Rechenaufgabe

Rechenaufgabe: Sie halten eine Wirksamkeit vor einer Studie für 50 % wahrscheinlich. Die Studie liefert einen Bayes-Faktor von 3 zugunsten der Wirksamkeit. Wie wahrscheinlich ist die Wirksamkeit danach? Und wie wahrscheinlich, wenn Sie vorab nur 20 % angenommen hätten?

Lektion 7

Fälle, Merksätze und Aufgaben

Fall 1: Delirprävention nach neuer Studie

Eine 79-jährige Patientin mit Schenkelhalsfraktur, leichter kognitiver Einschränkung und arterieller Hypertonie wird für eine Hemiprothese vorbereitet. In der Frühbesprechung verweist ein Kollege auf eine neu publizierte, monozentrische randomisierte Studie (konstruiertes Beispiel für diese Lerneinheit): Eine zusätzliche perioperative Maßnahme habe das postoperative Delir von 27 von 150 Patienten (18,0 %) auf 13 von 150 (8,7 %) gesenkt, p = 0,026 (exakter Test nach Fisher), Risikodifferenz 9,3 Prozentpunkte (95-%-KI 1,7 bis 17,0). Geplant waren 199 Patienten je Gruppe für eine angenommene Senkung von 20 auf 10 %; die Rekrutierung wurde wegen langsamen Einschlusses nach 150 je Gruppe beendet. 9 Patienten sind ohne Delirerhebung ausgeschieden. Der Kollege schlägt vor, die Maßnahme ab sofort für alle älteren Patienten einzuführen. Mit dem Fragility-Index-Rechner in Lektion 6 können Sie die Studie selbst nachrechnen.

Fall 1, Frage 1

Fall 1, Frage 2

Fall 1, Frage 3

Merksätze

  • Der p-Wert beschreibt die Daten unter der Nullhypothese, nicht die Wahrscheinlichkeit der Hypothese.3
  • Erst das Konfidenzintervall, dann der p-Wert: Intervall gegen Nullwert und Relevanzgrenze lesen.
  • Nicht signifikant heißt nicht gleich; nur ein schmales Intervall innerhalb der Relevanzgrenzen zeigt Gleichwertigkeit.4
  • Die Fallzahl wächst mit dem Quadrat des Kehrwerts der Differenz; optimistische Annahmen erzeugen zu kleine Studien.8, 7
  • Die nachträglich berechnete Power ist eine Umrechnung des p-Werts.6
  • Ein primärer Endpunkt, vorab festgelegte Analysen, Korrektur bei vielen Tests.10, 9
  • Nichtunterlegenheit: ungünstige Intervallgrenze gegen die vorab begründete Marge.12
  • Fragility Index unter der Zahl der Verlorenen: Das Ergebnis hängt an den fehlenden Daten.14

Aufgaben

Aufgabe 1: Fallzahl planen

Gegeben:
Sie planen eine Studie zur Senkung postoperativer Übelkeit und Erbrechen von 30 auf 20 % (α = 0,05 zweiseitig, Power 90 %, 15 % Ausfälle).

Frage:
Wie viele Patienten müssen insgesamt eingeschlossen werden, und welche Annahmen prüfen Sie kritisch?

Lösung

p̄ = 0,25; z = 1,96 und 1,28. n je Gruppe = [1,96 × √(2 × 0,25 × 0,75) + 1,28 × √(0,21 + 0,16)]² / 0,1² = (1,96 × 0,612 + 1,28 × 0,608)² / 0,01 = (1,200 + 0,779)² / 0,01 ≈ 392. Mit 15 % Ausfällen: 392 / 0,85 ≈ 462 je Gruppe, also etwa 924 insgesamt. Kritisch zu prüfen: Ist die Kontrollrate von 30 % realistisch für die geplante Population und Prophylaxe? Ist eine Senkung um 10 Prozentpunkte klinisch relevant und plausibel, oder stammt sie aus einer kleinen, optimistischen Vorstudie? Gibt es Cluster, etwa wenige Anästhesisten je Arm? Diese Angaben gehören nach SPIRIT 2025 ins Protokoll.8, 9

Aufgabe 2: Negatives Ergebnis richtig berichten

Gegeben:
Eine Studie findet für die 30-Tage-Letalität 4,1 % gegenüber 4,6 %, Risikodifferenz -0,5 Prozentpunkte (95-%-KI -2,1 bis +1,1), p = 0,54. Die Autoren schreiben: „Die Intervention hat keinen Einfluss auf die Letalität.“

Frage:
Ist die Formulierung korrekt? Wie wäre sie besser?

Lösung

Die Formulierung geht zu weit. Das Intervall ist mit einer Senkung um 2,1 und einer Zunahme um 1,1 Prozentpunkte vereinbar. Ob das „kein relevanter Einfluss“ bedeutet, hängt von der vorab festgelegten Relevanzgrenze ab: Liegt sie bei 3 Prozentpunkten, schließt das Intervall relevante Effekte aus; liegt sie bei 1 Prozentpunkt, ist das Ergebnis nicht schlüssig. Besser: „Die Letalität unterschied sich nicht signifikant (-0,5 Prozentpunkte, 95-%-KI -2,1 bis +1,1); ein Nutzen oder Schaden von mehr als etwa 2 Prozentpunkten ist mit den Daten wenig vereinbar.“4, 3

Aufgabe 3: Viele Endpunkte, ein Treffer

Gegeben:
Eine Studie mit neutralem primären Endpunkt berichtet 14 sekundäre Endpunkte ohne Korrektur; einer ist mit p = 0,03 signifikant und steht im Titel der Pressemitteilung.

Frage:
Wie ordnen Sie den Befund ein?

Lösung

Bei 14 unabhängigen Tests ohne Effekt beträgt die Wahrscheinlichkeit mindestens eines Treffers 1 − 0,95¹⁴ ≈ 51 %. Nach Bonferroni läge die Schwelle bei 0,05/14 ≈ 0,0036; der Befund wäre nicht signifikant. Der sekundäre Endpunkt ist hypothesengenerierend, besonders bei neutralem primären Endpunkt, und rechtfertigt keine Praxisänderung. Zu prüfen ist, ob er im Protokoll vorab festgelegt war.10, 9

Aufgabe 4: Nichtunterlegenheit beurteilen

Gegeben:
Eine Studie vergleicht eine Larynxmaske der zweiten Generation mit der endotrachealen Intubation für einen Aspirationsendpunkt (konstruiertes Beispiel). Marge: +1,0 Prozentpunkte. Ergebnis nach Zuteilung: Differenz +0,2 (95-%-KI -0,3 bis +0,7); per protocol: +0,4 (95-%-KI -0,2 bis +1,2).

Frage:
Ist Nichtunterlegenheit gezeigt?

Lösung

Nach Zuteilung liegt die obere Grenze (+0,7) unter der Marge, per protocol (+1,2) darüber. Weil in Nichtunterlegenheitsstudien die Auswertung nach Zuteilung die Gruppen einander annähern kann, sollen beide Analysen zum selben Schluss kommen; das ist hier nicht der Fall. Nichtunterlegenheit ist damit nicht überzeugend gezeigt. Zu prüfen sind außerdem die Begründung der Marge und die Zahl der Protokollabweichungen.12, 11

Aufgabenblock abschließen

Markieren Sie den Block als bearbeitet, wenn Sie alle Aufgaben gelöst und mit den Lösungen verglichen haben.

Abschlussquiz, etwa 10 Minuten

Abschlussquiz

Zehn Fragen. Bestanden ab 80 %.

Zum Nachschlagen

Begriffe und Literatur

BegriffBedeutung
NullhypotheseAnnahme ohne Effekt, gegen die ein Signifikanztest prüft
p-WertWahrscheinlichkeit mindestens so extremer Daten unter Nullhypothese und Modellannahmen
KonfidenzintervallBereich aus einem Verfahren, das bei Wiederholung in 95 % den wahren Wert einschließt
Fehler 1. und 2. Artfalsch positive (α) und falsch negative (β) Testentscheidung
PowerWahrscheinlichkeit, einen angenommenen Effekt als signifikant zu erkennen (1 − β)
Familienweise FehlerrateWahrscheinlichkeit mindestens eines falsch positiven Ergebnisses in einer Testfamilie
Nichtunterlegenheitsgrenzevorab festgelegter größter noch akzeptabler Nachteil einer neuen Behandlung
Fragility Indexkleinste Zahl von Ergebniswechseln, die die Signifikanz aufhebt
Bayes-FaktorVerhältnis der Wahrscheinlichkeit der Daten unter zwei Hypothesen
Prior und PosteriorVorabverteilung und Nachher-Verteilung einer Größe in der bayesianischen Analyse

Literatur

  1. Sidebotham D, Hewson D. Core concepts in statistics and research methods. Part I: statistical inference. BJA Educ. 2025;25(1):29-37. doi:10.1016/j.bjae.2024.09.001
  2. Jones PM, Martin J. Core concepts in statistics and research methods. Part 4: null hypothesis significance testing. BJA Educ. 2026;26(1):10-19. doi:10.1016/j.bjae.2025.10.001
  3. Wasserstein RL, Lazar NA. The ASA statement on p-values: context, process, and purpose. Am Stat. 2016;70(2):129-133. doi:10.1080/00031305.2016.1154108 (Grundlagenarbeit)
  4. Greenland S, Senn SJ, Rothman KJ, Carlin JB, Poole C, Goodman SN, Altman DG. Statistical tests, P values, confidence intervals, and power: a guide to misinterpretations. Eur J Epidemiol. 2016;31(4):337-350. doi:10.1007/s10654-016-0149-3 (Grundlagenarbeit)
  5. Hopewell S, Chan AW, Collins GS, Hróbjartsson A, Moher D et al. CONSORT 2025 statement: updated guideline for reporting randomised trials. BMJ. 2025;389:e081123. doi:10.1136/bmj-2024-081123
  6. Zaniletti I, Devick KL, Larson DR, Lewallen DG, Berry DJ, Maradit Kremers H. P-values and power in orthopedic research: myths and reality. J Arthroplasty. 2022;37(10):1945-1950. doi:10.1016/j.arth.2022.05.026
  7. Seretny M, Barlow J, Sidebotham D. Multicentre randomised trials in anaesthesia: an analysis using Bayesian metrics. Anaesthesia. 2023;78(1):73-80. doi:10.1111/anae.15867
  8. Bould MD, McIsaac DI. Core concepts in statistics and research methods. Part 6: sample size calculations. BJA Educ. 2026;26(5):212-221. doi:10.1016/j.bjae.2026.02.002
  9. Chan AW, Boutron I, Hopewell S, Moher D, Schulz KF et al. SPIRIT 2025 statement: updated guideline for protocols of randomised trials. BMJ. 2025;389:e081477. doi:10.1136/bmj-2024-081477
  10. Sidebotham D, Chen X. The perils of multiple statistical tests: controlling for false positives. Br J Anaesth. 2026;136(2):486-490. doi:10.1016/j.bja.2025.11.008
  11. Walker J. Non-inferiority statistics and equivalence studies. BJA Educ. 2019;19(8):267-271. doi:10.1016/j.bjae.2019.03.004
  12. Piaggio G, Elbourne DR, Pocock SJ, Evans SJW, Altman DG; CONSORT Group. Reporting of noninferiority and equivalence randomized trials: extension of the CONSORT 2010 statement. JAMA. 2012;308(24):2594-2604. doi:10.1001/jama.2012.87802 (Grundlage, weiterhin gültige Erweiterung)
  13. Devereaux PJ, Marcucci M, Painter TW, Conen D et al. Tranexamic acid in patients undergoing noncardiac surgery. N Engl J Med. 2022;386(21):1986-1997. doi:10.1056/NEJMoa2201171
  14. Walsh M, Srinathan SK, McAuley DF, Mrkobrada M et al. The statistical significance of randomized controlled trial results is frequently fragile: a case for a Fragility Index. J Clin Epidemiol. 2014;67(6):622-628. doi:10.1016/j.jclinepi.2013.10.019 (Grundlagenarbeit)
  15. Otálora-Esteban M, Segura-Salguero JC, Zabida A, Echeverri-Mallarino V, Díaz-Bohada L et al. Fragility Index of randomized clinical trials in perioperative anesthesia: a methodologic survey of guideline-supporting evidence. Anesthesiology. 2026, online vor Druck. doi:10.1097/ALN.0000000000006311
  16. Barlow CJ, Sidebotham D. Core concepts in statistics and research methods. Part 3: essentials of Bayesian inference. BJA Educ. 2025;25(8):326-334. doi:10.1016/j.bjae.2025.02.006
  17. Sidebotham D, Barlow CJ, Martin J, Jones PM. Interpreting frequentist hypothesis tests: insights from Bayesian inference. Can J Anaesth. 2023;70:1560-1575. doi:10.1007/s12630-023-02557-5

Standardwerke

  • Altman DG. Practical Statistics for Medical Research. Chapman and Hall; 1991
  • Kirkwood BR, Sterne JAC. Essential Medical Statistics. 2. Aufl. Blackwell Science; 2003
  • Weiß C. Basiswissen Medizinische Statistik. 7. Aufl. Springer; 2019

© 2026 Ulrich Frey. Alle Rechte vorbehalten. Neufassung für das E-Learning, Recherchestand September 2026. Die Inhalte dienen der Aus- und Weiterbildung und ersetzen keine Leitlinie, keine Fachinformation und keine lokalen Standards.