Weiterbildung, Statistik und Studienbewertung · Stufe WBJ 1

Effektmaße: relatives Risiko, Odds Ratio, Hazard Ratio und NNT

Ein Effekt ist erst verstanden, wenn er als absolute Zahl für einen Endpunkt, einen Zeitraum und ein Basisrisiko ausgesprochen werden kann.

Lernziele
  • Aus Ereignissen und Gesamtzahlen je Arm Risiken, relatives Risiko, relative und absolute Risikoreduktion berechnen und sprachlich korrekt (Prozent gegenüber Prozentpunkten) berichten.
  • Die NNT mit Endpunkt, Vergleich und Zeitraum angeben, NNTB und NNTH unterscheiden und ihr Konfidenzintervall richtig berichten, auch wenn es die Null einschließt.
  • Die Abhängigkeit der NNT vom Basisrisiko erklären und absolute Effekte für den eigenen Patienten ableiten.
  • Begründen, warum die Odds Ratio bei häufigen Ereignissen den Effekt überzeichnet, und eine OR mit bekanntem Basisrisiko in ein RR umrechnen.
  • Kaplan-Meier-Kurven mit Zensierung und Zahl unter Risiko lesen und Log-Rank-Test, Hazard Ratio und RMST einordnen.
  • Kombinierte Endpunkte, Surrogatendpunkte und „Tage lebend und zu Hause“ kritisch bewerten.
  • Therapievergleich und Diagnostik als unterschiedliche Eingabemodi einer Vierfeldertafel unterscheiden.

Zu dieser Lerneinheit

  1. Sechs Lektionen mit drei Tabellen, zwei eigenen Abbildungen, zwei interaktiven Rechnern, drei Rechenaufgaben und sechs Übungen, ein klinischer Fall mit drei Fragen, Merksätze, vier Aufgaben und ein Abschlussquiz mit zehn Fragen.
  2. Grundlagen zu Konfidenzintervall und p-Wert: Schließende Statistik. Vierfeldertafel in der Diagnostik: Diagnostische Tests.
  3. Weiterführend: Studiendesign, Bias, Metaanalyse und GRADE, Publikationsupdates und Aktuelle Leitlinien.

Lektion 1

Risiken, relatives Risiko und absolute Differenz

Ein Studienergebnis wird im Alltag fast immer in einem Satz weitergegeben: „Das Medikament senkt das Risiko um ein Viertel.“ Dieser Satz klingt eindeutig und ist doch unvollständig. Er verschweigt, von welchem Ausgangsrisiko die Rede ist, über welchen Zeitraum, für welchen Endpunkt und mit welcher Unsicherheit. Die Einheit zeigt, wie Sie aus den Rohdaten einer Studie die passenden Effektmaße berechnen, wie Sie sie übersetzen und wo die typischen Fallen liegen. Die Grundbegriffe Konfidenzintervall und p-Wert werden in der Einheit zur schließenden Statistik vertieft; hier geht es um die Größe und die Lesart eines Effekts.

Risiko, Chance und Rate

Bei einem binären Endpunkt, also einem Ereignis, das eintritt oder nicht eintritt, beschreibt das Risiko den Anteil der Patienten einer Gruppe, bei denen das Ereignis innerhalb eines festgelegten Zeitraums auftritt. Treten bei 20 von 200 Patienten Wundinfektionen innerhalb von 30 Tagen auf, beträgt das Risiko 20/200 = 0,10 oder 10 %. Die Chance (englisch odds) setzt dagegen Ereignisse ins Verhältnis zu Nichtereignissen: 20/180 = 0,11. Eine Rate bezieht Ereignisse auf die beobachtete Personenzeit, etwa Ereignisse je 100 Patiententage. Die drei Größen klingen ähnlich, werden aber verschieden berechnet und dürfen nicht gegeneinander ausgetauscht werden. Bei seltenen Ereignissen liegen Risiko und Chance nahe beieinander, bei häufigen Ereignissen weichen sie deutlich voneinander ab. Diese Beobachtung ist die Grundlage für das Verständnis der Odds Ratio in Lektion 3.

Für den Vergleich zweier Behandlungen wird eine Vierfeldertafel angelegt: In den Zeilen stehen die Behandlungsarme, in den Spalten Ereignis ja oder nein. Aus den beiden Risiken, dem Risiko unter Intervention (hier p1) und dem Risiko in der Kontrollgruppe (p0), lassen sich alle weiteren Maße ableiten. Das Risiko der Kontrollgruppe heißt auch Basisrisiko; es beschreibt, was ohne die geprüfte Maßnahme zu erwarten ist, und bestimmt entscheidend, wie viel ein Patient von einer Therapie absolut gewinnen kann.

Relative und absolute Maße

Das relative Risiko (RR, auch Risikoverhältnis) ist der Quotient p1/p0. Ein RR von 1 bedeutet keinen Unterschied, Werte unter 1 ein geringeres Risiko unter Intervention. Die relative Risikoreduktion ist 1 minus RR und wird in Prozent angegeben. Die absolute Risikoreduktion (ARR, auch Risikodifferenz) ist die Differenz p0 minus p1 und wird in Prozentpunkten angegeben, nicht in Prozent. Diese sprachliche Unterscheidung ist wichtig: Sinkt ein Risiko von 20 % auf 10 %, dann sinkt es um 50 % relativ, aber um 10 Prozentpunkte absolut. Die Risikodifferenz ist nach dem Cochrane Handbook besonders leicht zu verstehen, weil sie direkt den Unterschied im beobachteten Risiko beschreibt, und sie eignet sich besonders, um Nutzen und Schaden gegeneinander abzuwägen.1

Ein eigenes Rechenbeispiel zeigt, warum beide Maße nötig sind. Eine Intervention senkt ein Ereignisrisiko von 20 % auf 10 %: RR 0,50, relative Risikoreduktion 50 %, ARR 10 Prozentpunkte. Eine zweite Intervention senkt ein Risiko von 2 % auf 1 %: wieder RR 0,50 und relative Risikoreduktion 50 %, aber die ARR beträgt nur einen Prozentpunkt. Relativ sind beide Maßnahmen gleich wirksam, für den einzelnen Patienten unterscheidet sich der Nutzen um den Faktor 10. Wer nur relative Maße liest, überschätzt deshalb leicht den Nutzen bei Patienten mit niedrigem Ausgangsrisiko und unterschätzt ihn bei Hochrisikopatienten.

Tabelle 1: Effektmaße für binäre Endpunkte im Therapievergleich (p1 Risiko unter Intervention, p0 Risiko der Kontrolle)
MaßBerechnungkein Effekt beiLesart
Relatives Risiko (RR)p1/p01Risiko unter Intervention als Vielfaches des Kontrollrisikos
Relative Risikoreduktion (RRR)1 minus RR0 %Anteil des Kontrollrisikos, der vermieden wird
Absolute Risikoreduktion (ARR)p0 minus p10 Prozentpunktevermiedene Ereignisse je 100 Behandelte im Studienzeitraum
Number needed to treat (NNT)1/ARRunendlichBehandelte je zusätzlich vermiedenem Ereignis im Studienzeitraum
Odds Ratio (OR)[p1/(1 minus p1)] / [p0/(1 minus p0)]1Verhältnis der Chancen; bei häufigen Ereignissen weiter von 1 entfernt als das RR
Hazard Ratio (HR)aus einem Zeit-bis-Ereignis-Modell1Verhältnis der momentanen Ereignisraten unter der Annahme proportionaler Hazards

Wie Ergebnisse berichtet werden

Wie selten absolute Maße tatsächlich berichtet werden, zeigt eine systematische Auswertung von 385 867 Abstracts randomisierter Studien aus PubMed zwischen 1975 und 2021. Konfidenzintervalle tauchten 1975 in 0,5 % und 2021 in 29 % der Abstracts auf; seit 1990 war die Angabe von p-Werten ohne Konfidenzintervall die häufigste Form. Bei binären Endpunkten dominierten relative Maße wie Hazard Ratio und Odds Ratio, während absolute Maße und die NNT nur selten genannt wurden.2 Die Berichtsleitlinie CONSORT 2025 fordert für jeden Endpunkt das Ergebnis je Gruppe, die geschätzte Effektgröße mit ihrer Präzision und für binäre Endpunkte möglichst sowohl absolute als auch relative Effekte.3 Für das Lesen bedeutet das: Wenn eine Zusammenfassung nur ein relatives Maß nennt, suchen Sie im Ergebnisteil oder in der Tabelle die Ereigniszahlen je Arm und rechnen selbst nach.

Prozent oder Prozentpunkte

„Das Risiko sinkt um 2,6 %“ ist mehrdeutig. Gemeint sein kann eine relative Senkung um 2,6 % oder eine absolute um 2,6 Prozentpunkte. In POISE-3 lag die Blutungsrate unter Tranexamsäure bei 9,1 % und unter Placebo bei 11,7 %, die absolute Differenz betrug 2,6 Prozentpunkte, relativ entspricht das etwa einem Viertel weniger Ereignissen.4 Schreiben Sie deshalb für absolute Unterschiede immer „Prozentpunkte“.

Übung 1.2, Rechenaufgabe

In einer randomisierten Studie treten bei 30 von 150 Patienten unter Intervention und bei 45 von 150 Patienten unter Kontrolle Ereignisse innerhalb von 30 Tagen auf. Berechnen Sie das relative Risiko und die absolute Risikoreduktion in Prozentpunkten.

Übung 1.1

Lektion 2

NNT, Zeitbezug und Basisrisiko

Die Number needed to treat (NNT) übersetzt die absolute Risikoreduktion in eine anschauliche Zahl: Wie viele Patienten müssen im Studienzeitraum statt der Kontrollbehandlung die Intervention erhalten, damit bei einem zusätzlichen Patienten das Ereignis vermieden wird? Sie ist der Kehrwert der ARR: Bei einer ARR von 10 Prozentpunkten ist NNT = 1/0,10 = 10, bei einer ARR von einem Prozentpunkt ist NNT = 100. Die NNT wird üblicherweise auf die nächste ganze Zahl aufgerundet, weil halbe Patienten nicht behandelt werden.

Ohne Zeitbezug keine NNT

Eine NNT ist nur vollständig, wenn Endpunkt, Vergleichsbehandlung und Zeitraum genannt sind. Das Cochrane Handbook betont, dass bei jeder NNT der Zeitraum anzugeben ist, auf den sie sich bezieht.5 „NNT 40“ ist deshalb keine Aussage, „NNT 40 über 90 Tage zur Vermeidung einer klinisch relevanten oberen gastrointestinalen Blutung unter Pantoprazol gegenüber Placebo bei invasiv beatmeten Patienten“ schon. Diese Zahl ergibt sich aus der REVISE-Studie: Klinisch relevante obere gastrointestinale Blutungen traten bei 25 von 2385 Patienten (1,0 %) unter Pantoprazol und bei 84 von 2377 Patienten (3,5 %) unter Placebo auf, die absolute Differenz betrug 2,5 Prozentpunkte mit einem 95-%-Konfidenzintervall von 1,6 bis 3,3 Prozentpunkten.6 Rechnerisch entspricht das einer NNT von etwa 40 über 90 Tage. Für den zweiten primären Endpunkt, die Sterblichkeit nach 90 Tagen (29,1 % gegenüber 30,9 %, Hazard Ratio 0,94, 95-%-KI 0,85 bis 1,04), lässt sich keine belastbare NNT angeben, weil das Intervall sowohl Nutzen als auch Schaden einschließt.6

Das Handbuch empfiehlt außerdem, die Richtung sprachlich eindeutig zu machen: NNTB (number needed to treat for an additional beneficial outcome) für einen zusätzlichen Nutzen und NNTH (number needed to treat for an additional harmful outcome) für einen zusätzlichen Schaden. Die verbreitete Abkürzung NNH ist missverständlich, weil sie wie eine eigene Größe klingt; rechnerisch ist sie dieselbe Kehrwertbildung einer Risikodifferenz, die in Richtung Schaden zeigt.5

Das Basisrisiko entscheidet

Relative Effekte sind über Patientengruppen mit unterschiedlichem Ausgangsrisiko oft ähnlicher als absolute, aber nicht garantiert konstant.1 Wird ein relatives Risiko aus einer Studie auf eigene Patienten übertragen, muss deshalb ein angenommenes Kontrollrisiko gewählt werden, und die absolute Wirkung ergibt sich erst aus der Kombination. Das Cochrane Handbook empfiehlt, absolute Effekte für klinisch unterscheidbare Risikogruppen getrennt darzustellen, statt eine einzige NNT zu nennen, damit Anwender ihren Patienten im richtigen Bereich einordnen können.5 Die Formel lautet: ARR = Basisrisiko × (1 minus RR), NNT = 1/ARR. Bei gleichem RR von 0,76 beträgt die NNT bei einem Basisrisiko von 20 % etwa 21, bei 5 % etwa 84 und bei 1 % etwa 417 (Rechenbeispiel).

Tabelle 2: Rechenbeispiel: gleicher relativer Effekt (RR 0,76), unterschiedliche Basisrisiken
Basisrisiko ohne TherapieRisiko mit TherapieARRNNT im Studienzeitraum
20 %15,2 %4,8 Prozentpunkte21
11,7 %8,9 %2,8 Prozentpunkte36
5 %3,8 %1,2 Prozentpunkte84
1 %0,76 %0,24 Prozentpunkte417

Mit dem folgenden Rechner können Sie das selbst prüfen. Stellen Sie ein relatives Risiko ein und verschieben Sie das Basisrisiko: Die NNT ändert sich stark, obwohl der relative Effekt gleich bleibt. Bei einem relativen Risiko über 1 wird aus der NNTB eine NNTH. Beachten Sie zusätzlich die Odds Ratio, die zum selben relativen Risiko gehört; sie entfernt sich bei wachsendem Basisrisiko immer weiter vom relativen Risiko.

Basisrisiko und NNT

Modell: Das relative Risiko bleibt über alle Basisrisiken gleich. Das ist eine Annahme, die in echten Studien geprüft werden muss; das Ergebnis ist ein Rechenbeispiel, keine Therapieempfehlung.

Risiko mit Therapie
Absolute Differenz
NNT für den Zeitraum der Studie
Zugehörige Odds Ratio

Unsicherheit der NNT

Die NNT erbt die Unsicherheit der ARR. Ihr Konfidenzintervall entsteht, indem die Grenzen des Intervalls der ARR ebenfalls umgekehrt werden. Solange das Intervall der ARR ganz auf einer Seite der Null liegt, ist das unproblematisch. Schließt es die Null ein, dann reicht das Intervall der NNT von einer NNTB über „unendlich“ bis zu einer NNTH; die Darstellung wird unstetig und leicht missverstanden.7, 5 In diesem Fall wird die NNT entweder mit diesem Intervall vollständig berichtet oder gar nicht, keinesfalls als einzelne Zahl ohne Intervall. NNT lassen sich außerdem nicht direkt metaanalytisch zusammenfassen; eine Metaanalyse fasst relative oder absolute Differenzen zusammen, die NNT wird erst danach für ein angenommenes Basisrisiko berechnet.1

Übung 2.2, Rechenaufgabe

Eine Studie berichtet für 90 Tage eine ARR von 2,5 Prozentpunkten. Berechnen Sie die NNT. Übertragen Sie dann ein relatives Risiko von 0,30 auf eine Patientengruppe mit einem Basisrisiko von 1 % und berechnen Sie die NNT für diese Gruppe (jeweils aufgerundet).

Übung 2.1

Lektion 3

Odds Ratio: wann sie passt und wann sie täuscht

Die Odds Ratio (OR) vergleicht nicht Risiken, sondern Chancen. Für das Rechenbeispiel mit einer Senkung des Risikos von 20 % auf 10 % beträgt die Chance unter Kontrolle 0,20/0,80 = 0,25 und unter Intervention 0,10/0,90 = 0,111; die OR ist 0,111/0,25 = 0,44, während das RR 0,50 beträgt. Die OR liegt damit weiter von 1 entfernt als das RR. Das gilt immer, wenn überhaupt ein Effekt besteht: Bei einem Nutzen ist die OR kleiner als das RR, bei einem Schaden größer. Je häufiger das Ereignis, desto größer der Abstand.

Warum die OR bei häufigen Ereignissen überzeichnet

Bei seltenen Ereignissen ist der Nenner der Chance (1 minus Risiko) nahe 1, und Chance und Risiko sind fast gleich. Bei einem Basisrisiko von 2 % und einem RR von 0,5 beträgt die OR 0,495, praktisch dasselbe. Bei einem Basisrisiko von 40 % und demselben RR ist die OR 0,375. Das Cochrane Handbook warnt ausdrücklich, dass eine Fehlinterpretation der OR als RR den Effekt der Intervention tendenziell überschätzt, besonders bei häufigen Ereignissen mit Risiken über etwa 20 %.1 Die Abbildung zeigt diesen Zusammenhang für zwei konstante relative Risiken.

0,000,250,500,751,000 %10 %20 %30 %40 %50 %60 %Risiko in der Kontrollgruppe (Basisrisiko)EffektmaßRR 0,5OR 0,29RR 0,8OR 0,62relatives Risiko, konstant angenommenzugehörige Odds Ratio
Abbildung 1: Bei konstantem relativem Risiko entfernt sich die zugehörige Odds Ratio mit steigendem Basisrisiko immer weiter von 1. Berechnet nach OR = RR × (1 minus p0) / (1 minus RR × p0). Eigene Darstellung

Ein Beispiel aus der perioperativen Medizin macht den Unterschied greifbar. In der Stop-or-Not-Studie traten intraoperative Hypotonien bei 54 % der Patienten auf, die ihren Hemmer des Renin-Angiotensin-Systems bis zum Operationstag weiter einnahmen, und bei 41 % der Patienten, die ihn 48 Stunden vorher pausierten; das berichtete relative Risiko betrug 1,31 (95-%-KI 1,19 bis 1,44).8 Aus denselben Anteilen berechnet ergibt sich eine Odds Ratio von etwa 1,69. Wer diese Zahl als „69 % mehr Hypotonien“ liest, verdoppelt fast den tatsächlichen relativen Anstieg von 31 % (Rechenbeispiel aus den berichteten Anteilen).

Wo die Odds Ratio ihren Platz hat

Die OR ist nicht falsch, sondern für bestimmte Situationen das natürliche Maß. In Fall-Kontroll-Studien werden Patienten nach dem Ereignis ausgewählt; Risiken lassen sich daher gar nicht schätzen, wohl aber die Odds Ratio der Exposition. Die logistische Regression, das Standardverfahren zur Adjustierung binärer Endpunkte, liefert ebenfalls Odds Ratios. Mathematisch hat die OR zudem angenehme Eigenschaften: Sie ist symmetrisch, wenn Ereignis und Nichtereignis vertauscht werden, und sie ist nicht wie das RR durch das Basisrisiko nach oben begrenzt.1 Problematisch wird die OR erst in der Übersetzung für Patienten und Behandelnde, weil diese in Risiken denken. Die Auswertung von Abstracts randomisierter Studien zeigt, dass relative Maße wie Odds Ratios häufig berichtet werden, ohne dass daneben absolute Zahlen stehen.2

Kennen Sie das Basisrisiko p0, lässt sich eine OR in ein ungefähres RR zurückrechnen: RR = OR / (1 minus p0 + p0 × OR). Diese Umrechnung ist eine algebraische Umformung für nicht adjustierte Werte; für adjustierte Odds Ratios aus Regressionsmodellen liefert sie nur eine Näherung, deren Konfidenzintervall nicht einfach mit umgerechnet werden darf.

Merksatz

Eine Odds Ratio nahe 1 oder bei seltenen Ereignissen darf näherungsweise wie ein RR gelesen werden. Bei häufigen Ereignissen gilt das nicht: Rechnen Sie mit dem Basisrisiko zurück oder suchen Sie die absoluten Zahlen.

Übung 3.2, Rechenaufgabe

Das Risiko eines Ereignisses beträgt unter Kontrolle 40 % und unter Intervention 30 %. Berechnen Sie relatives Risiko und Odds Ratio.

Übung 3.1

Lektion 4

Zeit bis zum Ereignis: Kaplan-Meier, Log-Rank und Hazard Ratio

Viele Endpunkte in Anästhesie und Intensivmedizin sind Zeitpunkte: Tod, Entlassung, Extubation, Rezidiv. Eine Vierfeldertafel zu einem festen Stichtag verschenkt hier Information, weil sie nicht berücksichtigt, wann ein Ereignis eintritt, und weil nicht alle Patienten gleich lange beobachtet werden. Zeit-bis-Ereignis-Analysen lösen beide Probleme.

Kaplan-Meier-Kurve und Zensierung

Die Kaplan-Meier-Kurve schätzt für jeden Zeitpunkt den Anteil der Patienten ohne Ereignis. Sie fällt nur an den Zeitpunkten, an denen ein Ereignis auftritt, und zwar um den Anteil der Ereignisse unter den zu diesem Zeitpunkt noch beobachteten Patienten. Patienten, die ohne Ereignis aus der Beobachtung ausscheiden, etwa weil die Studie endet oder der Kontakt abbricht, werden zensiert: Sie zählen bis zu ihrem letzten Beobachtungszeitpunkt zur Risikomenge und fallen danach heraus, ohne die Kurve zu senken. Zensierungen werden als kleine senkrechte Striche markiert. Die Methode setzt voraus, dass die Zensierung nicht informativ ist, dass also ausscheidende Patienten dieselbe Ereigniswahrscheinlichkeit haben wie verbleibende. Scheiden bevorzugt kränkere Patienten aus, etwa durch Verlegung, wird die Kurve zu optimistisch.

Unter der Grafik sollte immer die Zahl unter Risiko stehen. Am rechten Rand stützt sich die Kurve oft auf wenige Patienten; ein scheinbar dramatischer Abfall kann dort durch zwei Ereignisse entstehen. Achten Sie außerdem auf die y-Achse: Beginnt sie nicht bei null, wirken Unterschiede größer, als sie sind.

0,70,80,91,00306090Tage nach RandomisierungAnteil ohne EreignisDifferenz nach 30 TagenInterventionKontrollezensiertZahl unter RisikoIntervention200184170160Kontrolle200168150131
Abbildung 2: Kaplan-Meier-Kurven zweier Arme mit Zensierungen und Zahl unter Risiko. Fiktive Daten zur Veranschaulichung; die y-Achse beginnt bei 0,7. Eigene Darstellung

Log-Rank-Test und Hazard Ratio

Der Log-Rank-Test prüft, ob sich die Kurven über den gesamten Verlauf unterscheiden. Er vergleicht an jedem Ereigniszeitpunkt die beobachteten mit den unter Gleichheit erwarteten Ereignissen und liefert einen p-Wert, aber kein Effektmaß. Das Effektmaß liefert meist das Cox-Modell als Hazard Ratio (HR). Der Hazard ist die momentane Ereignisrate unter den noch ereignisfreien Patienten; die HR ist das Verhältnis dieser Raten zwischen den Armen. Eine HR von 0,76 bedeutet, dass zu jedem Zeitpunkt die momentane Ereignisrate unter Intervention etwa 76 % der Rate unter Kontrolle beträgt, sofern die Annahme proportionaler Hazards gilt. Die HR ist kein Quotient kumulativer Risiken: In POISE-3 lag die HR für den Blutungsendpunkt bei 0,76, das rohe Verhältnis der Ereignisanteile nach 30 Tagen (9,1 % zu 11,7 %) bei 0,78.4 Bei seltenen Ereignissen liegen beide nahe beieinander, bei häufigen Ereignissen und langen Beobachtungen können sie deutlich auseinanderlaufen.

Proportionale Hazards und ihre Verletzung

Das Cox-Modell nimmt an, dass das Verhältnis der Hazards über die Zeit konstant bleibt. Das ist plausibel, wenn eine Therapie gleichmäßig wirkt, aber oft verletzt: Ein operatives Verfahren kann früh schaden und spät nützen, eine Prophylaxe kann nur in den ersten Tagen wirken. Kreuzen sich die Kurven oder laufen sie erst spät auseinander, beschreibt eine einzelne HR einen Durchschnitt, der für keinen Zeitpunkt richtig ist. Ergänzende Maße sind dann die Differenz der ereignisfreien Anteile zu festgelegten Zeitpunkten und die restricted mean survival time (RMST), die Fläche unter der Kaplan-Meier-Kurve bis zu einem festgelegten Zeitpunkt. Die Differenz der RMST zwischen zwei Armen gibt an, wie viel ereignisfreie Zeit im Mittel bis zu diesem Zeitpunkt gewonnen wird, und kommt ohne die Annahme proportionaler Hazards aus.9

Tabelle 3: Zeit-bis-Ereignis-Maße im Überblick
MaßAussageAnnahme oder Grenze
Kaplan-Meier-SchätzerAnteil ohne Ereignis zu jedem Zeitpunktnicht informative Zensierung; rechts wenige Patienten unter Risiko
Log-Rank-TestUnterschied der Kurven insgesamt (p-Wert)kein Effektmaß; geringe Power bei sich kreuzenden Kurven
Hazard Ratio (Cox-Modell)Verhältnis der momentanen Ereignisratenproportionale Hazards; kein Risikoverhältnis
Differenz zu einem Zeitpunktabsoluter Unterschied, etwa nach 30 oder 90 TagenZeitpunkt vorab festlegen
RMST-Differenzgewonnene ereignisfreie Zeit bis zu einem ZeitpunktZeithorizont vorab festlegen

Übung 4.1

Lektion 5

Kombinierte Endpunkte, Surrogate und Tage lebend zu Hause

Ein Effektmaß ist nur so aussagekräftig wie der Endpunkt, auf den es sich bezieht. Drei Endpunkttypen verlangen beim Lesen besondere Aufmerksamkeit: kombinierte Endpunkte, Surrogatendpunkte und patientenzentrierte Summenmaße wie „Tage lebend und zu Hause“.

Kombinierte Endpunkte

Ein kombinierter Endpunkt zählt einen Patienten als Ereignis, sobald eine von mehreren Komponenten eintritt. Das erhöht die Ereignisrate und damit die Power einer Studie. Der primäre Wirksamkeitsendpunkt von POISE-3 war ein Blutungsendpunkt aus lebensbedrohlicher Blutung, schwerer Blutung und Blutung in ein kritisches Organ innerhalb von 30 Tagen; der primäre Sicherheitsendpunkt kombinierte myokardiale Schädigung nach nicht herzchirurgischen Eingriffen, nicht hämorrhagischen Schlaganfall, periphere arterielle Thrombose und symptomatische proximale venöse Thromboembolie. Der Blutungsendpunkt trat bei 433 von 4757 Patienten (9,1 %) unter Tranexamsäure und bei 561 von 4778 (11,7 %) unter Placebo auf (HR 0,76; 95-%-KI 0,67 bis 0,87; absolute Differenz minus 2,6 Prozentpunkte, 95-%-KI minus 3,8 bis minus 1,4). Der Sicherheitsendpunkt trat bei 14,2 % gegenüber 13,9 % auf (HR 1,02; 95-%-KI 0,92 bis 1,14); die vorab festgelegte Nichtunterlegenheit wurde mit einem einseitigen p-Wert von 0,04 formal nicht nachgewiesen.4 Das Beispiel zeigt zweierlei: Ein kombinierter Endpunkt fasst Ereignisse sehr unterschiedlicher Schwere zusammen, und ein „nicht signifikanter“ Unterschied im Sicherheitsendpunkt ist nicht dasselbe wie ein nachgewiesenes Fehlen eines Schadens.

Beim Lesen kombinierter Endpunkte helfen drei Fragen. Sind die Komponenten für Patienten ähnlich wichtig? Treiben häufige, weniger schwere Komponenten das Gesamtergebnis? Zeigen die Einzelkomponenten in dieselbe Richtung? Im Stop-or-Not-Versuch war der primäre Endpunkt eine Kombination aus Tod jeder Ursache und schweren postoperativen Komplikationen innerhalb von 28 Tagen; er trat in beiden Armen bei 22 % der Patienten auf (RR 1,02; 95-%-KI 0,87 bis 1,19).8 Das Intervall schließt einen relativen Anstieg um 19 % ebenso ein wie eine relative Senkung um 13 %: kein Hinweis auf einen Unterschied, aber auch kein Beweis völliger Gleichheit.

Surrogatendpunkte

Ein Surrogatendpunkt ersetzt den eigentlich interessierenden Zielendpunkt durch eine leichter oder früher messbare Größe: Blutdruck statt Schlaganfall, Troponin statt Myokardinfarkt, Oxygenierung statt Überleben. Surrogate beschleunigen Studien, bergen aber das Risiko, dass eine Therapie den Laborwert verbessert und den Patienten nicht. Die Berichtserweiterung CONSORT-Surrogate verlangt deshalb, dass Studien mit einem Surrogat als primärem Endpunkt dies kenntlich machen, die Begründung und die Belege für die Beziehung zwischen Surrogat und Zielendpunkt darlegen und die Grenzen dieser Beziehung diskutieren; die Erweiterung umfasst elf Punkte, neun davon angepasst aus CONSORT 2010 und zwei neue.10 Für die Bewertung eines Effektmaßes heißt das: Ein großes RR für ein Surrogat ist kein großer Effekt für den Patienten, solange nicht belegt ist, dass sich der Zielendpunkt entsprechend verändert.

Tage lebend und zu Hause

„Days alive and at home“ (DAH) zählt die Tage innerhalb eines festen Zeitraums, meist 30 oder 90 Tage nach der Operation, die ein Patient lebend und zu Hause verbringt. Tod, Krankenhausverweildauer, Wiederaufnahme und Verlegung in eine Pflegeeinrichtung gehen in eine einzige Zahl ein, die für Patienten unmittelbar verständlich ist. In einer Kohorte von 825 Patienten ab 70 Jahren nach hüftgelenksnaher Fraktur betrug der Median der Tage lebend und zu Hause innerhalb von 90 Tagen 54 Tage; 35 % kehrten innerhalb von 90 Tagen nicht nach Hause zurück. Die Autoren empfehlen für diese Population die Messung über 90 statt über 30 Tage, weil der kürzere Zeitraum wichtige Ereignisse verfehlt.11 Da DAH keine binäre Größe ist, sondern schief verteilt und oft bei null gehäuft, werden Unterschiede als Differenz der Mediane oder mit geeigneten Verfahren für schiefe Daten berichtet; RR und NNT sind hier nicht das passende Maß.

Aktuelle Evidenz: drei Studien, drei Lehrstücke

Stop-or-Not (2222 Patienten, 40 Kliniken): primärer kombinierter Endpunkt nach 28 Tagen 22 % in beiden Armen, RR 1,02 (0,87 bis 1,19); intraoperative Hypotonie 54 % unter Fortführung gegenüber 41 % unter Pausieren, RR 1,31 (1,19 bis 1,44).8 POISE-3 (9535 Patienten): Blutungsendpunkt 9,1 % gegenüber 11,7 %, HR 0,76 (0,67 bis 0,87), absolute Differenz minus 2,6 Prozentpunkte; Sicherheitsendpunkt 14,2 % gegenüber 13,9 %, HR 1,02 (0,92 bis 1,14), Nichtunterlegenheit nicht nachgewiesen.4 REVISE (invasiv beatmete Patienten): klinisch relevante obere gastrointestinale Blutung 1,0 % gegenüber 3,5 %, HR 0,30 (0,19 bis 0,47); Tod nach 90 Tagen 29,1 % gegenüber 30,9 %, HR 0,94 (0,85 bis 1,04).6

Übung 5.1

Lektion 6

Therapievergleichsrechner und typische Fehlannahmen

Der folgende Rechner führt die Maße dieser Einheit zusammen. Er ist für einen Therapievergleich gebaut: zwei Behandlungsarme, ein binärer Endpunkt, Ereignisse und Gesamtzahl je Arm. Laden Sie zunächst die Beispiele und vergleichen Sie die Ergebnisse mit den publizierten Zahlen. Kleine Abweichungen sind erwartbar, weil Studien ihre Hauptanalyse oft adjustiert oder als Zeit-bis-Ereignis-Modell rechnen, während der Rechner rohe Anteile verwendet.

Therapievergleich aus einer Vierfeldertafel

Eingabe: Ereignisse und Gesamtzahl je Arm einer randomisierten Studie. Ausgabe: rohe (nicht adjustierte) Risiken mit Wilson-Intervall, relatives Risiko mit Intervall nach der Log-Methode, absolute Risikoreduktion mit Intervall nach Newcombe, NNT mit Intervall nach Altman und Odds Ratio. Keine Zeit-bis-Ereignis-Analyse, keine Adjustierung, keine Cluster.

Eingabemodus
Beispiel laden
Risiko Intervention (95-%-KI)
Risiko Kontrolle (95-%-KI)
Relatives Risiko (95-%-KI)
Absolute Risikoreduktion (95-%-KI)
NNT (95-%-KI)
Odds Ratio (95-%-KI)

Welche Verfahren der Rechner verwendet

Die Risiken je Arm werden mit dem Wilson-Intervall angegeben, das auch bei kleinen Zahlen und Anteilen nahe null oder eins brauchbare Grenzen liefert. Das Intervall des relativen Risikos wird auf der logarithmischen Skala berechnet: Der Standardfehler von ln(RR) ist die Wurzel aus 1/a minus 1/n1 plus 1/c minus 1/n0, die Grenzen werden anschließend zurücktransformiert. Deshalb ist das Intervall des RR asymmetrisch um den Punktschätzer. Für die Odds Ratio gilt dasselbe Prinzip mit dem Standardfehler nach Woolf. Das Intervall der Risikodifferenz wird nach der Hybridmethode aus Wilson-Intervallen berechnet, die in einem Vergleich von elf Verfahren gute Eigenschaften zeigte.12 Das Intervall der NNT entsteht durch Kehrwertbildung der Grenzen der Risikodifferenz; schließt dieses die Null ein, zeigt der Rechner die Spanne von NNTB über unendlich bis NNTH an.7 Enthält eine Zelle null Ereignisse, wird zu allen Zellen 0,5 addiert; das ist eine übliche, aber nicht die einzige Korrektur.

Diagnostik ist ein anderer Eingabemodus

Eine Vierfeldertafel sieht in der Diagnostik genauso aus wie im Therapievergleich, bedeutet aber etwas anderes. In der Diagnostik stehen in den Zeilen Testergebnisse und in den Spalten der Krankheitsstatus nach Referenzstandard; die passenden Maße sind Sensitivität, Spezifität, prädiktive Werte und Likelihood Ratios, und die prädiktiven Werte hängen von der Prävalenz ab.13 Eine NNT aus einer diagnostischen Vierfeldertafel zu berechnen, wäre fachlich falsch: Weder ist ein positiver Test eine Behandlung, noch ist „krank“ ein Ereignis, das durch den Test vermieden würde. Der Rechner zeigt deshalb im diagnostischen Modus keine Therapiemaße an und verweist auf die Einheit Diagnostische Tests. Ob ein Test Patienten nützt, beantwortet nur eine Studie, die Patienten zu einer teststeuerten und einer anderen Strategie randomisiert und patientenrelevante Endpunkte vergleicht; erst dort sind RR, ARR und NNT wieder die richtigen Maße.

Typische Fehlannahmen
  • „Eine relative Risikoreduktion um 50 % ist immer ein großer Effekt.“ Bei einem Basisrisiko von 1 % bedeutet sie 0,5 Prozentpunkte und eine NNT von 200.
  • „Die Odds Ratio ist ungefähr das relative Risiko.“ Das stimmt nur bei seltenen Ereignissen; bei häufigen Ereignissen überzeichnet die OR den Effekt.1
  • „Eine Hazard Ratio von 0,5 halbiert das Risiko nach einem Jahr.“ Die HR ist ein Verhältnis momentaner Raten, kein Quotient kumulativer Risiken.
  • „Eine NNT gilt für alle Patienten.“ Sie gilt für das Basisrisiko, den Endpunkt und den Zeitraum der Studie.5
  • „Nicht signifikant heißt kein Schaden.“ Ein Intervall, das einen relevanten Schaden einschließt, schließt ihn nicht aus.
  • „Eine NNT lässt sich aus jeder Vierfeldertafel berechnen.“ In der Diagnostik gibt es keine NNT.13

Vom Effektmaß zur Entscheidung

Für die Entscheidung am Patienten folgt aus allem eine feste Reihenfolge. Zuerst den Endpunkt und den Zeitraum benennen. Dann das relative Maß mit seinem Intervall lesen und prüfen, ob es sich um RR, OR oder HR handelt. Dann das eigene Basisrisiko schätzen, am besten aus einem validierten Risikomodell oder aus der Kontrollgruppe einer vergleichbaren Studie, und daraus ARR und NNT für den eigenen Patienten ableiten. Zuletzt Nutzen und Schaden auf derselben absoluten Skala gegenüberstellen: Eine NNTB von 40 gegen eine NNTH von 200 ist eine andere Abwägung als eine NNTB von 400 gegen eine NNTH von 200. Diese Übersetzung ist die Grundlage dafür, wie Leitlinien Empfehlungen formulieren; mehr dazu in der Einheit Aktuelle Leitlinien und zur Bewertung der Evidenzsicherheit in Studiendesign, Bias, Metaanalyse und GRADE.

Übung 6.1

Lektion 7

Fälle, Merksätze und Aufgaben

Fall 1: Journal Club vor der Hemikolektomie

Ein 71-jähriger Patient (82 kg, arterielle Hypertonie, Typ-2-Diabetes) ist zur elektiven Hemikolektomie rechts vorgesehen. Er nimmt seit Jahren Ramipril 5 mg am Morgen, der Blutdruck in der Prämedikation beträgt 148/86 mmHg, das Kreatinin 1,1 mg/dl. Im morgendlichen Journal Club stellt ein Assistenzarzt die Stop-or-Not-Studie vor: 2222 Patienten vor großen nicht herzchirurgischen Eingriffen, randomisiert zum Fortführen des RAS-Hemmers bis zum Operationstag oder zum Pausieren 48 Stunden vorher. Er fasst zusammen: „Kein Unterschied bei Tod und Komplikationen, aber Fortführen erhöht die Hypotonien um 69 %.“ Der Patient hat sein Ramipril am Operationstag eingenommen. Nach der Einleitung mit Propofol, Sufentanil und Rocuronium fällt der mittlere arterielle Druck auf 58 mmHg und wird mit Noradrenalin in niedriger Dosis stabilisiert; der weitere Verlauf ist unauffällig.8

Fall 1, Frage 1

Fall 1, Frage 2

Fall 1, Frage 3

Merksätze

  • Absolute Unterschiede in Prozentpunkten, relative in Prozent: Beides gehört in jede Ergebnisbeschreibung.3
  • Die NNT braucht Endpunkt, Vergleich und Zeitraum und gilt nur für das Basisrisiko der Studie.5
  • Gleicher relativer Effekt, anderes Basisrisiko, andere NNT: Das eigene Basisrisiko entscheidet über den absoluten Nutzen.
  • Schließt die Risikodifferenz die Null ein, reicht das Intervall der NNT durch unendlich.7
  • Die Odds Ratio liegt immer weiter von 1 entfernt als das relative Risiko; bei Risiken über etwa 20 % ist der Unterschied relevant.1
  • Eine Hazard Ratio ist ein Verhältnis momentaner Raten und setzt proportionale Hazards voraus.9
  • Bei kombinierten Endpunkten immer die Komponenten ansehen, bei Surrogaten immer den Zielendpunkt suchen.10
  • Diagnostik und Therapievergleich nutzen dieselbe Tafel, aber verschiedene Maße: keine NNT aus einer diagnostischen Vierfeldertafel.13

Aufgaben

Aufgabe 1: REVISE nachrechnen

Gegeben:
In REVISE traten klinisch relevante obere gastrointestinale Blutungen bei 25 von 2385 Patienten unter Pantoprazol und bei 84 von 2377 unter Placebo auf; Tod nach 90 Tagen bei 29,1 % gegenüber 30,9 % (HR 0,94; 95-%-KI 0,85 bis 1,04).6

Frage:
Berechnen Sie Risiken, RR, ARR und NNT für die Blutung. Lässt sich eine NNT für die Sterblichkeit angeben?

Lösung

Risiko Pantoprazol 25/2385 = 1,05 %, Placebo 84/2377 = 3,53 %. RR = 0,0105/0,0353 = 0,30 (die publizierte HR beträgt ebenfalls 0,30). ARR = 3,53 minus 1,05 = 2,5 Prozentpunkte, NNT = 1/0,025 = 40 (aufgerundet 41 bei exakter Rechnung) über 90 Tage. Das Intervall der publizierten Differenz (1,6 bis 3,3 Prozentpunkte) entspricht einer NNT von etwa 31 bis 63.6 Für die Sterblichkeit schließt das Intervall der HR die 1 ein; eine NNT wäre nur mit dem Intervall durch unendlich zu berichten und ist hier nicht sinnvoll.7

Aufgabe 2: Odds Ratio zurückrechnen

Gegeben:
Eine Beobachtungsstudie berichtet für postoperatives Delir eine adjustierte OR von 0,60 für ein Verfahren. Das Delirrisiko ohne das Verfahren beträgt in dieser Population etwa 30 %.

Frage:
Welchem relativen Risiko entspricht das näherungsweise, und wie groß wäre die ARR?

Lösung

RR ≈ OR/(1 minus p0 + p0 × OR) = 0,60/(0,70 + 0,18) = 0,60/0,88 = 0,68. Risiko mit Verfahren etwa 0,30 × 0,68 = 20,5 %, ARR etwa 9,5 Prozentpunkte, NNT etwa 11. Als RR gelesen hätte die OR eine Reduktion um 40 % statt um etwa 32 % suggeriert. Die Umrechnung ist für adjustierte Werte nur eine Näherung, und als Beobachtungsstudie bleibt das Ergebnis anfällig für Confounding.1

Aufgabe 3: Eine NNT für den eigenen Patienten

Gegeben:
POISE-3 berichtet für den Blutungsendpunkt 9,1 % gegenüber 11,7 % (HR 0,76).4 Ihre Patientin hat nach einem validierten Risikomodell ein Blutungsrisiko ohne Prophylaxe von etwa 4 % für einen ähnlichen Endpunkt.

Frage:
Welche NNT ist für die Patientin zu erwarten, wenn der relative Effekt übertragbar ist?

Lösung

ARR ≈ 0,04 × (1 minus 0,76) = 0,0096, NNT ≈ 105 über 30 Tage, gegenüber etwa 38 in der Studienpopulation. Die HR wird dabei näherungsweise wie ein RR behandelt, was bei seltenen Ereignissen vertretbar ist. Der Nutzen ist bei niedrigem Basisrisiko absolut deutlich kleiner; ob er die möglichen Nachteile überwiegt, ist eine eigene Abwägung.5

Aufgabe 4: Eine Kaplan-Meier-Kurve lesen

Gegeben:
Abbildung 2 zeigt nach 30 Tagen etwa 94 % ereignisfreie Patienten unter Intervention und 87 % unter Kontrolle; am Ende stehen 160 und 131 Patienten unter Risiko.

Frage:
Welche absolute Differenz nach 30 Tagen lesen Sie ab, und welche Informationen fehlen für eine Hazard Ratio?

Lösung

Die Differenz der ereignisfreien Anteile nach 30 Tagen beträgt etwa 7 Prozentpunkte, entsprechend einer NNT von etwa 15 für diesen Zeitpunkt. Für eine HR braucht es die Ereigniszeiten aller Patienten und ein Modell (Cox); aus zwei abgelesenen Punkten lässt sich keine HR berechnen. Ob proportionale Hazards vorliegen, ist am Kurvenverlauf zu prüfen; bei Zweifeln sind Zeitpunktdifferenzen oder die RMST aussagekräftiger.9

Aufgabenblock abschließen

Markieren Sie den Block als bearbeitet, wenn Sie alle Aufgaben gelöst und mit den Lösungen verglichen haben.

Abschlussquiz, etwa 10 Minuten

Abschlussquiz

Zehn Fragen. Bestanden ab 80 %.

Zum Nachschlagen

Begriffe und Literatur

BegriffBedeutung
Relatives Risiko (RR)Risiko unter Intervention geteilt durch Risiko der Kontrolle
Absolute Risikoreduktion (ARR)Differenz der Risiken in Prozentpunkten, auch Risikodifferenz
NNTB und NNTHKehrwert der Risikodifferenz in Richtung Nutzen oder Schaden, immer mit Zeitraum
BasisrisikoRisiko ohne die geprüfte Maßnahme, meist das Risiko der Kontrollgruppe
Odds Ratio (OR)Verhältnis der Chancen; bei häufigen Ereignissen weiter von 1 entfernt als das RR
Hazard Ratio (HR)Verhältnis momentaner Ereignisraten aus einem Zeit-bis-Ereignis-Modell
ZensierungAusscheiden aus der Beobachtung ohne beobachtetes Ereignis
RMSTrestricted mean survival time, mittlere ereignisfreie Zeit bis zu einem festgelegten Zeitpunkt
Surrogatendpunktleichter messbarer Ersatz für einen patientenrelevanten Zielendpunkt
Tage lebend und zu HauseSummenmaß der Tage, die ein Patient in einem festen Zeitraum lebend und zu Hause verbringt

Literatur

  1. Higgins JPT, Li T, Deeks JJ (Hrsg.). Chapter 6: Choosing effect measures and computing estimates of effect (last updated August 2023). In: Higgins JPT, Thomas J, Chandler J et al. (Hrsg.). Cochrane Handbook for Systematic Reviews of Interventions, Version 6.5. Cochrane; 2024. https://www.cochrane.org/handbook
  2. Stang A, Rothman KJ. Statistical inference and effect measures in abstracts of randomized controlled trials, 1975-2021. A systematic review. Eur J Epidemiol. 2023;38(10):1035-1042. doi:10.1007/s10654-023-01047-8
  3. Hopewell S, Chan AW, Collins GS, Hróbjartsson A, Moher D et al. CONSORT 2025 statement: updated guideline for reporting randomised trials. BMJ. 2025;389:e081123. doi:10.1136/bmj-2024-081123
  4. Devereaux PJ, Marcucci M, Painter TW et al. Tranexamic acid in patients undergoing noncardiac surgery. N Engl J Med. 2022;386(21):1986-1997. doi:10.1056/NEJMoa2201171
  5. Schünemann HJ, Vist GE, Higgins JPT, Santesso N, Deeks JJ, Glasziou P, Akl EA, Guyatt GH. Chapter 15: Interpreting results and drawing conclusions (last updated August 2023). In: Higgins JPT, Thomas J, Chandler J et al. (Hrsg.). Cochrane Handbook for Systematic Reviews of Interventions, Version 6.5. Cochrane; 2024. https://www.cochrane.org/handbook
  6. Cook D, Deane A, Lauzier F et al. Stress ulcer prophylaxis during invasive mechanical ventilation. N Engl J Med. 2024;391(1):9-20. doi:10.1056/NEJMoa2404245
  7. Altman DG. Confidence intervals for the number needed to treat. BMJ. 1998;317(7168):1309-1312. doi:10.1136/bmj.317.7168.1309 (methodische Grundlagenarbeit)
  8. Legrand M, Falcone J, Cholley B et al. Continuation vs discontinuation of renin-angiotensin system inhibitors before major noncardiac surgery: the Stop-or-Not randomized clinical trial. JAMA. 2024;332(12):970-978. doi:10.1001/jama.2024.17123
  9. Han K, Jung I. Restricted mean survival time for survival analysis: a quick guide for clinical researchers. Korean J Radiol. 2022;23(5):495. PMID 35506526. doi:10.3348/kjr.2022.0061
  10. Manyara AM, Davies P, Stewart D, Weir CJ, Young AE et al. Reporting of surrogate endpoints in randomised controlled trial reports (CONSORT-Surrogate): extension checklist with explanation and elaboration. BMJ. 2024;386:e078524. doi:10.1136/bmj-2023-078524
  11. Wu A, Fahey MT, Cui D, El-Behesy B, Story DA. An evaluation of the outcome metric „days alive and at home“ in older patients after hip fracture surgery. Anaesthesia. 2022;77(8):901-909. doi:10.1111/anae.15742
  12. Newcombe RG. Interval estimation for the difference between independent proportions: comparison of eleven methods. Stat Med. 1998;17(8):873-890. doi:10.1002/(SICI)1097-0258(19980430)17:8<873::AID-SIM779>3.0.CO;2-I (methodische Grundlagenarbeit)
  13. Schlattmann P. Statistics in diagnostic medicine. Clin Chem Lab Med. 2022;60(6):801-807. doi:10.1515/cclm-2022-0225

Standardwerke

  • Kirkwood BR, Sterne JAC. Essential Medical Statistics. 2. Aufl. Oxford: Blackwell Science; 2003
  • Guyatt G, Rennie D, Meade MO, Cook DJ (Hrsg.). Users’ Guides to the Medical Literature: A Manual for Evidence-Based Clinical Practice. 3. Aufl. New York: McGraw-Hill Education; 2015

© 2026 Ulrich Frey. Alle Rechte vorbehalten. Neufassung für das E-Learning, Recherchestand September 2026. Die Inhalte dienen der Aus- und Weiterbildung und ersetzen keine Leitlinie, keine Fachinformation und keine lokalen Standards.