Weiterbildung, Statistik und Studienbewertung · Stufe WBJ 2

Studiendesign, Bias, Metaanalyse und GRADE

Ein Design ist weder gut noch schlecht, es passt zu einer Frage; und die Sicherheit der Evidenz entscheidet noch nicht über die Stärke der Empfehlung.

Lernziele
  • Eine klinische Frage nach PICO formulieren und das passende Design wählen, einschließlich Cluster-RCT, pragmatischer Studie, diagnostischer Genauigkeitsstudie und Prognosemodell.
  • Randomisierung, verdeckte Zuteilung, Verblindung sowie Intention-to-treat- und Per-Protocol-Analyse in ihrer Schutzwirkung unterscheiden.
  • Confounding by indication, Selektions-, Informations- und Immortal-time-Bias erkennen und die Idee der Target Trial Emulation erklären.
  • Diskrimination, Kalibrierung und externe Validierung von Vorhersagemodellen bewerten und Datenleckage erkennen.
  • Feste und zufällige Effekte, I², tau² und Vorhersageintervall im Forest Plot interpretieren und einen Funnel Plot einordnen.
  • Die Evidenzsicherheit nach GRADE mit Startstufe, fünf Herabstufungs- und drei Heraufstufungsgründen bestimmen.
  • Evidenzsicherheit und Empfehlungsstärke unterscheiden und die Faktoren von der Evidenz zur Entscheidung benennen.
  • Jede Studie mit den vier Prüffragen Größe, Präzision, Glaubwürdigkeit und Übertragbarkeit bewerten.

Zu dieser Lerneinheit

  1. Sechs Lektionen mit vier Tabellen, drei eigenen Abbildungen, einem interaktiven Heterogenitätsrechner, einer Rechenaufgabe und sechs Übungen, ein klinischer Fall mit drei Fragen, Merksätze, vier Aufgaben und ein Abschlussquiz mit zehn Fragen.
  2. Voraussetzung: Effektmaße und Schließende Statistik.
  3. Verwandt: Aktuelle Leitlinien, Up-to-date-Medizin, Generative KI und Forschung und Translation.

Lektion 1

Von der klinischen Frage zum Studiendesign

Jede Studienbewertung beginnt mit der Frage, die eine Studie beantworten will, und erst danach mit dem Design. Ein Design ist weder gut noch schlecht; es passt zu einer Frage oder es passt nicht. Diese Einheit führt vom klinischen Problem über die Designs und ihre typischen Verzerrungen zur Metaanalyse und zur Bewertung eines ganzen Evidenzkörpers mit GRADE. Wie eine Studie praktisch geplant, genehmigt und publiziert wird, behandelt die Einheit Forschung und Translation; wie im Dienst schnell eine Antwort gefunden wird, Up-to-date-Medizin.

Die Frage nach PICO

Eine präzise Frage nennt die Population, die Intervention oder Exposition, den Vergleich und den patientenrelevanten Endpunkt (englisch outcome), kurz PICO. Die Core-GRADE-Reihe von 2025 stellt diese Struktur an den Anfang jeder Evidenzbewertung und betont, dass Behandlungseffekte zwischen Patientengruppen variieren können; wer die Population unscharf formuliert, kann später nicht beurteilen, ob ein Ergebnis übertragbar ist.1 Für die Anästhesie heißt das konkret: Nicht „Ist die Spinalanästhesie besser?“, sondern „Senkt bei Patienten ab 50 Jahren mit hüftgelenksnaher Fraktur die Spinalanästhesie im Vergleich zur Allgemeinanästhesie die Kombination aus Tod und fehlender Gehfähigkeit nach 60 Tagen?“ Genau diese Frage stellte die REGAIN-Studie.2

Designs und was sie leisten

Ein randomisierter kontrollierter Versuch (RCT) weist eine Intervention zufällig zu und kann deshalb kausale Aussagen über die Wirkung dieser Zuweisung machen. Ein Cluster-RCT randomisiert nicht einzelne Patienten, sondern Einheiten wie Stationen, Kliniken oder Zeitabschnitte; das ist sinnvoll, wenn eine Maßnahme nur für eine ganze Einheit umgesetzt werden kann oder wenn sich Behandelte und Unbehandelte sonst gegenseitig beeinflussen würden. Die Analyse muss dann berücksichtigen, dass Patienten desselben Clusters sich ähnlicher sind als Patienten verschiedener Cluster. Pragmatische Studien prüfen eine Strategie unter Alltagsbedingungen mit breiten Einschlusskriterien und patientenrelevanten Endpunkten; sie beantworten die Frage „Wirkt es in der Versorgung?“ statt „Kann es unter idealen Bedingungen wirken?“. Ein Beispiel für beides ist PILOT: eine pragmatische, clusterrandomisierte Cluster-Crossover-Studie in einer Notaufnahme und einer internistischen Intensivstation, die drei Zielbereiche der Sauerstoffsättigung bei beatmeten Patienten verglich; die Zahl der beatmungsfreien Tage unterschied sich nicht (Median 20, 21 und 21 Tage).3

Beobachtungsstudien weisen nichts zu, sondern beobachten. Eine Kohortenstudie verfolgt Exponierte und Nichtexponierte über die Zeit und kann Risiken, Inzidenzen und zeitliche Abfolgen beschreiben, bleibt aber anfällig für Confounding. Eine Fall-Kontroll-Studie geht vom Ereignis aus und vergleicht die frühere Exposition von Fällen und Kontrollen; sie eignet sich für seltene Ereignisse und liefert Odds Ratios, ist aber für Auswahl- und Erinnerungsfehler anfällig. Eine Querschnittsstudie misst Exposition und Zustand zum selben Zeitpunkt und beschreibt Prävalenzen, ohne die zeitliche Richtung klären zu können. Eine diagnostische Genauigkeitsstudie vergleicht einen Indextest mit einem Referenzstandard in einer möglichst repräsentativen Patientenserie. Ein Prognosemodell kombiniert mehrere Merkmale zu einer Risikovorhersage und muss nach der Entwicklung an unabhängigen Daten extern validiert werden.

Tabelle 1: Studiendesigns, ihre Fragen und ihre Hauptrisiken
DesignbeantwortetEffektmaßHauptrisiko
RCTWirkung einer zugewiesenen InterventionRR, ARR, HR, Mittelwertdifferenzfehlende verdeckte Zuteilung, Verblindung, Ausfälle
Cluster-RCTWirkung einer Maßnahme auf Ebene von Einheitenwie RCT, mit Clusterkorrekturwenige Cluster, Rekrutierungsbias nach Zuteilung
Pragmatischer RCTWirksamkeit im Versorgungsalltagpatientenrelevante EndpunkteVerdünnung durch Nichtadhärenz, Wechsel der Gruppen
KohortenstudieRisiko und Verlauf nach ExpositionRR, HR (adjustiert)Confounding, Immortal-time-Bias, Verluste
Fall-Kontroll-StudieExposition bei seltenen EreignissenORAuswahl der Kontrollen, Erinnerungsbias
QuerschnittsstudieHäufigkeit zu einem ZeitpunktPrävalenz, Prävalenzverhältniskeine zeitliche Richtung
Diagnostische GenauigkeitsstudieGüte eines Tests gegen ReferenzstandardSensitivität, Spezifität, Likelihood RatioSpektrum- und Verifikationsbias
Prognosemodellindividuelles RisikoDiskrimination, Kalibrierung, klinischer NutzenÜberanpassung, Datenleckage, fehlende externe Validierung

Übung 1.1

Lektion 2

Randomisierung, verdeckte Zuteilung, Verblindung und ITT

Randomisierung ist das stärkste Werkzeug gegen Confounding, aber sie wirkt nur, wenn mehrere Schutzmechanismen zusammenkommen. Diese Mechanismen schützen vor verschiedenen Verzerrungen und sind nicht gegeneinander austauschbar.

Zufallsfolge, verdeckte Zuteilung und Verblindung

Die Randomisierung erzeugt eine unvorhersehbare Zuteilungsfolge. Sie verteilt bekannte und unbekannte Einflussgrößen im Erwartungswert gleich auf die Gruppen, garantiert aber nicht in jeder kleinen Studie eine perfekte Balance; Unterschiede in einer Basistabelle sind deshalb nicht automatisch ein Zeichen fehlerhafter Randomisierung. Die verdeckte Zuteilung (allocation concealment) sorgt dafür, dass niemand, der über den Einschluss entscheidet, die nächste Zuteilung kennt. Fehlt sie, kann ein Untersucher etwa einen besonders kranken Patienten zurückstellen, bis die „richtige“ Gruppe an der Reihe ist; der Vorteil der Randomisierung geht dann vor dem ersten Studientag verloren. Die Verblindung wirkt nach der Zuteilung: Sie verhindert, dass Patienten, Behandelnde oder Endpunktbewerter das Ergebnis durch ihr Wissen beeinflussen. Viele anästhesiologische Interventionen, etwa ein Narkoseverfahren, lassen sich nicht verblinden; die Bewertung des Endpunkts kann aber dennoch verblindet erfolgen, und objektive Endpunkte wie Tod sind weniger anfällig als subjektive wie Schmerz oder Zufriedenheit.

Das Werkzeug RoB 2 der Cochrane Collaboration fasst diese Überlegungen in fünf Domänen zusammen: Randomisierungsprozess, Abweichungen von der geplanten Intervention, fehlende Endpunktdaten, Messung des Endpunkts und Auswahl des berichteten Ergebnisses.4 Die letzte Domäne erinnert daran, dass auch eine gut durchgeführte Studie verzerrt berichtet werden kann, wenn aus mehreren Endpunkten oder Analysen der günstigste ausgewählt wird. Dagegen schützen vorab veröffentlichte Protokolle und Analysepläne. SPIRIT 2025 beschreibt in 34 Mindestpunkten, was ein Studienprotokoll enthalten soll, darunter einen neuen Abschnitt zu Open Science, eine stärkere Betonung der Erfassung von Schäden und der Beschreibung von Intervention und Vergleich sowie Angaben dazu, wie Patienten und Öffentlichkeit einbezogen werden.5 CONSORT 2025 ist das Gegenstück für den Ergebnisbericht: 30 Punkte, davon sieben neu, ebenfalls mit eigenem Abschnitt zu Open Science.6

Intention to treat und Per-Protocol

Die Intention-to-treat-Analyse (ITT) wertet alle Patienten in der Gruppe aus, in die sie randomisiert wurden, unabhängig davon, was sie tatsächlich erhielten. Sie erhält die Vergleichbarkeit, die die Randomisierung geschaffen hat, und beantwortet die pragmatische Frage, was die Entscheidung für eine Strategie bewirkt. Die Per-Protocol-Analyse wertet nur Patienten aus, die die zugeteilte Behandlung wie geplant erhielten; sie kommt der Frage nach der Wirkung der Behandlung selbst näher, verliert aber den Schutz der Randomisierung, weil die Gründe für Abweichungen mit der Prognose zusammenhängen können. In REGAIN erhielten 666 von 795 Patienten (83,8 %) der Spinalgruppe tatsächlich eine Spinalanästhesie, aber 769 von 805 (95,5 %) der Allgemeinanästhesiegruppe die zugeteilte Allgemeinanästhesie. Der primäre Endpunkt, Tod oder Unfähigkeit, ohne Hilfe einer anderen Person etwa drei Meter zu gehen, nach 60 Tagen, trat bei 18,5 % gegenüber 18,0 % auf (RR 1,03; 95-%-KI 0,84 bis 1,27).2 Ein Wechsel von jedem sechsten Patienten der Spinalgruppe kann einen echten Unterschied in der ITT-Analyse abschwächen; deshalb werden in solchen Studien ITT und Per-Protocol-Analyse gemeinsam betrachtet, wobei die ITT für Überlegenheitsfragen führend bleibt. Bei Nichtunterlegenheitsstudien wirkt die Verdünnung dagegen in Richtung des gewünschten Ergebnisses, weshalb dort beide Analysen übereinstimmen sollten.

Merksatz

Randomisierung schützt vor Confounding, verdeckte Zuteilung schützt die Randomisierung, Verblindung schützt die Messung, ITT schützt den Vergleich. Fehlt ein Glied, hilft kein anderes aus.

Übung 2.1

Lektion 3

Confounding, Selektion und Immortal-time-Bias in Beobachtungsstudien

Beobachtungsstudien sind unverzichtbar: für seltene Schäden, für Langzeitverläufe, für Fragen, die sich nicht randomisieren lassen, und für Hypothesen, die später randomisiert geprüft werden. Ihre Schwäche ist, dass die Behandlung nicht zufällig, sondern aus Gründen gewählt wird, und diese Gründe hängen oft mit der Prognose zusammen.

Confounding by indication

Confounding liegt vor, wenn ein dritter Faktor sowohl die Exposition als auch den Endpunkt beeinflusst. Die klinisch wichtigste Form ist das Confounding by indication: Kränkere Patienten erhalten häufiger eine bestimmte Behandlung und haben unabhängig davon eine schlechtere Prognose. So erscheinen Transfusionen, invasive Katheter oder Intensivaufnahmen in Registerdaten regelmäßig mit höherer Sterblichkeit verbunden, ohne dass sie ursächlich schaden müssen. Umgekehrt kann eine Behandlung nützlich erscheinen, wenn sie bevorzugt Gesünderen gegeben wird. Adjustierung in Regressionsmodellen oder Propensity-Score-Verfahren kann nur Einflussgrößen ausgleichen, die gemessen, korrekt erfasst und richtig modelliert wurden; ungemessene Einflussgrößen, etwa der klinische Gesamteindruck, bleiben bestehen.

Selektionsbias und Informationsbias

Selektionsbias entsteht, wenn die Auswahl der untersuchten Patienten oder ihr Verbleib in der Studie sowohl mit Exposition als auch mit Endpunkt zusammenhängt, etwa wenn nur unkomplizierte Verläufe vollständig nachuntersucht werden. Informationsbias betrifft systematische Unterschiede in Messung oder Klassifikation: Komplikationen werden bei Patienten mit auffälligem Verlauf gründlicher gesucht, oder die Dokumentation einer Diagnose hängt von der abrechnungsrelevanten Kodierung ab. Beide Verzerrungen lassen sich durch größere Fallzahlen nicht beheben; eine große verzerrte Studie liefert ein präzises falsches Ergebnis.

Immortal-time-Bias und Zeitpunkt null

Eine besonders tückische Verzerrung in Routinedaten ist der Immortal-time-Bias. Er entsteht, wenn Patienten als „behandelt“ gelten, sobald sie irgendwann während der Beobachtung eine Behandlung erhalten, die Beobachtung aber für alle ab demselben früheren Zeitpunkt beginnt. Wer die Behandlung am fünften Tag erhält, muss die ersten vier Tage überlebt haben; diese Zeit ist in der Behandlungsgruppe „unsterblich“ und lässt die Behandlung schützend erscheinen. Die Lösung ist, Einschluss, Zuteilung zur Behandlungsstrategie und Beginn der Nachbeobachtung auf denselben Zeitpunkt null zu legen, wie es ein randomisierter Versuch automatisch tut. Das Konzept der Target Trial Emulation beschreibt zuerst den idealen randomisierten Versuch und bildet ihn dann mit Beobachtungsdaten so genau wie möglich nach; Einschlusskriterien und Zuteilung werden am Zeitpunkt null synchronisiert, ohne spätere Information zur Einteilung zu verwenden. Die Autoren betonen zugleich die Grenze: Die Emulation beseitigt Verzerrungen durch Fehler im Design, nicht aber das Confounding durch nicht vergleichbare Gruppen; dafür braucht es gute Daten zu den Einflussgrößen.7

Tabelle 2: Verzerrungen, ihr Mechanismus und Gegenmittel
VerzerrungMechanismusBeispielGegenmittel
Confounding by indicationIndikation bestimmt Behandlung und PrognoseTransfusion erscheint tödlichRandomisierung; Adjustierung nur für gemessene Faktoren
SelektionsbiasAuswahl oder Verbleib hängen mit Exposition und Endpunkt zusammennur vollständig nachuntersuchte Verläufevollständige Nachbeobachtung, Sensitivitätsanalysen
Informationsbiassystematisch unterschiedliche MessungKomplikationen nur bei Verdacht gesuchtstandardisierte, verblindete Endpunkterhebung
Immortal-time-BiasÜberlebenszeit vor Behandlungsbeginn zählt zur BehandlungTherapie ab Tag 5 wirkt schützendgemeinsamer Zeitpunkt null, Target Trial Emulation
VerifikationsbiasReferenztest nur bei positivem IndextestSensitivität zu hochReferenzstandard für alle oder Korrektur
DatenleckageTestdaten beeinflussen das TrainingMesspunkte desselben Patienten in beiden DatensätzenTrennung nach Patienten, externe Validierung
Nicht jede Assoziation ist ein Effekt

Eine Registerstudie zeigt, dass Patienten mit Spinalanästhesie nach Hüftfraktur seltener sterben. Bevor daraus ein Nutzen abgeleitet wird, ist zu fragen: Wer bekam welche Anästhesie, und warum? Patienten unter Antikoagulation oder mit schwerer Aortenstenose erhalten häufiger eine Allgemeinanästhesie und haben unabhängig davon ein höheres Risiko. Die randomisierte REGAIN-Studie fand für den kombinierten Endpunkt keinen Unterschied.2

Übung 3.1

Lektion 4

Diagnostische Studien und Vorhersagemodelle

Diagnostische Tests und Vorhersagemodelle folgen eigenen Regeln. Die Rechenmaße der diagnostischen Genauigkeit sind Gegenstand der Einheit Diagnostische Tests; hier geht es um das Design und die Verzerrungen, die die Ergebnisse solcher Studien unbrauchbar machen können.

Diagnostische Genauigkeitsstudien

Eine diagnostische Genauigkeitsstudie braucht einen begründeten Referenzstandard und eine Patientenserie, die dem späteren Einsatz entspricht. Wird ein Test nur an eindeutig Kranken und eindeutig Gesunden geprüft, erscheint er besser, als er in der Praxis mit ihren Grenzfällen ist (Spektrumbias). Wird der Referenzstandard nur bei positivem Indextest durchgeführt, fehlen die falsch negativen Befunde, und die Sensitivität wird überschätzt (Verifikationsbias). Für den Bericht gilt: Die Vierfeldertafel oder zumindest Zähler und Nenner jedes Maßes sollen angegeben werden, Sensitivität und Spezifität gehören als Paar zusammen, jedes Maß braucht ein 95-%-Konfidenzintervall, und das verwendete Intervallverfahren soll genannt werden.8 Prädiktive Werte hängen zusätzlich von der Prävalenz ab und lassen sich deshalb nicht ohne Weiteres von einer Studienpopulation auf eine andere übertragen.9

Vorhersagemodelle: Entwicklung und Validierung

Ein Vorhersagemodell kombiniert Merkmale zu einer individuellen Risikoschätzung, sei es als Regressionsgleichung oder als Verfahren des maschinellen Lernens. Seine Güte hat drei Dimensionen. Die Diskrimination beschreibt, wie gut das Modell Patienten mit und ohne Ereignis unterscheidet, gemessen etwa als Fläche unter der ROC-Kurve. Die Kalibrierung beschreibt, ob vorhergesagte Risiken den beobachteten Häufigkeiten entsprechen: Ein Modell kann Patienten perfekt ordnen und trotzdem alle Risiken um das Doppelte überschätzen. Der klinische Nutzen fragt, ob Entscheidungen auf Basis des Modells Patienten tatsächlich helfen. Eine hohe AUC ersetzt weder Kalibrierung noch Nutzen. Jedes Modell passt sich an die Daten an, an denen es entwickelt wurde; deshalb braucht es eine interne Validierung (etwa mit Kreuzvalidierung oder Bootstrap) und vor dem klinischen Einsatz eine externe Validierung an unabhängigen Patienten aus anderer Zeit, anderem Ort oder anderer Versorgung.

TRIPOD+AI hat 2024 die Berichtsleitlinie für Vorhersagemodelle erneuert: Sie gilt gleichermaßen für Regression und maschinelles Lernen, umfasst eine erweiterte Checkliste mit 27 Punkten und ersetzt die Fassung von 2015, die nicht mehr verwendet werden soll.10

Datenleckage und Auswahl der Beispiele

Beim maschinellen Lernen ist Datenleckage eine häufige Ursache zu optimistischer Ergebnisse: Information aus den Testdaten gelangt unbemerkt in das Training. Eine Übersicht fand Leckage in 17 Fachgebieten mit zusammen 294 betroffenen Publikationen und beschrieb acht Typen, von Lehrbuchfehlern bis zu offenen Forschungsproblemen.11 Für intraoperative Daten ist ein Typ besonders relevant: Werden Messzeitpunkte desselben Patienten zufällig auf Trainings- und Testdaten verteilt, sieht das Modell im Test Patienten, die es schon kennt. Die Trennung muss deshalb nach Patienten erfolgen, besser noch nach Zeitraum oder Klinik.

Ein zweites Problem ist die Auswahl der Beispiele. Für den Hypotension Prediction Index wurde gezeigt, dass die Art, wie Zeitabschnitte mit und ohne nachfolgende Hypotonie für die Validierung ausgewählt wurden, eine systematische Verzerrung erzeugte: Schon der aktuelle mittlere arterielle Druck sagte unter diesen Bedingungen eine Hypotonie scheinbar hervorragend voraus. Da der Druck selbst in den Index eingeht, dürfte die Leistung des Index ebenfalls überschätzt sein; die Autoren fordern eine weitere Validierung.12 Die Lehre gilt allgemein: Wer die Leistung eines Modells beurteilt, prüft zuerst, ob die Testsituation der klinischen Anwendung entspricht, und vergleicht das Modell mit einer einfachen Alternative.

Tabelle 3: Prüffragen für Vorhersagemodelle
FrageWarnzeichen
Wurde nach Patienten getrennt validiert?Zufällige Aufteilung einzelner Messpunkte
Gibt es eine externe Validierung?nur interne Kreuzvalidierung
Wird die Kalibrierung berichtet?nur AUC oder Genauigkeit
Entspricht die Testsituation der Anwendung?ausgewählte, besonders klare Beispiele
Ist das Modell besser als eine einfache Regel?kein Vergleich mit Basismodell
Wurde nach TRIPOD+AI berichtet?fehlende Angaben zu Daten, Ausfällen und Vorverarbeitung

Übung 4.1

Lektion 5

Metaanalyse, Heterogenität und Publikationsbias

Eine systematische Übersichtsarbeit sucht nach einem vorab festgelegten Protokoll alle Studien zu einer Frage, bewertet sie und fasst sie zusammen; die Metaanalyse ist der statistische Teil dieser Zusammenfassung. Den Bericht regelt PRISMA 2020 mit einer Checkliste und einem Flussdiagramm, das nachvollziehbar macht, wie viele Treffer gefunden, ausgeschlossen und eingeschlossen wurden.13 Eine Metaanalyse ist nicht automatisch hochwertig: Sie kann nur so gut sein wie die eingeschlossenen Studien.

Feste und zufällige Effekte

Beide Modelle gewichten Studien nach ihrer Präzision, die Gewichte beruhen auf der inversen Varianz. Das Modell fester Effekte nimmt an, dass alle Studien denselben wahren Effekt schätzen und Unterschiede nur zufällig sind. Das Modell zufälliger Effekte nimmt an, dass die wahren Effekte zwischen Studien streuen, etwa wegen unterschiedlicher Populationen, Dosierungen oder Begleittherapien, und schätzt den Mittelwert dieser Verteilung. Dafür wird die Varianz zwischen den Studien, tau², geschätzt und zu jeder Studienvarianz addiert; die Gewichte werden dadurch ausgeglichener, kleine Studien erhalten relativ mehr Gewicht, und das Konfidenzintervall wird breiter. Das Cochrane Handbook gibt keine allgemeine Empfehlung für eines der beiden Modelle, hält die Annahme identischer Effekte aber meist für unplausibel. Seit der Version 6.5 ist REML der Standard zur Schätzung von tau², nicht mehr das Verfahren nach DerSimonian und Laird, und für das Konfidenzintervall wird die Methode nach Hartung, Knapp, Sidik und Jonkman nahegelegt, wenn mehr als zwei Studien vorliegen und tau² größer als null ist.14

StudieRR (95-%-KI)A0,60 (0,41 bis 0,89)B0,85 (0,67 bis 1,08)C1,02 (0,86 bis 1,22)D0,50 (0,32 bis 0,77)E0,90 (0,74 bis 1,09)F0,75 (0,56 bis 1,01)feste Effekte0,86 (0,78 bis 0,95)zufällige Effekte0,80 (0,66 bis 0,95)0,250,5124spricht für Interventionspricht für KontrolleQuadrat: Schätzer der Einzelstudie, Fläche nach Gewicht. Linie: 95-%-Konfidenzintervall.Raute: gepoolter Effekt, Breite gleich Konfidenzintervall. Logarithmische x-Achse.
Abbildung 1: Aufbau eines Forest Plots mit sechs fiktiven Studien, gepoolt mit festen und zufälligen Effekten (Rechenbeispiel). Eigene Darstellung

Heterogenität lesen

Ob die Ergebnisse der Studien zusammenpassen, zeigt zuerst der Blick auf den Forest Plot: Liegen die Punktschätzer auf derselben Seite der Nulllinie, überlappen die Intervalle? Statistisch prüft Cochrans Q, ob die Streuung größer ist als durch Zufall erwartet; bei wenigen Studien hat dieser Test wenig Power. I² beschreibt den Anteil der Gesamtvariabilität, der auf echte Unterschiede zwischen den Studien statt auf Zufall zurückgeht: I² = (Q minus Freiheitsgrade)/Q. Das Handbuch nennt grobe Bereiche: 0 bis 40 % möglicherweise unbedeutend, 30 bis 60 % möglicherweise moderat, 50 bis 90 % möglicherweise erheblich, 75 bis 100 % beträchtlich; die Bereiche überlappen absichtlich, weil die Bedeutung von der Größe der Effekte und der Stärke des Heterogenitätsbefunds abhängt.14 I² ist ein relatives Maß: Bei sehr präzisen Studien kann es hoch sein, obwohl alle Effekte klinisch gleichbedeutend sind. Das Vorhersageintervall gibt dagegen an, in welchem Bereich der wahre Effekt einer neuen, vergleichbaren Studie oder Klinik wahrscheinlich liegt; es ist nach dem Handbuch ab etwa fünf Studien sinnvoll und für die klinische Übertragung oft aussagekräftiger als I².14

Heterogenität im Forest Plot

Sechs fiktive Studien; Studie E lässt sich verändern. Berechnung mit inverser Varianz, Heterogenität nach DerSimonian und Laird, Vorhersageintervall mit t-Verteilung (k minus 2 Freiheitsgrade). Das Cochrane Handbook verwendet seit 2024 standardmäßig REML; die Ergebnisse unterscheiden sich meist wenig, bei wenigen Studien aber spürbar.

Cochran Q (5 Freiheitsgrade)
I²
tau²
RR feste Effekte (95-%-KI)
RR zufällige Effekte (95-%-KI)
Vorhersageintervall

Funnel Plot und Publikationsbias

Studien mit positivem Ergebnis werden häufiger, schneller und in bekannteren Zeitschriften veröffentlicht. Fehlen deshalb kleine Studien ohne Effekt, überschätzt eine Metaanalyse den Nutzen. Der Funnel Plot trägt den Effekt jeder Studie gegen ihre Präzision auf. Ohne Verzerrung streuen kleine Studien breit und symmetrisch um den gemeinsamen Effekt, große Studien eng: Es entsteht ein umgedrehter Trichter. Fehlt eine Ecke, etwa kleine Studien ohne Nutzen, wird der Trichter asymmetrisch. Asymmetrie ist aber kein Beweis für Publikationsbias; sie kann auch durch echte Unterschiede zwischen kleinen und großen Studien, methodische Schwächen kleiner Studien oder Zufall entstehen. Bei weniger als etwa zehn Studien ist die Beurteilung unzuverlässig. Ergänzend helfen die Suche in Studienregistern und der Vergleich von registrierten mit publizierten Endpunkten.

0,250,5124relatives Risiko der Einzelstudie (logarithmisch)0,00,20,40,6Standardfehlerpublizierte Studievermutlich fehlend
Abbildung 2: Funnel Plot mit Asymmetrie: Kleine Studien ohne Nutzen fehlen (fiktive Daten). Eigene Darstellung

Übung 5.2, Rechenaufgabe

Eine Metaanalyse aus 7 Studien berichtet Cochrans Q = 18. Berechnen Sie die Freiheitsgrade und I² in Prozent.

Übung 5.1

Lektion 6

GRADE: von der Evidenzsicherheit zur Empfehlung

GRADE (Grading of Recommendations Assessment, Development and Evaluation) bewertet nicht einzelne Studien, sondern die Sicherheit der Evidenz für einen bestimmten Endpunkt, also das Vertrauen, dass der wahre Effekt nahe am geschätzten liegt. Es gibt vier Stufen: hoch, moderat, niedrig und sehr niedrig.15

Startstufe, Herabstufen, Heraufstufen

Evidenz aus randomisierten Studien beginnt bei „hoch“. Beobachtungsstudien beginnen traditionell bei „niedrig“; wird ihr Verzerrungsrisiko mit ROBINS-I bewertet, starten sie formal bei „hoch“ und werden meist wegen Confounding und Selektion um zwei Stufen herabgestuft.15 Herabgestuft wird um eine oder zwei Stufen wegen Verzerrungsrisiko, Inkonsistenz (unerklärte Unterschiede der Ergebnisse), Indirektheit (Population, Intervention, Vergleich oder Endpunkt weichen von der Frage ab), Unpräzision (weite Konfidenzintervalle, wenige Ereignisse) und Publikationsbias. Heraufgestuft wird, vor allem bei Beobachtungsstudien, bei einem großen Effekt (etwa RR über 2 oder unter 0,5 ohne plausible Störgrößen), bei einem Dosis-Wirkungs-Gradienten und wenn alle plausiblen Verzerrungen den beobachteten Effekt eher verkleinern würden.15

Randomisierte StudienStart: hochBeobachtungsstudienStart: niedrig (mit ROBINS-IStart hoch, dann Abzug)Herabstufen um 1 bis 2 StufenVerzerrungsrisikoInkonsistenzIndirektheitUnpräzisionPublikationsbiasje Endpunkt beurteiltHeraufstufen (selten)großer EffektDosis-Wirkungs-GradientConfounding gegen den Effekthochmoderatniedrigsehr niedrigEvidenzsicherheitje EndpunktEvidenz zur Entscheidung: Nutzen, Schaden und Belastung, Evidenzsicherheit,Werte und Präferenzen, Ressourcen, Machbarkeit, Akzeptanz, GerechtigkeitErgebnis: starke oder bedingte Empfehlung für oder gegen eine Maßnahme
Abbildung 3: Ablauf der GRADE-Bewertung: Startstufe, Herab- und Heraufstufen, Evidenzsicherheit je Endpunkt und Entscheidung. Eigene Darstellung

Was GRADE 36 und 38 präzisieren

GRADE guidance 36 stellt klar, dass Inkonsistenz die Variabilität der Ergebnisse meint, nicht die Unterschiede der Studienmerkmale. Bei binären Endpunkten sind relative und absolute Effekte zu betrachten, und dieselbe Evidenz kann je nach Bewertungsziel unterschiedlich eingestuft werden: Geht es nur darum, ob überhaupt ein Effekt besteht, stört Streuung weniger, als wenn ein Effekt oberhalb einer klinisch bedeutsamen Schwelle belegt werden soll. Die Leitlinie beschreibt außerdem, wie I² in diesem Zusammenhang einzuordnen ist und wie die Glaubwürdigkeit von Subgruppeneffekten schrittweise geprüft wird.16 GRADE guidance 38 regelt das Heraufstufen bei einem Dosis-Wirkungs-Gradienten: Zuerst wird dessen Glaubwürdigkeit anhand von fünf Kriterien geprüft (angemessene Analyse, Confounding, ökologische Verzerrung, Konsistenz zwischen Studien, stützende indirekte Evidenz), und nur ein glaubwürdiger Gradient rechtfertigt ein vorsichtiges Heraufstufen um höchstens eine Stufe.17

Tabelle 4: GRADE-Domänen mit Leitfragen
DomäneLeitfrageBeispiel für Herabstufung
VerzerrungsrisikoSchützen Randomisierung, Zuteilung, Verblindung und Vollständigkeit das Ergebnis?unverblindete Studien mit subjektivem Endpunkt
InkonsistenzZeigen die Studien in dieselbe Richtung und Größenordnung?Punktschätzer beiderseits der Schwelle, Intervalle ohne Überlappung
IndirektheitPassen Population, Intervention, Vergleich und Endpunkt zur Frage?Surrogat statt Zielendpunkt, andere Population
UnpräzisionIst das Intervall eng genug für eine Entscheidung?Intervall schließt Nutzen und relevanten Schaden ein
PublikationsbiasFehlen vermutlich Studien?nur kleine, industriefinanzierte positive Studien
Heraufstufengroßer Effekt, Dosis-Wirkung, Confounding gegen den Effektmeist nur bei Beobachtungsstudien

Evidenzsicherheit ist nicht Empfehlungsstärke

Aus der Evidenzsicherheit folgt noch keine Empfehlung. Core GRADE 7 beschreibt den Weg von der Evidenz zur Entscheidung: Eine starke Empfehlung wird ausgesprochen, wenn die erwünschten Folgen die unerwünschten klar überwiegen und praktisch alle informierten Menschen dieselbe Wahl treffen würden; eine bedingte Empfehlung, wenn die Bilanz weniger klar ist oder eine nennenswerte Minderheit anders wählen würde. Stets zu berücksichtigen sind Nutzen, Schaden und Belastung, die Evidenzsicherheit sowie Werte und Präferenzen der Patienten; aus Sicht einer Bevölkerung kommen Ressourcen, Machbarkeit, Akzeptanz und gesundheitliche Gerechtigkeit hinzu. Eine starke Empfehlung trotz niedriger Evidenzsicherheit ist in besonderen Situationen gerechtfertigt, etwa wenn eine Maßnahme mit hoher Wahrscheinlichkeit ein katastrophales Ereignis verhindert oder wenn niedrig gesicherter Nutzen einem gut belegten erheblichen Schaden gegenübersteht.18 Umgekehrt führt hoch gesicherte Evidenz für einen kleinen Nutzen nicht automatisch zu einer starken Empfehlung. Wie deutsche Leitlinien diese Stärke sprachlich ausdrücken („soll“, „sollte“, „kann“), zeigt die Einheit Aktuelle Leitlinien.

Vier Prüffragen für jede Literaturaufgabe

Für Journal Club, Facharztprüfung und Visite lässt sich jede Studienbewertung auf vier Fragen zurückführen. Wie groß ist der Effekt? Absolut und relativ, für einen patientenrelevanten Endpunkt; die Rechenwege stehen in der Einheit Effektmaße. Wie präzise ist er? Das Konfidenzintervall zeigt, welche Effekte mit den Daten vereinbar sind. Wie glaubwürdig ist die kausale Aussage? Design, Schutzmechanismen und Verzerrungsrisiko entscheiden. Ist das Ergebnis übertragbar? Population, Vergleichsbehandlung, Versorgungsumfeld und Basisrisiko müssen zu den eigenen Patienten passen. Das Ansehen der Zeitschrift ersetzt keine dieser Prüfungen.

  1. Größe: absolute und relative Differenz für den patientenrelevanten Endpunkt.
  2. Präzision: Konfidenzintervall, Zahl der Ereignisse, Informationsgröße.
  3. Glaubwürdigkeit: Design, Randomisierung, verdeckte Zuteilung, Verblindung, Vollständigkeit, selektives Berichten.
  4. Übertragbarkeit: Population, Vergleich, Setting, Basisrisiko, Werte der Patienten.
Aktuelle Evidenz: neue Standards seit 2023

CONSORT 2025: 30 Punkte, sieben neu, drei überarbeitet, einer gestrichen, neuer Abschnitt zu Open Science.6 SPIRIT 2025: 34 Mindestpunkte für Protokolle, zwei neu, fünf überarbeitet, fünf gestrichen oder zusammengeführt, Einbeziehung von Patienten und Öffentlichkeit.5 TRIPOD+AI 2024: 27 Punkte für Regression und maschinelles Lernen, ersetzt TRIPOD 2015.10 Cochrane Handbook 6.5: REML als Standard für tau², Hartung-Knapp-Sidik-Jonkman für das Konfidenzintervall nahegelegt.14 GRADE 36 und 38 (2023): Inkonsistenz bezogen auf Ergebnisse und Bewertungsziel, Heraufstufen bei Dosis-Wirkung nur nach Glaubwürdigkeitsprüfung.16, 17 Core GRADE (2025): kompakte Reihe von PICO bis zur Empfehlung.1, 18

Typische Fehlannahmen
  • „Eine Metaanalyse steht immer an der Spitze der Evidenz.“ Eine Metaanalyse verzerrter Studien liefert ein präzises verzerrtes Ergebnis.
  • „I² von 0 % beweist, dass die Studien übereinstimmen.“ Bei wenigen, unpräzisen Studien ist I² unzuverlässig.14
  • „Niedrige Evidenzsicherheit heißt, die Maßnahme wirkt nicht.“ Sie heißt, dass der wahre Effekt deutlich abweichen kann.
  • „Starke Empfehlungen setzen hohe Evidenz voraus.“ In besonderen Situationen sind sie auch bei niedriger Evidenz gerechtfertigt.18
  • „Adjustierung beseitigt Confounding.“ Nur für gemessene und richtig modellierte Einflussgrößen.7
  • „Eine AUC von 0,9 macht ein Modell einsatzbereit.“ Ohne Kalibrierung und externe Validierung nicht.10

Übung 6.1

Lektion 7

Fälle, Merksätze und Aufgaben

Fall 1: Hüftfraktur und die Frage nach dem Narkoseverfahren

Eine 84-jährige Patientin (58 kg) wird mit medialer Schenkelhalsfraktur nach häuslichem Sturz aufgenommen. Vorerkrankungen: Vorhofflimmern unter Apixaban (letzte Einnahme am Vorabend), arterielle Hypertonie, leichte kognitive Einschränkung. Blutdruck 135/80 mmHg, Herzfrequenz 88/min, SpO2 95 % unter Raumluft, Hämoglobin 11,2 g/dl, eGFR 48 ml/min/1,73 m². Die Operation ist für den Folgetag geplant. In der Besprechung verweist ein Kollege auf eine große (fiktive) Registerstudie: 30-Tage-Sterblichkeit 5,1 % nach Spinalanästhesie gegenüber 7,4 % nach Allgemeinanästhesie, adjustierte Odds Ratio 0,67. Er schlägt vor, die Spinalanästhesie „wegen des Überlebensvorteils“ in jedem Fall anzustreben. Eine Assistenzärztin bringt die randomisierte REGAIN-Studie mit 1600 Patienten ein.2

Fall 1, Frage 1

Fall 1, Frage 2

Fall 1, Frage 3

Merksätze

  • Erst PICO, dann Design: Population, Intervention, Vergleich und patientenrelevanter Endpunkt bestimmen, welche Studie passt.1
  • Randomisierung, verdeckte Zuteilung, Verblindung und ITT schützen vor verschiedenen Verzerrungen und ersetzen einander nicht.4
  • Confounding by indication und Immortal-time-Bias lassen Behandlungen in Routinedaten schützend oder schädlich erscheinen; Zeitpunkt null synchronisieren.7
  • Vorhersagemodelle brauchen Trennung nach Patienten, Kalibrierung und externe Validierung; eine hohe AUC allein reicht nicht.10
  • Im Forest Plot zuerst schauen, dann rechnen: I² ist relativ, das Vorhersageintervall zeigt die Spanne für eine neue Einrichtung.14
  • GRADE bewertet Endpunkte, nicht Studien: RCT starten hoch, fünf Gründe führen nach unten, drei nach oben.15
  • Evidenzsicherheit ist nicht Empfehlungsstärke; starke Empfehlungen bei niedriger Evidenz sind in besonderen Situationen gerechtfertigt.18
  • Größe, Präzision, Glaubwürdigkeit, Übertragbarkeit: Die Zeitschrift ersetzt keine dieser Prüfungen.

Aufgaben

Aufgabe 1: Heterogenität berechnen und deuten

Gegeben:
Eine Metaanalyse von 7 Studien zur Prophylaxe postoperativer Übelkeit berichtet ein gepooltes RR von 0,70 (95-%-KI 0,58 bis 0,85), Cochrans Q = 18 und ein Vorhersageintervall von 0,42 bis 1,17.

Frage:
Wie groß ist I², und was bedeutet das Vorhersageintervall für die Einführung in einer neuen Klinik?

Lösung

Freiheitsgrade 7 minus 1 = 6; I² = (18 minus 6)/18 = 67 %, nach dem Cochrane Handbook möglicherweise erhebliche Heterogenität.14 Das Konfidenzintervall beschreibt die Unsicherheit des mittleren Effekts, das Vorhersageintervall die Spanne des wahren Effekts in einer neuen, vergleichbaren Einrichtung: von einer deutlichen Reduktion bis zu einem leichten Anstieg. Vor der Einführung sind Ursachen der Streuung zu suchen, etwa Dosis, Zeitpunkt, Narkoseverfahren oder Endpunktdefinition, und bei der GRADE-Bewertung ist eine Herabstufung wegen Inkonsistenz zu prüfen.16

Aufgabe 2: Immortal time erkennen

Gegeben:
Eine Auswertung aus Routinedaten vergleicht Intensivpatienten, die „irgendwann während des Aufenthalts“ eine Frühmobilisation erhielten, mit Patienten ohne Frühmobilisation. Die Nachbeobachtung beginnt für alle mit der Aufnahme. Die Sterblichkeit ist in der Mobilisationsgruppe um die Hälfte geringer.

Frage:
Welche Verzerrungen erwarten Sie, und wie wäre die Analyse zu verbessern?

Lösung

Immortal-time-Bias: Wer mobilisiert wird, musste bis dahin überleben und stabil genug sein; diese Zeit wird der Mobilisation gutgeschrieben. Zusätzlich Confounding by indication, denn stabilere Patienten werden eher mobilisiert. Verbesserung: einen Zielversuch formulieren (Einschluss, Strategien, Zeitpunkt null, Endpunkt), Einschluss und Strategiezuordnung am selben Zeitpunkt synchronisieren, etwa durch Landmark-Analyse oder zeitabhängige Exposition, und gemessene Einflussgrößen zum Zeitpunkt null adjustieren. Ungemessenes Confounding bleibt eine Grenze.7

Aufgabe 3: Evidenzsicherheit bestimmen

Gegeben:
Fünf RCT (1800 Patienten) prüfen ein Verfahren zur Schmerztherapie. Drei sind unverblindet, der Endpunkt ist der selbstberichtete Schmerz. Die Punktschätzer liegen alle auf der Seite des Nutzens, I² = 20 %. Das Konfidenzintervall der mittleren Differenz reicht von einem klinisch bedeutsamen Nutzen bis zu einem unbedeutenden.

Frage:
Welche Evidenzsicherheit ergibt sich nach GRADE, und welche Empfehlung wäre denkbar?

Lösung

Start hoch (RCT). Herabstufung um eine Stufe wegen Verzerrungsrisiko (unverblindet, subjektiver Endpunkt). Keine Herabstufung wegen Inkonsistenz (gleiche Richtung, geringe Heterogenität). Herabstufung wegen Unpräzision ist zu erwägen, weil das Intervall einen unbedeutenden Effekt einschließt. Ergebnis: moderat bis niedrig.15 Die Empfehlung hängt zusätzlich von Nebenwirkungen, Aufwand und Präferenzen ab; bei unklarer Bilanz ist eine bedingte Empfehlung wahrscheinlich.18

Aufgabe 4: Die vier Prüffragen anwenden

Gegeben:
POISE-3: Tranexamsäure gegen Placebo bei nicht herzchirurgischen Eingriffen, 9535 Patienten. Blutungsendpunkt 9,1 % gegenüber 11,7 % (absolute Differenz minus 2,6 Prozentpunkte, 95-%-KI minus 3,8 bis minus 1,4). Kardiovaskulärer Sicherheitsendpunkt 14,2 % gegenüber 13,9 %, Nichtunterlegenheit formal nicht nachgewiesen.

Frage:
Beantworten Sie die vier Prüffragen.

Lösung

Größe: etwa 2,6 vermiedene Blutungsereignisse je 100 Patienten in 30 Tagen, NNT rund 38. Präzision: Intervall 1,4 bis 3,8 Prozentpunkte, also sicher ein Nutzen, dessen Größe von klein bis moderat reicht. Glaubwürdigkeit: großer, placebokontrollierter RCT mit hoher Glaubwürdigkeit für den Blutungsendpunkt; für den Sicherheitsendpunkt bleibt Unsicherheit, weil die Nichtunterlegenheit nicht belegt ist. Übertragbarkeit: für Patienten mit ähnlichem Blutungs- und Thromboserisiko; bei niedrigem Blutungsrisiko sinkt der absolute Nutzen, das mögliche thrombotische Risiko bleibt. Details zur Rechnung in der Einheit Effektmaße.

Aufgabenblock abschließen

Markieren Sie den Block als bearbeitet, wenn Sie alle Aufgaben gelöst und mit den Lösungen verglichen haben.

Abschlussquiz, etwa 10 Minuten

Abschlussquiz

Zehn Fragen. Bestanden ab 80 %.

Zum Nachschlagen

Begriffe und Literatur

BegriffBedeutung
PICOPopulation, Intervention, Vergleich, Endpunkt: Struktur einer klinischen Frage
Verdeckte ZuteilungDie nächste Zuteilung ist beim Einschluss nicht bekannt
Intention to treatAuswertung nach der randomisierten Gruppe, unabhängig von der erhaltenen Behandlung
Confounding by indicationDie Indikation beeinflusst Behandlung und Prognose zugleich
Immortal-time-BiasÜberlebenszeit vor Behandlungsbeginn wird der Behandlung zugerechnet
Target Trial EmulationNachbildung eines idealen randomisierten Versuchs mit Beobachtungsdaten
DatenleckageInformation aus Testdaten gelangt in das Training eines Modells
I² und tau²Anteil der Variabilität durch echte Unterschiede und Varianz der wahren Effekte zwischen Studien
VorhersageintervallBereich des wahren Effekts in einer neuen, vergleichbaren Studie oder Einrichtung
EvidenzsicherheitVertrauen, dass der wahre Effekt nahe am geschätzten liegt: hoch, moderat, niedrig, sehr niedrig

Literatur

  1. Guyatt G, Agoritsas T, Brignardello-Petersen R, Mustafa RA, Rylance J et al. Core GRADE 1: overview of the Core GRADE approach. BMJ. 2025;389:e081903. doi:10.1136/bmj-2024-081903
  2. Neuman MD, Feng R, Carson JL et al. Spinal anesthesia or general anesthesia for hip surgery in older adults. N Engl J Med. 2021;385(22):2025-2035. doi:10.1056/NEJMoa2113514
  3. Semler MW, Casey JD, Lloyd BD et al. Oxygen-saturation targets for critically ill adults receiving mechanical ventilation. N Engl J Med. 2022;387(19):1759-1769. doi:10.1056/NEJMoa2208415
  4. Sterne JAC, Savović J, Page MJ, Elbers RG, Blencowe NS et al. RoB 2: a revised tool for assessing risk of bias in randomised trials. BMJ. 2019;366:l4898. doi:10.1136/bmj.l4898 (methodische Grundlagenarbeit)
  5. Chan AW, Boutron I, Hopewell S, Moher D, Schulz KF et al. SPIRIT 2025 statement: updated guideline for protocols of randomised trials. BMJ. 2025;389:e081477. doi:10.1136/bmj-2024-081477
  6. Hopewell S, Chan AW, Collins GS, Hróbjartsson A, Moher D et al. CONSORT 2025 statement: updated guideline for reporting randomised trials. BMJ. 2025;389:e081123. doi:10.1136/bmj-2024-081123
  7. Hernán MA, Wang W, Leaf DE. Target trial emulation: a framework for causal inference from observational data. JAMA. 2022;328(24):2446-2447. doi:10.1001/jama.2022.21383
  8. Vrbin CM. Recommendations for reporting measures of diagnostic accuracy. Cytopathology. 2023;34(3):185-190. doi:10.1111/cyt.13208
  9. Schlattmann P. Statistics in diagnostic medicine. Clin Chem Lab Med. 2022;60(6):801-807. doi:10.1515/cclm-2022-0225
  10. Collins GS, Moons KGM, Dhiman P, Riley RD, Beam AL et al. TRIPOD+AI statement: updated guidance for reporting clinical prediction models that use regression or machine learning methods. BMJ. 2024;385:e078378. doi:10.1136/bmj-2023-078378
  11. Kapoor S, Narayanan A. Leakage and the reproducibility crisis in machine-learning-based science. Patterns (N Y). 2023;4(9):100804. doi:10.1016/j.patter.2023.100804
  12. Enevoldsen J, Vistisen ST. Performance of the Hypotension Prediction Index may be overestimated due to selection bias. Anesthesiology. 2022;137(3):283-289. doi:10.1097/ALN.0000000000004320
  13. Page MJ, McKenzie JE, Bossuyt PM, Boutron I, Hoffmann TC et al. The PRISMA 2020 statement: an updated guideline for reporting systematic reviews. BMJ. 2021;372:n71. doi:10.1136/bmj.n71
  14. Deeks JJ, Higgins JPT, Altman DG, McKenzie JE, Veroniki AA (Hrsg.). Chapter 10: Analysing data and undertaking meta-analyses (last updated November 2024). In: Higgins JPT, Thomas J, Chandler J et al. (Hrsg.). Cochrane Handbook for Systematic Reviews of Interventions, Version 6.5. Cochrane; 2024. https://www.cochrane.org/handbook
  15. Schünemann HJ, Higgins JPT, Vist GE, Glasziou P, Akl EA, Skoetz N, Guyatt GH. Chapter 14: Completing „Summary of findings“ tables and grading the certainty of the evidence (last updated August 2023). In: Higgins JPT, Thomas J, Chandler J et al. (Hrsg.). Cochrane Handbook for Systematic Reviews of Interventions, Version 6.5. Cochrane; 2024. https://www.cochrane.org/handbook
  16. Guyatt G, Zhao Y, Mayer M, Briel M, Mustafa R et al. GRADE guidance 36: updates to GRADE’s approach to addressing inconsistency. J Clin Epidemiol. 2023;158:70-83. doi:10.1016/j.jclinepi.2023.03.003
  17. Murad MH, Verbeek J, Schwingshackl L, Filippini T, Vinceti M et al. GRADE guidance 38: updated guidance for rating up certainty of evidence due to a dose-response gradient. J Clin Epidemiol. 2023;164:45-53. doi:10.1016/j.jclinepi.2023.09.011
  18. Guyatt G, Vandvik PO, Iorio A, Agarwal A, Yao L et al. Core GRADE 7: principles for moving from evidence to recommendations and decisions. BMJ. 2025;389:e083867. doi:10.1136/bmj-2024-083867

Standardwerke

  • Hernán MA, Robins JM. Causal Inference: What If. Boca Raton: Chapman & Hall/CRC; 2020
  • Borenstein M, Hedges LV, Higgins JPT, Rothstein HR. Introduction to Meta-Analysis. 2. Aufl. Chichester: Wiley; 2021
  • Guyatt G, Rennie D, Meade MO, Cook DJ (Hrsg.). Users’ Guides to the Medical Literature: A Manual for Evidence-Based Clinical Practice. 3. Aufl. New York: McGraw-Hill Education; 2015

© 2026 Ulrich Frey. Alle Rechte vorbehalten. Neufassung für das E-Learning, Recherchestand September 2026. Die Inhalte dienen der Aus- und Weiterbildung und ersetzen keine Leitlinie, keine Fachinformation und keine lokalen Standards.