Jede Studienbewertung beginnt mit der Frage, die eine Studie beantworten will, und erst danach mit dem Design. Ein Design ist weder gut noch schlecht; es passt zu einer Frage oder es passt nicht. Diese Einheit führt vom klinischen Problem über die Designs und ihre typischen Verzerrungen zur Metaanalyse und zur Bewertung eines ganzen Evidenzkörpers mit GRADE. Wie eine Studie praktisch geplant, genehmigt und publiziert wird, behandelt die Einheit Forschung und Translation; wie im Dienst schnell eine Antwort gefunden wird, Up-to-date-Medizin.
Die Frage nach PICO
Eine präzise Frage nennt die Population, die Intervention oder Exposition, den Vergleich und den patientenrelevanten Endpunkt (englisch outcome), kurz PICO. Die Core-GRADE-Reihe von 2025 stellt diese Struktur an den Anfang jeder Evidenzbewertung und betont, dass Behandlungseffekte zwischen Patientengruppen variieren können; wer die Population unscharf formuliert, kann später nicht beurteilen, ob ein Ergebnis übertragbar ist.1 Für die Anästhesie heißt das konkret: Nicht „Ist die Spinalanästhesie besser?“, sondern „Senkt bei Patienten ab 50 Jahren mit hüftgelenksnaher Fraktur die Spinalanästhesie im Vergleich zur Allgemeinanästhesie die Kombination aus Tod und fehlender Gehfähigkeit nach 60 Tagen?“ Genau diese Frage stellte die REGAIN-Studie.2
Designs und was sie leisten
Ein randomisierter kontrollierter Versuch (RCT) weist eine Intervention zufällig zu und kann deshalb kausale Aussagen über die Wirkung dieser Zuweisung machen. Ein Cluster-RCT randomisiert nicht einzelne Patienten, sondern Einheiten wie Stationen, Kliniken oder Zeitabschnitte; das ist sinnvoll, wenn eine Maßnahme nur für eine ganze Einheit umgesetzt werden kann oder wenn sich Behandelte und Unbehandelte sonst gegenseitig beeinflussen würden. Die Analyse muss dann berücksichtigen, dass Patienten desselben Clusters sich ähnlicher sind als Patienten verschiedener Cluster. Pragmatische Studien prüfen eine Strategie unter Alltagsbedingungen mit breiten Einschlusskriterien und patientenrelevanten Endpunkten; sie beantworten die Frage „Wirkt es in der Versorgung?“ statt „Kann es unter idealen Bedingungen wirken?“. Ein Beispiel für beides ist PILOT: eine pragmatische, clusterrandomisierte Cluster-Crossover-Studie in einer Notaufnahme und einer internistischen Intensivstation, die drei Zielbereiche der Sauerstoffsättigung bei beatmeten Patienten verglich; die Zahl der beatmungsfreien Tage unterschied sich nicht (Median 20, 21 und 21 Tage).3
Beobachtungsstudien weisen nichts zu, sondern beobachten. Eine Kohortenstudie verfolgt Exponierte und Nichtexponierte über die Zeit und kann Risiken, Inzidenzen und zeitliche Abfolgen beschreiben, bleibt aber anfällig für Confounding. Eine Fall-Kontroll-Studie geht vom Ereignis aus und vergleicht die frühere Exposition von Fällen und Kontrollen; sie eignet sich für seltene Ereignisse und liefert Odds Ratios, ist aber für Auswahl- und Erinnerungsfehler anfällig. Eine Querschnittsstudie misst Exposition und Zustand zum selben Zeitpunkt und beschreibt Prävalenzen, ohne die zeitliche Richtung klären zu können. Eine diagnostische Genauigkeitsstudie vergleicht einen Indextest mit einem Referenzstandard in einer möglichst repräsentativen Patientenserie. Ein Prognosemodell kombiniert mehrere Merkmale zu einer Risikovorhersage und muss nach der Entwicklung an unabhängigen Daten extern validiert werden.
| Design | beantwortet | Effektmaß | Hauptrisiko |
|---|---|---|---|
| RCT | Wirkung einer zugewiesenen Intervention | RR, ARR, HR, Mittelwertdifferenz | fehlende verdeckte Zuteilung, Verblindung, Ausfälle |
| Cluster-RCT | Wirkung einer Maßnahme auf Ebene von Einheiten | wie RCT, mit Clusterkorrektur | wenige Cluster, Rekrutierungsbias nach Zuteilung |
| Pragmatischer RCT | Wirksamkeit im Versorgungsalltag | patientenrelevante Endpunkte | Verdünnung durch Nichtadhärenz, Wechsel der Gruppen |
| Kohortenstudie | Risiko und Verlauf nach Exposition | RR, HR (adjustiert) | Confounding, Immortal-time-Bias, Verluste |
| Fall-Kontroll-Studie | Exposition bei seltenen Ereignissen | OR | Auswahl der Kontrollen, Erinnerungsbias |
| Querschnittsstudie | Häufigkeit zu einem Zeitpunkt | Prävalenz, Prävalenzverhältnis | keine zeitliche Richtung |
| Diagnostische Genauigkeitsstudie | Güte eines Tests gegen Referenzstandard | Sensitivität, Spezifität, Likelihood Ratio | Spektrum- und Verifikationsbias |
| Prognosemodell | individuelles Risiko | Diskrimination, Kalibrierung, klinischer Nutzen | Überanpassung, Datenleckage, fehlende externe Validierung |