Weiterbildung, Statistik und Studienbewertung · Stufe WBJ 1

Daten beschreiben: Datentypen, Verteilung und Streuung

Wer Daten richtig beschreibt, erkennt die meisten Fehler einer Studie, bevor der erste Test gerechnet ist.

Lernziele
  • Datentypen und Skalenniveaus unterscheiden und die Beobachtungseinheit einer Auswertung benennen.
  • Passende Lage- und Streuungsmaße für symmetrische und schiefe Verteilungen wählen und begründen.
  • Histogramm und Boxplot lesen und eine schiefe Verteilung aus Mittelwert und SD erkennen.
  • Standardabweichung und Standardfehler unterscheiden und beide aus Angaben einer Studie berechnen.
  • Abhängige Messungen erkennen und den Designeffekt als Maß der verlorenen Information deuten.
  • Die Mechanismen fehlender Werte (MCAR, MAR, MNAR) und die Grenzen der Imputation erklären.
  • Einen Methodenvergleich nach Bland und Altman lesen, Übereinstimmungsgrenzen berechnen und den prozentualen Fehler einordnen.
  • Die Anforderungen von SPIRIT 2025 und CONSORT 2025 an Analysepopulation und fehlende Daten benennen.

Zu dieser Lerneinheit

  1. Sechs Lektionen mit zwei Rechnern, drei Rechenaufgaben, sieben Übungen, ein klinischer Fall mit drei Fragen, Aufgaben und ein Abschlussquiz mit zehn Fragen.
  2. Weiter geht es mit Diagnostische Tests und Schließende Statistik.
  3. Den Weg von der Frage zur Publikation behandelt Forschung und Translation, das strukturierte Lesen von Studien Publikationsupdates, die Einordnung von Empfehlungen Aktuelle Leitlinien.

Lektion 1

Datentypen, Skalenniveaus und Beobachtungseinheit

Jede statistische Auswertung beginnt mit zwei unscheinbaren Fragen: Welcher Art sind die Daten, und wer oder was ist eine Beobachtung? Wer diese Fragen überspringt, wählt später falsche Kennzahlen, falsche Tests und oft eine falsche Fallzahl. In der Anästhesie ist die Versuchung besonders groß, weil Monitore in hoher Frequenz Daten erzeugen: Ein einziges Narkoseprotokoll enthält Tausende Blutdruck-, Herzfrequenz- und Sättigungswerte. Diese Menge wirkt wie eine große Stichprobe, beschreibt aber nur einen Patienten.1

Datentypen und Skalenniveaus

Kategoriale Merkmale ordnen Beobachtungen in Klassen. Sind die Klassen ungeordnet, spricht die Statistik von nominalen Daten: Geschlecht, Blutgruppe, Art des Atemwegs (Maske, Larynxmaske, Tubus) oder das Auftreten einer postoperativen Übelkeit mit „ja“ oder „nein“. Nominale Daten werden als absolute Häufigkeit und als Anteil mit Nenner berichtet, etwa „37 von 212 Patienten (17,5 %)“. Haben die Klassen eine natürliche Reihenfolge, ohne dass die Abstände zwischen ihnen gleich sind, liegen ordinale Daten vor. Die ASA-Klassifikation, die Mallampati-Klasse, die numerische Schmerzskala von 0 bis 10 oder eine Sedierungsskala sind ordinal: Der Schritt von ASA 1 nach ASA 2 ist nicht „gleich groß“ wie der von ASA 3 nach ASA 4. Für ordinale Daten eignen sich Median, Quartile und die Verteilung über alle Stufen; ein Mittelwert von „2,4 ASA-Punkten“ ist rechnerisch möglich, inhaltlich aber fragwürdig.

Metrische Daten haben gleiche Abstände. Bei Intervalldaten fehlt ein natürlicher Nullpunkt (Temperatur in Grad Celsius), bei Verhältnisdaten ist er vorhanden (Herzzeitvolumen, Körpergewicht, Blutverlust in Millilitern). Metrische Daten können stetig sein, also jeden Wert in einem Bereich annehmen (Laktat, Körpertemperatur), oder diskret, also nur ganze Zahlen annehmen (Zahl der Intubationsversuche, Zahl der Antiemetika-Gaben). Zeiten bis zu einem Ereignis bilden eine eigene Gruppe: Die Zeit bis zur Extubation oder bis zur Entlassung ist nicht immer vollständig beobachtet, weil manche Patienten zum Ende der Beobachtung das Ereignis noch nicht erreicht haben. Solche zensierten Daten brauchen eigene Verfahren der Überlebenszeitanalyse und dürfen nicht einfach gemittelt werden.2

Tabelle 1: Skalenniveaus mit Beispielen aus Anästhesie und Intensivmedizin und passender Beschreibung
SkalenniveauBeispieleLageStreuung oder VerteilungDarstellung
nominalPONV ja oder nein, Atemweg, BlutgruppeModus, AnteilHäufigkeiten aller KategorienTabelle, Balken
ordinalASA, Mallampati, NRS 0 bis 10, RASSMedianQuartile, Interquartilsabstand, Verteilung über Stufengestapelte Balken, Boxplot
metrisch, annähernd symmetrischKörpergröße, HämoglobinMittelwertStandardabweichungHistogramm, Punktdiagramm
metrisch, schiefVerweildauer, Blutverlust, OpioidverbrauchMedianInterquartilsabstand, SpannweiteHistogramm, Boxplot
Zeit bis EreignisZeit bis Extubation, Überlebenmediane ZeitKaplan-Meier-KurveÜberlebenskurve mit Zahl unter Risiko

Die Beobachtungseinheit

Die zweite Grundfrage lautet: Was ist die Einheit, über die eine Aussage getroffen werden soll? In einer Studie zu postoperativer Übelkeit ist es in der Regel der Patient. In einer Studie zur Punktionstechnik kann es die einzelne Punktion sein, in einer Studie zur Kommunikation im Team die Schicht, in einer Registerstudie die Klinik. Die Beobachtungseinheit bestimmt, welche Werte voneinander unabhängig sind. Zwei Patienten sind in der Regel unabhängig; zwei Blutdruckwerte desselben Patienten im Abstand von einer Minute sind es nicht. Die Einheit der Randomisierung und die Einheit der Auswertung sollten zueinander passen: Wird nach Operationssälen oder Stationen randomisiert (Clusterrandomisierung), muss die Auswertung diese Gruppierung berücksichtigen.3

Praktisch hilft ein einfacher Satz vor jeder Auswertung: „Eine Zeile meiner Tabelle ist ein …“. Lautet die Antwort „ein Messwert“, obwohl die Fragestellung Patienten betrifft, ist eine Aggregation (zum Beispiel ein Wert je Patient) oder ein Modell für abhängige Daten nötig. Diese Entscheidung gehört in den Analyseplan, bevor Daten erhoben werden; SPIRIT 2025 verlangt, dass Protokolle die Analysepopulation und die statistischen Methoden vorab festlegen und den statistischen Analyseplan zugänglich machen.4

Kategorisieren kostet Information

Ein häufiger Schritt in klinischen Arbeiten ist das Zerteilen stetiger Größen: MAP unter 65 mmHg „ja oder nein“, Alter über 70 Jahre, Laktat über 2 mmol/l. Das erleichtert die Kommunikation, verschenkt aber Information. Zwei Patienten mit MAP 64 und 40 mmHg landen in derselben Kategorie, zwei Patienten mit 64 und 66 mmHg in verschiedenen. Schwellen sollten deshalb klinisch begründet und vorab festgelegt sein; die Suche nach der „besten“ Schwelle in denselben Daten erzeugt optimistische Ergebnisse, die sich in neuen Daten selten bestätigen. Wo möglich, wird die stetige Größe zusätzlich stetig ausgewertet.

Übung 1.1

Lektion 2

Lage, Streuung und Form einer Verteilung

Beschreibende Statistik fasst eine Verteilung mit wenigen Zahlen zusammen. Dazu gehören immer ein Lagemaß (wo liegt die Mitte?) und ein Streuungsmaß (wie breit streuen die Werte?). Welche Maße passen, hängt von der Form der Verteilung ab, und die Form sieht nur, wer die Daten vorher grafisch betrachtet.2

Mittelwert, Median und Modus

Der arithmetische Mittelwert ist die Summe aller Werte geteilt durch ihre Zahl. Er nutzt jede Information, reagiert aber stark auf Ausreißer: Ein einzelner Patient mit 40 Tagen Intensivaufenthalt verschiebt den Mittelwert einer kleinen Gruppe deutlich. Der Median ist der Wert, der die geordneten Beobachtungen in zwei gleich große Hälften teilt. Er ist robust gegenüber Extremwerten und für ordinale Daten das natürliche Lagemaß. Der Modus ist der häufigste Wert; er ist vor allem für nominale Daten und für mehrgipflige Verteilungen interessant. Bei einer symmetrischen, eingipfligen Verteilung liegen alle drei nahe beieinander. Bei einer rechtsschiefen Verteilung, also mit langem Ausläufer zu hohen Werten, liegt der Mittelwert rechts vom Median. Typische rechtsschiefe Größen in der Anästhesie sind Blutverlust, Opioidverbrauch, Verweildauer, Laktat und Beatmungsdauer.

10203040123456789101112131415Verweildauer in TagenAnzahl PatientenMedian 4Mittelwert 4,9Rechter Ausläufer:wenige lange Verläufe ziehenden Mittelwert nach rechtsIQR 3 bis 6AusreißerBoxplot
Abbildung 1: Rechtsschiefe Verteilung der postoperativen Verweildauer bei 200 Patienten (fiktive Daten). Oben Histogramm mit Median (Linie) und Mittelwert (gestrichelt), unten der Boxplot derselben Daten: Box vom ersten bis zum dritten Quartil, Strich im Median, Antennen bis zum letzten Wert innerhalb des 1,5-fachen Interquartilsabstands, Kreise für Ausreißer. Eigene Darstellung

Streuung: Standardabweichung, Quartile, Spannweite

Die Standardabweichung (SD) ist die Wurzel aus der mittleren quadrierten Abweichung vom Mittelwert. Bei annähernd normalverteilten Daten liegen rund zwei Drittel der Werte innerhalb von einer SD um den Mittelwert und etwa 95 % innerhalb von 1,96 SD. Diese Faustregel gilt nur bei Normalverteilung. In Abbildung 1 beträgt der Mittelwert 4,9 Tage und die SD 2,8 Tage; die Regel „Mittelwert minus zwei SD“ ergäbe eine negative Verweildauer, was die Schiefe verrät. Für Größen, die nicht negativ werden können, gilt als Faustregel: Ist die SD größer als der halbe Mittelwert, ist die Verteilung wahrscheinlich schief, und Mittelwert mit SD beschreibt sie schlecht.5

Bei schiefen Daten beschreiben Median und Interquartilsabstand (IQR) die Verteilung besser. Das erste Quartil (Q1) trennt das untere Viertel ab, das dritte Quartil (Q3) das obere Viertel. Der IQR ist Q3 minus Q1 und umfasst die mittleren 50 % der Werte; in Abbildung 1 reicht er von 3 bis 6 Tagen. Berichtet wird am besten „Median 4 Tage (IQR 3 bis 6)“, denn die beiden Grenzen zeigen die Asymmetrie, die eine einzelne Zahl „IQR 3“ verschweigt. Die Spannweite (Minimum bis Maximum) ergänzt die Angabe, ist aber von Einzelwerten abhängig und wächst mit der Stichprobengröße.

Tabelle 2: Lage- und Streuungsmaße im Überblick
MaßBerechnungStärkeSchwächeGeeignet für
MittelwertSumme durch Anzahlnutzt alle Werte, Grundlage vieler Testsempfindlich für Ausreißersymmetrische metrische Daten
Medianmittlerer Wert der geordneten Reiherobustnutzt weniger Informationschiefe und ordinale Daten
StandardabweichungWurzel der VarianzEinheit wie die Datennur bei Normalverteilung anschaulichStreuung der Einzelwerte
InterquartilsabstandQ3 minus Q1robust, zeigt mittlere 50 %ohne Q1 und Q3 wenig aussagekräftigschiefe Daten
SpannweiteMaximum minus Minimumzeigt Extremwertehängt von n und Einzelwerten abErgänzung, Plausibilitätsprüfung
VariationskoeffizientSD durch Mittelwertdimensionslosnur für Verhältnisdaten sinnvollPräzision eines Messverfahrens

Normalverteilung und Transformation

Die Normalverteilung ist symmetrisch, glockenförmig und durch Mittelwert und SD vollständig beschrieben. Viele biologische Größen sind annähernd normalverteilt, viele aber nicht. Ob eine Normalverteilung plausibel ist, zeigt am zuverlässigsten der Blick auf Histogramm oder Quantil-Quantil-Diagramm; formale Normalitätstests sind bei kleinen Stichproben zu schwach und bei großen Stichproben übertrieben empfindlich. Zudem betrifft die Annahme vieler Verfahren nicht die Rohdaten, sondern die Residuen eines Modells oder die Verteilung des Mittelwerts. Rechtsschiefe positive Größen werden oft nach Logarithmierung annähernd symmetrisch; die Ergebnisse werden dann als geometrischer Mittelwert oder als Verhältnis berichtet. Mehrgipflige Verteilungen deuten auf Untergruppen hin, zum Beispiel ambulante und stationäre Eingriffe in derselben Tabelle.1

Darstellung

Für kleine und mittlere Stichproben sind Punktdiagramme mit allen Einzelwerten am ehrlichsten, gegebenenfalls ergänzt um Median und IQR. Boxplots fassen größere Stichproben zusammen und zeigen Schiefe und Ausreißer auf einen Blick. Histogramme zeigen die Form, hängen aber von der gewählten Klassenbreite ab. Balkendiagramme mit Fehlerbalken („Dynamitdiagramme“) für stetige Daten verbergen die Verteilung und sollten nicht verwendet werden, erst recht nicht mit dem Standardfehler als Fehlerbalken, denn dieser beschreibt nicht die Streuung der Patienten (Lektion 3).6

Übung 2.1

Lektion 3

Standardabweichung, Standardfehler und Präzision

Standardabweichung und Standardfehler klingen ähnlich und werden in Publikationen regelmäßig verwechselt. Sie beantworten jedoch zwei völlig verschiedene Fragen. Die SD beschreibt, wie weit die einzelnen Patienten um den Mittelwert streuen. Der Standardfehler des Mittelwerts (SEM, kurz SE) beschreibt, wie genau der Mittelwert der Stichprobe den unbekannten Mittelwert der Grundgesamtheit schätzt.6

Stichprobe, Grundgesamtheit und Stichprobenverteilung

Eine Studie untersucht eine Stichprobe, um etwas über eine Grundgesamtheit zu erfahren, etwa über alle Erwachsenen mit einem bestimmten Eingriff. Der Mittelwert der Stichprobe ist eine Punktschätzung. Würde dieselbe Studie sehr oft mit neuen Patienten wiederholt, ergäbe jede Wiederholung einen etwas anderen Mittelwert. Die Verteilung dieser gedachten Mittelwerte heißt Stichprobenverteilung, und ihre Standardabweichung ist der Standardfehler. Geschätzt wird er als SD geteilt durch die Wurzel aus n.1 Daraus folgen zwei praktische Regeln. Erstens: Mit wachsendem n wird der SE kleiner, die SD dagegen bleibt im Mittel gleich, weil die Patienten nicht einheitlicher werden, nur weil mehr von ihnen untersucht werden. Zweitens: Für eine Halbierung des SE braucht es die vierfache Stichprobe. Die Wurzel im Nenner erklärt, warum Präzision teuer ist.

Standardabweichung oder Standardfehler?

Rechenbeispiel: mittlerer arterieller Druck (MAP) einer Stichprobe mit angenommenem Mittelwert 75 mmHg. Modellannahmen: unabhängige Beobachtungen (ein Wert je Patient), annähernd normalverteilte Werte; das Konfidenzintervall nutzt die t-Verteilung. Bei schiefen Daten, Clustern oder sehr kleinen Stichproben gilt die Rechnung nur eingeschränkt.

Standardfehler (SD/√n)
95-%-Konfidenzintervall des Mittelwerts
Bereich für etwa 95 % der Einzelwerte

Konfidenzintervall des Mittelwerts

Aus dem SE lässt sich ein Konfidenzintervall bilden. Für große Stichproben reicht der Mittelwert plus minus 1,96 SE, für kleinere wird der Faktor aus der t-Verteilung genommen, der bei n = 10 etwa 2,26 beträgt. Ein 95-%-Konfidenzintervall entsteht aus einem Verfahren, das bei vielen Wiederholungen in 95 % der Fälle den wahren Mittelwert einschließt. Es sagt nichts darüber, wo 95 % der Patienten liegen; dafür ist der Bereich Mittelwert plus minus 1,96 SD zuständig, der bei Normalverteilung etwa 95 % der Einzelwerte umfasst. Der Rechner oben zeigt den Unterschied: Bei 36 Patienten mit SD 12 mmHg ist der Mittelwert auf etwa plus minus 4 mmHg genau bestimmt, die einzelnen Patienten streuen aber über rund 47 mmHg. Die Deutung des Konfidenzintervalls und seine Rolle beim Testen vertieft die Einheit Schließende Statistik.

Was wann berichtet wird

Beschreibt eine Tabelle die Studienpopulation (klassische „Tabelle 1“), gehört dorthin die SD oder bei schiefen Daten der IQR, weil Leser wissen wollen, wie unterschiedlich die Patienten waren. Soll dagegen die Genauigkeit einer Schätzung gezeigt werden, etwa ein Unterschied zwischen zwei Gruppen, ist das Konfidenzintervall die richtige Angabe. Den SE als „±“-Wert in einer Beschreibungstabelle anzugeben, lässt Daten schmaler und präziser erscheinen, als sie sind: Bei n = 100 ist der SE ein Zehntel der SD.6 Unklar bleibt oft auch, was hinter dem „±“ steht; die Angabe „Mittelwert (SD)“ oder „Median (IQR)“ vermeidet diese Mehrdeutigkeit. In randomisierten Studien werden Ausgangsmerkmale deskriptiv berichtet; Signifikanztests zwischen den randomisierten Gruppen in Tabelle 1 sind nicht sinnvoll, weil Unterschiede dort definitionsgemäß zufällig entstanden sind. CONSORT 2025 verlangt für die Ergebnisse jedes Endpunkts die Effektschätzung mit ihrer Präzision, etwa dem 95-%-Konfidenzintervall.7

Merke

SD beschreibt Patienten, SE beschreibt die Genauigkeit eines Mittelwerts. Wer die Streuung der Patienten zeigen will und den SE angibt, macht die Daten bei n = 100 optisch zehnmal schmaler.

Übung 3.1

Übung 3.2, Rechenaufgabe

Rechenaufgabe: In einer Studie beträgt der mittlere präoperative MAP 82 mmHg bei einer Standardabweichung von 12 mmHg und n = 36 Patienten. Berechnen Sie den Standardfehler und die halbe Breite des 95-%-Konfidenzintervalls des Mittelwerts (Normalapproximation mit Faktor 1,96).

Lektion 4

Wiederholte Messungen und Cluster

Die meisten statistischen Standardverfahren setzen voraus, dass die Beobachtungen voneinander unabhängig sind. In der Anästhesie ist diese Voraussetzung oft verletzt, ohne dass es auf den ersten Blick auffällt: wiederholte Blutdruckmessungen während einer Narkose, mehrere Narkosen desselben Patienten, mehrere Patienten derselben Anästhesistin, mehrere Stationen derselben Klinik. Werte innerhalb einer solchen Gruppe (eines Clusters) ähneln sich stärker als Werte aus verschiedenen Gruppen.3

Warum zehntausend Messwerte keine zehntausend Patienten sind

Angenommen, eine Auswertung umfasst 100 Narkosen mit je 100 minütlich gespeicherten MAP-Werten. Wer die 10 000 Werte wie 10 000 unabhängige Beobachtungen behandelt, rechnet mit einem Standardfehler, der nur ein Hundertstel der SD beträgt. Tatsächlich liefern aufeinanderfolgende Werte desselben Patienten viel weniger neue Information: Ein Patient mit hohem Ausgangsdruck bleibt meist auch in der nächsten Minute hoch. Konfidenzintervalle werden dadurch zu schmal und p-Werte zu klein; scheinbar signifikante Unterschiede können allein aus dieser Pseudoreplikation entstehen. Das Maß für die Ähnlichkeit innerhalb eines Clusters ist die Intraklassenkorrelation (ICC): Sie gibt an, welcher Anteil der Gesamtvarianz auf Unterschiede zwischen den Clustern entfällt. Bei einer ICC von 0 sind die Werte eines Patienten so verschieden wie die verschiedener Patienten, bei 1 sind sie innerhalb des Patienten identisch.

Der Designeffekt übersetzt diese Abhängigkeit in eine Zahl. Für gleich große Cluster mit m Messungen gilt näherungsweise Designeffekt = 1 + (m − 1) × ICC. Die effektive Stichprobengröße ist die Zahl aller Messwerte geteilt durch den Designeffekt. Bei 50 Patienten mit je 20 Messungen und einer ICC von 0,5 ergibt sich ein Designeffekt von 10,5; die 1000 Messwerte tragen dann etwa so viel Information wie 95 unabhängige Beobachtungen. Diese Formel stammt aus der Planung von Clusterstudien und dient hier der Anschauung (Lehrbuchwissen).

Wie viele unabhängige Informationen stecken in wiederholten Messungen?

Designeffekt nach der Formel 1 + (m − 1) × ICC für gleich große Cluster und austauschbare Korrelation. Die Formel ist eine Näherung zur Planung und ersetzt kein Modell für abhängige Daten (gemischtes Modell, GEE).

Messwerte insgesamt
Designeffekt
Effektive Stichprobengröße
Scheinbar zu schmales Konfidenzintervall um Faktor

Wie abhängige Daten richtig ausgewertet werden

Die einfachste korrekte Lösung ist die Aggregation auf die Ebene der Fragestellung: je Patient ein zusammenfassender Wert, etwa der mittlere MAP, der niedrigste MAP, die Zeit unter einer Schwelle oder die Fläche unter einer Schwelle (Dauer mal Tiefe). Diese Kennzahlen müssen vorab festgelegt werden, denn wer nachträglich unter vielen möglichen Kennzahlen die „beste“ auswählt, testet unbemerkt mehrfach. Aufwendiger, aber informativer sind Modelle, die Abhängigkeiten ausdrücklich abbilden: gemischte Modelle mit zufälligen Effekten je Patient oder Cluster, verallgemeinerte Schätzgleichungen (GEE) oder Messwiederholungsmodelle. Sie nutzen alle Messwerte, gewichten sie aber richtig, und sie kommen mit ungleich vielen Messungen je Patient und mit einzelnen fehlenden Zeitpunkten besser zurecht als eine klassische Varianzanalyse mit Messwiederholung.3

Getrennt betrachtet werden sollten zwei Fragen, die in Monitoringstudien oft vermischt sind: Wie verhalten sich Werte zwischen Patienten (ist ein Patient mit höherem Wert A auch einer mit höherem Wert B?) und wie verhalten sie sich innerhalb eines Patienten über die Zeit (steigt B, wenn A steigt?). Eine Korrelation über alle Messwerte vermengt beide Ebenen und kann in beide Richtungen täuschen. Für Methodenvergleiche mit mehreren Messungen je Patient gibt es eigene Varianten der Bland-Altman-Analyse (Lektion 6).8

Cluster in Studiendesigns

Dieselbe Logik gilt für Studien, die ganze Gruppen zuteilen. Wird eine neue Checkliste nach Operationssälen oder Krankenhäusern eingeführt, sind die Patienten eines Saals keine unabhängigen Beobachtungen. Die Fallzahl muss mit dem Designeffekt vergrößert werden, und die Auswertung muss die Clusterstruktur berücksichtigen. Auch in individuell randomisierten Studien kann eine Clusterung entstehen, wenn wenige Behandelnde eine technisch anspruchsvolle Intervention durchführen. CONSORT 2025 enthält dazu einen neuen Punkt zu Auswahlkriterien für Zentren und für die Personen, die die Intervention durchführen.7

Übung 4.1

Übung 4.2, Rechenaufgabe

Rechenaufgabe: Eine Auswertung umfasst 40 Patienten mit je 25 MAP-Werten. Die Intraklassenkorrelation beträgt 0,4. Berechnen Sie den Designeffekt und die effektive Stichprobengröße.

Lektion 5

Fehlende Werte, Imputation und transparente Berichterstattung

Fehlende Werte gibt es in fast jeder klinischen Studie: Ein Patient wird vorzeitig verlegt, ein Fragebogen bleibt leer, ein Laborwert wurde nicht abgenommen, ein Monitor war getrennt. Entscheidend ist nicht nur, wie viele Werte fehlen, sondern warum. Davon hängt ab, ob eine Auswertung der vollständigen Fälle verzerrt ist und welche Ersetzungsverfahren angemessen sind.9

Drei Mechanismen

Die Statistik unterscheidet drei Mechanismen. Fehlen die Werte völlig zufällig (missing completely at random, MCAR), hängt das Fehlen weder von beobachteten noch von unbeobachteten Merkmalen ab; Beispiel: Proben gehen durch einen Transportfehler unabhängig vom Patienten verloren. Die Analyse der vollständigen Fälle verliert dann Power, bleibt aber unverzerrt. Fehlen die Werte zufällig bedingt (missing at random, MAR), hängt das Fehlen von beobachteten Merkmalen ab; Beispiel: Ältere Patienten füllen den Fragebogen am dritten Tag seltener aus, und das Alter ist bekannt. Werden diese Merkmale in einem Modell berücksichtigt, lässt sich die Verzerrung korrigieren. Fehlen die Werte nicht zufällig (missing not at random, MNAR), hängt das Fehlen vom fehlenden Wert selbst ab; Beispiel: Patienten mit starken Schmerzen oder schwerem Delir können den Schmerzfragebogen nicht beantworten. Dann ist jede Analyse auf Annahmen angewiesen, die sich aus den Daten allein nicht prüfen lassen.10

Tabelle 3: Mechanismen fehlender Werte und ihre Folgen
MechanismusFehlen hängt ab vonBeispielAnalyse vollständiger FälleAngemessener Umgang
MCARnichts, rein zufälligProbe beim Transport verlorenunverzerrt, aber weniger Powervollständige Fälle oder multiple Imputation
MARbeobachteten MerkmalenÄltere füllen Fragebogen seltener aus, Alter erfassthäufig verzerrtmultiple Imputation oder Modell mit diesen Merkmalen
MNARdem fehlenden Wert selbststarke Schmerzen, deshalb kein SchmerzfragebogenverzerrtSensitivitätsanalysen mit plausiblen Annahmen

Imputation: Wert ersetzt ist nicht Wert gemessen

Einfache Ersetzungsverfahren sind verbreitet und fast immer problematisch. Der Ersatz durch den Mittelwert verringert künstlich die Streuung und schwächt Zusammenhänge ab. Das Fortschreiben des letzten beobachteten Werts (last observation carried forward) unterstellt, dass sich nach dem Ausscheiden nichts mehr ändert, was bei Schmerz, Delir oder Organfunktion selten zutrifft. Die multiple Imputation erzeugt dagegen mehrere plausible vollständige Datensätze aus einem Vorhersagemodell, wertet jeden aus und fasst die Ergebnisse so zusammen, dass die Unsicherheit über die fehlenden Werte in das Konfidenzintervall eingeht. Sie ist unter der MAR-Annahme ein etabliertes Verfahren, setzt aber ein gut gewähltes Imputationsmodell voraus, das die Variablen der späteren Analyse einschließlich des Endpunkts enthält.10

Ein vollständig ausgefüllter Datensatz nach Imputation ist deshalb nicht automatisch unverzerrt. Liegt MNAR nahe, gehören Sensitivitätsanalysen dazu, die zeigen, wie stark sich das Ergebnis unter ungünstigen Annahmen verändert, etwa wenn alle fehlenden Schmerzwerte hoch wären.9 Große Anteile fehlender Werte lassen sich statistisch nicht „reparieren“; sie werden am besten durch Planung vermieden: wenige, klar definierte Endpunkte, realistische Erhebungszeitpunkte, Nachverfolgung auch nach Verlegung und ein Datenmonitoring während der Studie.

Transparenz nach SPIRIT 2025 und CONSORT 2025

Die 2025 aktualisierten Leitlinien für Studienprotokolle und Studienberichte behandeln fehlende Werte ausdrücklich. SPIRIT 2025 umfasst 34 Mindestpunkte für Protokolle randomisierter Studien, darunter die Methoden zum Umgang mit fehlenden Daten, den Zugang zum statistischen Analyseplan und Pläne zur Weitergabe anonymisierter Einzeldaten.4 CONSORT 2025 umfasst 30 Punkte; neu sind unter anderem die Definition der Analysepopulation und die Angabe, wie fehlende Daten in der Analyse behandelt wurden. Für jeden primären und sekundären Endpunkt ist die Zahl der ausgewerteten Teilnehmer je Gruppe anzugeben.7 Beim Lesen einer Studie lohnt deshalb der Blick in das Flussdiagramm und in die Tabellen: Stimmen die Nenner mit der Zahl der Randomisierten überein, und wird erklärt, warum sie abweichen?

Typische Fehlannahmen
  • „Fehlende Werte sind zufällig, also harmlos.“ Ob sie zufällig sind, lässt sich nur begründen, nicht beweisen; das Fehlen hängt in der Klinik oft mit dem Zustand des Patienten zusammen.
  • „Nach der Imputation ist der Datensatz vollständig und damit unverzerrt.“ Imputation gilt nur unter ihren Annahmen, meist MAR.
  • „Viele Messwerte ersetzen viele Patienten.“ Wiederholte Messungen desselben Patienten sind abhängig (Lektion 4).
  • „Der Standardfehler ist das bessere Streuungsmaß, weil er kleiner ist.“ Er beschreibt eine andere Größe (Lektion 3).
  • „Eine hohe Korrelation zeigt, dass zwei Messverfahren austauschbar sind.“ Korrelation misst Zusammenhang, nicht Übereinstimmung (Lektion 6).

Übung 5.1

Lektion 6

Methodenvergleich nach Bland und Altman

Monitoringstudien fragen selten, ob zwei Größen zusammenhängen, sondern ob ein neues Verfahren ein etabliertes ersetzen kann: Fingermanschette statt arterieller Kanüle, Pulskonturanalyse statt Thermodilution, transkutanes statt arterielles CO2. Die passende Methode dafür beschrieben Bland und Altman 1986; sie ist bis heute der Standard für Methodenvergleiche.11

Korrelation ist keine Übereinstimmung

Ein hoher Korrelationskoeffizient zeigt nur, dass die Werte zweier Methoden gemeinsam steigen und fallen. Zwei Verfahren können perfekt korrelieren und dennoch systematisch um 20 mmHg voneinander abweichen, oder das neue Verfahren kann alle Werte um den Faktor 1,5 überzeichnen. Zudem hängt die Korrelation von der Spannweite der Werte ab: Schließt eine Studie Patienten mit MAP zwischen 40 und 130 mmHg ein, wird r fast zwangsläufig hoch, auch wenn die Abweichung im einzelnen Patienten klinisch inakzeptabel ist. Auch ein Signifikanztest auf Unterschied der Mittelwerte beantwortet die Frage nicht: Ein nicht signifikanter Unterschied bedeutet nicht, dass die Methoden im einzelnen Patienten übereinstimmen.11, 2

Das Bland-Altman-Diagramm

Für jedes Messwertpaar werden die Differenz (neue Methode minus Referenz) und der Mittelwert beider Methoden berechnet. Die Differenz wird auf der y-Achse gegen den Mittelwert auf der x-Achse aufgetragen. Der Mittelwert aller Differenzen ist der Bias, also die systematische Abweichung. Die SD der Differenzen beschreibt die zufällige Abweichung. Die Übereinstimmungsgrenzen (limits of agreement) liegen bei Bias plus minus 1,96 SD der Differenzen; zwischen ihnen liegen etwa 95 % der Differenzen, sofern diese annähernd normalverteilt sind. Die Grenzen selbst sind Schätzungen und sollten mit Konfidenzintervallen berichtet werden. Ob die Grenzen akzeptabel sind, ist keine statistische, sondern eine klinische Entscheidung, die vorab festgelegt werden muss.11

-20-1001020507090110Mittelwert beider Methoden (MAP, mmHg)Differenz (mmHg)Bias -2,0obere Grenze +9,8untere Grenze -13,8
Abbildung 2: Bland-Altman-Diagramm mit fiktiven Daten: Differenz Fingermanschette minus arterieller Katheter gegen den Mittelwert beider Methoden. Bias -2,0 mmHg, SD der Differenzen 6,0 mmHg, Übereinstimmungsgrenzen -13,8 bis +9,8 mmHg. Eigene Darstellung

Das Diagramm zeigt mehr als die drei Linien. Ein Trend der Differenzen mit steigendem Mittelwert (proportionaler Bias) bedeutet, dass die Abweichung vom Messbereich abhängt; dann sind logarithmierte Werte, prozentuale Differenzen oder eine Regression der Differenzen auf den Mittelwert angemessener. Nimmt die Streuung mit dem Mittelwert zu, sind feste Grenzen in mmHg irreführend. Einzelne Ausreißer verdienen einen Blick in das Protokoll: Messartefakt, Lagerung, Vasopressor?

Mehrere Messungen je Patient

Monitoringstudien liefern fast immer viele Messpaare je Patient. Werden alle Paare so behandelt, als stammten sie von verschiedenen Patienten, wird die SD der Differenzen unterschätzt, sobald Patienten eine eigene, konstante Abweichung haben. Die Übereinstimmungsgrenzen fallen dann zu schmal aus. Bland und Altman haben dafür Varianten beschrieben, die die Varianz zwischen und innerhalb der Patienten trennen.8 Das Validierungsprotokoll für Blutdruckmessgeräte nach AAMI, ESH und ISO berücksichtigt die Clusterung ausdrücklich: Kriterium 1 verlangt für 255 Messpaare von 85 Personen eine mittlere Differenz von höchstens 5 mmHg bei einer SD von höchstens 8 mmHg; Kriterium 2 prüft zusätzlich die je Person gemittelten Differenzen, und beide Kriterien müssen erfüllt sein.12 Diese Grenzen gelten für die Validierung von Blutdruckmessgeräten; sie sind kein allgemeiner Maßstab für jedes Monitoringverfahren.

Prozentualer Fehler und Trendfähigkeit beim Herzzeitvolumen

Beim Herzzeitvolumen hängt die absolute Abweichung vom Niveau ab. Critchley und Critchley schlugen deshalb den prozentualen Fehler vor: 1,96 SD der Differenzen geteilt durch das mittlere Herzzeitvolumen. Ein Wert bis etwa 30 % galt als akzeptabel, abgeleitet aus einer angenommenen Präzision der Referenzmethode von etwa plus minus 20 %.13 Die Schwelle ist eine Konvention, die von der Präzision der Referenz abhängt, keine Naturkonstante. Für den Einsatz am Patienten zählt außerdem, ob ein Verfahren Veränderungen richtig anzeigt (Trendfähigkeit); dafür werden Vier-Quadranten- und Polardiagramme verwendet, die über die klassische Bland-Altman-Analyse hinausgehen. Die klinische Einordnung der Verfahren behandelt die Einheit Hämodynamisches Monitoring.

Aktuelle Evidenz

Eine Metaanalyse von 54 Studien mit 1522 Patienten verglich die kontinuierliche mit der intermittierenden Thermodilution über den Pulmonalarterienkatheter. Der gepoolte Bias betrug 0,08 l/min, die gepoolten Übereinstimmungsgrenzen reichten von -1,68 bis 1,85 l/min, der gepoolte prozentuale Fehler lag bei 29,7 %. Selbst zwei Varianten desselben Referenzprinzips erfüllen damit die übliche Austauschbarkeitsgrenze nur knapp.14

Das Validierungsprotokoll für Blutdruckmessgeräte verlangt 85 Personen mit je drei Messpaaren, eine mittlere Differenz von höchstens 5 mmHg mit SD höchstens 8 mmHg und ein zweites Kriterium auf Personenebene.12

CONSORT 2025 (30 Punkte) verlangt die Definition der Analysepopulation, den Umgang mit fehlenden Daten und die Zahl der Ausgewerteten je Endpunkt und Gruppe.7

Übung 6.1

Übung 6.2, Rechenaufgabe

Rechenaufgabe: Ein neues Verfahren misst den MAP im Mittel 3 mmHg niedriger als die arterielle Referenz (Bias -3 mmHg). Die SD der Differenzen beträgt 5 mmHg. Berechnen Sie die untere und die obere Übereinstimmungsgrenze.

Lektion 7

Fälle, Merksätze und Aufgaben

Fall 1: Fingermanschette und arterielle Kanüle

Ein 71-jähriger Patient mit arterieller Hypertonie erhält eine offene Hemikolektomie rechts in Allgemeinanästhesie. Neben einer arteriellen Kanüle in der A. radialis links wird probeweise ein kontinuierliches nichtinvasives Verfahren mit Fingermanschette rechts angelegt. In der ersten Stunde stimmen beide Anzeigen gut überein (MAP 78 und 80 mmHg). Nach einer Phase mit Blutverlust von etwa 900 ml und kalten Extremitäten zeigt die Fingermanschette einen MAP von 68 mmHg, die arterielle Messung 57 mmHg; die arterielle Kurve ist gut gedämpft, der Nullabgleich korrekt. Ein Kollege verweist auf eine Broschüre, nach der das Gerät in einer Studie mit 30 Patienten und 12 000 Messpaaren eine Korrelation von r = 0,95 bei einem Bias von 1 mmHg und Übereinstimmungsgrenzen von ±7 mmHg erreicht habe, und schlägt vor, bei künftigen Eingriffen auf die arterielle Kanüle zu verzichten.

Fall 1, Frage 1

Fall 1, Frage 2

Fall 1, Frage 3

Merksätze

  • Vor jeder Auswertung klären: Welcher Datentyp, und was ist eine Beobachtung?
  • Schiefe Daten: Median mit Q1 und Q3; symmetrische Daten: Mittelwert mit SD.
  • Für nicht negative Größen gilt: SD größer als der halbe Mittelwert spricht für Schiefe.5
  • SD beschreibt Patienten, SE die Genauigkeit eines Mittelwerts; SE = SD/√n.6
  • Viele Messwerte von wenigen Patienten sind wenige Beobachtungen; der Designeffekt zeigt, wie wenige.
  • Fehlende Werte: Umfang, Zeitpunkt und plausibler Grund werden berichtet; Imputation heilt nur unter ihren Annahmen.10
  • Korrelation ist keine Übereinstimmung; Methodenvergleiche brauchen Bias, Übereinstimmungsgrenzen und klinisch begründete Akzeptanzgrenzen.11
  • Mehrere Messpaare je Patient verlangen eine Bland-Altman-Variante für Messwiederholungen.8

Aufgaben

Aufgabe 1: Beschreibungstabelle prüfen

Gegeben:
Eine Studie mit 120 Patienten berichtet in Tabelle 1: Alter 67 ± 1,1 Jahre, BMI 28 ± 0,5 kg/m², Operationsdauer 145 ± 11 min, ASA-Klasse 2,6 ± 0,1, Blutverlust 480 ± 38 ml. In der Legende steht „Mittelwert ± SEM“.

Frage:
Welche Angaben sind problematisch, und wie sollte die Tabelle aussehen?

Lösung

Alle „±“-Werte sind Standardfehler; die SD ergibt sich durch Multiplikation mit √120 ≈ 11: Alter etwa ± 12 Jahre, BMI etwa ± 5,5, Operationsdauer etwa ± 120 min, Blutverlust etwa ± 420 ml. Für die Beschreibung der Patienten gehört die SD in die Tabelle.6 Die Operationsdauer und der Blutverlust sind nach diesen Zahlen deutlich rechtsschief (SD nahe oder über dem halben Mittelwert) und sollten als Median (Q1 bis Q3) berichtet werden.5 Die ASA-Klasse ist ordinal und wird als Anzahl und Anteil je Klasse angegeben. Die Legende sollte für jede Zeile eindeutig sagen, welches Maß verwendet wird.

Aufgabe 2: Designeffekt berechnen

Gegeben:
Eine Auswertung zur intraoperativen Hypotonie nutzt 60 Narkosen mit je 120 minütlichen MAP-Werten (7200 Werte). Aus früheren Daten wird eine Intraklassenkorrelation von 0,3 angenommen.

Frage:
Wie groß sind Designeffekt und effektive Stichprobengröße, und welche Auswertung schlagen Sie vor?

Lösung

Designeffekt = 1 + (120 − 1) × 0,3 = 36,7. Effektive Stichprobengröße = 7200 / 36,7 ≈ 196. Die 7200 Werte tragen damit so viel Information wie etwa 196 unabhängige Beobachtungen; ein Standardfehler auf Basis von 7200 wäre um den Faktor √36,7 ≈ 6 zu klein. Vorgeschlagen wird eine vorab festgelegte Kennzahl je Narkose (etwa Zeit oder Fläche unter 65 mmHg) oder ein gemischtes Modell mit zufälligem Effekt je Patient.3

Aufgabe 3: Fehlende Werte einordnen

Gegeben:
In einer randomisierten Studie zur Delirprophylaxe fehlt die Delirerhebung am dritten Tag bei 9 % der Interventions- und 16 % der Kontrollgruppe. Häufigster Grund: „Patient sediert oder nicht kooperationsfähig“. Die Autoren werten nur vollständige Fälle aus.

Frage:
Welche Probleme sehen Sie, und was erwarten Sie im Bericht?

Lösung

Das Fehlen hängt vermutlich mit dem Zustand zusammen, der gemessen werden soll: Sedierte oder nicht kooperationsfähige Patienten haben ein erhöhtes Delirrisiko. Das spricht für MNAR, zumindest für MAR mit wichtigen Einflussgrößen. Die Analyse vollständiger Fälle kann den Effekt verzerren, zumal das Fehlen zwischen den Gruppen ungleich ist. Erwartet werden: Angabe der Zahl der Ausgewerteten je Gruppe, Beschreibung des Umgangs mit fehlenden Daten (CONSORT 2025), eine multiple Imputation unter MAR mit relevanten Prädiktoren und Sensitivitätsanalysen für MNAR, etwa unter der Annahme, dass fehlende Erhebungen häufiger ein Delir bedeuten.7, 10

Aufgabe 4: Methodenvergleich beurteilen

Gegeben:
Ein Pulskonturverfahren wird bei 25 Patienten nach Herzoperation mit der intermittierenden Thermodilution verglichen (je Patient acht Messpaare). Berichtet werden: mittleres Herzzeitvolumen 5,0 l/min, Bias 0,2 l/min, SD der Differenzen 0,9 l/min, Auswertung aller 200 Paare ohne Berücksichtigung der Messwiederholung.

Frage:
Berechnen Sie Übereinstimmungsgrenzen und prozentualen Fehler und bewerten Sie das Ergebnis.

Lösung

Übereinstimmungsgrenzen: 0,2 ± 1,96 × 0,9 = -1,56 bis 1,96 l/min. Prozentualer Fehler: 1,96 × 0,9 / 5,0 = 35 %. Das liegt über der konventionellen Grenze von etwa 30 %.13 Da die Messwiederholung nicht berücksichtigt wurde, sind die Grenzen eher noch zu schmal geschätzt.8 Zum Vergleich erreichte selbst die kontinuierliche Thermodilution in einer Metaanalyse nur 29,7 %.14 Für die Überwachung von Veränderungen wäre zusätzlich eine Trendanalyse nötig.

Aufgabenblock abschließen

Markieren Sie den Block als bearbeitet, wenn Sie alle Aufgaben gelöst und mit den Lösungen verglichen haben.

Abschlussquiz, etwa 10 Minuten

Abschlussquiz

Zehn Fragen. Bestanden ab 80 %.

Zum Nachschlagen

Begriffe und Literatur

BegriffBedeutung
SkalenniveauArt der Information eines Merkmals: nominal, ordinal, metrisch (Intervall oder Verhältnis)
MedianWert, der die geordneten Beobachtungen halbiert; robust gegenüber Ausreißern
InterquartilsabstandAbstand zwischen erstem und drittem Quartil, umfasst die mittleren 50 % der Werte
StandardabweichungMaß der Streuung der Einzelwerte um den Mittelwert
StandardfehlerStandardabweichung der Stichprobenverteilung eines Schätzers, beim Mittelwert SD/√n
IntraklassenkorrelationAnteil der Gesamtvarianz, der auf Unterschiede zwischen Clustern (etwa Patienten) entfällt
DesigneffektFaktor, um den abhängige Daten die Varianz eines Schätzers gegenüber unabhängigen Daten vergrößern
MCAR, MAR, MNARMechanismen fehlender Werte: völlig zufällig, zufällig bedingt durch Beobachtetes, nicht zufällig
ÜbereinstimmungsgrenzenBias ± 1,96 SD der Differenzen im Bland-Altman-Diagramm
Prozentualer Fehler1,96 SD der Differenzen geteilt durch den Mittelwert, üblich beim Herzzeitvolumen

Literatur

  1. Sidebotham D, Hewson D. Core concepts in statistics and research methods. Part I: statistical inference. BJA Educ. 2025;25(1):29-37. doi:10.1016/j.bjae.2024.09.001
  2. Schober P, Mascha EJ, Vetter TR. Statistics from A (agreement) to Z (z score): a guide to interpreting common measures of association, agreement, diagnostic accuracy, effect size, heterogeneity, and reliability in medical research. Anesth Analg. 2021;133(6):1633-1641. doi:10.1213/ANE.0000000000005773
  3. Schober P, Vetter TR. Repeated measures designs and analysis of longitudinal data: if at first you do not succeed, try, try again. Anesth Analg. 2018;127(2):569-575. doi:10.1213/ANE.0000000000003511
  4. Chan AW, Boutron I, Hopewell S, Moher D, Schulz KF et al. SPIRIT 2025 statement: updated guideline for protocols of randomised trials. BMJ. 2025;389:e081477. doi:10.1136/bmj-2024-081477
  5. Altman DG, Bland JM. Detecting skewness from summary information. BMJ. 1996;313(7066):1200. doi:10.1136/bmj.313.7066.1200 (Grundlagenarbeit)
  6. Altman DG, Bland JM. Standard deviations and standard errors. BMJ. 2005;331(7521):903. doi:10.1136/bmj.331.7521.903 (Grundlagenarbeit)
  7. Hopewell S, Chan AW, Collins GS, Hróbjartsson A, Moher D et al. CONSORT 2025 statement: updated guideline for reporting randomised trials. BMJ. 2025;389:e081123. doi:10.1136/bmj-2024-081123
  8. Bland JM, Altman DG. Agreement between methods of measurement with multiple observations per individual. J Biopharm Stat. 2007;17(4):571-582. doi:10.1080/10543400701329422 (Grundlagenarbeit)
  9. Schober P, Vetter TR. Missing data and imputation methods. Anesth Analg. 2020;131(5):1419-1420. doi:10.1213/ANE.0000000000005068
  10. Austin PC, White IR, Lee DS, van Buuren S. Missing data in clinical research: a tutorial on multiple imputation. Can J Cardiol. 2021;37(9):1322-1331. doi:10.1016/j.cjca.2020.11.010
  11. Bland JM, Altman DG. Statistical methods for assessing agreement between two methods of clinical measurement. Lancet. 1986;1(8476):307-310. doi:10.1016/S0140-6736(86)90837-8 (Grundlagenarbeit)
  12. Stergiou GS, Palatini P, Asmar R, Ioannidis JP, Kollias A et al. Recommendations and practical guidance for performing and reporting validation studies according to the Universal Standard for the validation of blood pressure measuring devices by the Association for the Advancement of Medical Instrumentation/European Society of Hypertension/International Organization for Standardization (AAMI/ESH/ISO). J Hypertens. 2019;37(3):459-466. doi:10.1097/HJH.0000000000002039
  13. Critchley LA, Critchley JA. A meta-analysis of studies using bias and precision statistics to compare cardiac output measurement techniques. J Clin Monit Comput. 1999;15(2):85-91. doi:10.1023/A:1009982611386 (Grundlagenarbeit)
  14. Kouz K, Michard F, Bergholz A, Vokuhl C, Briesenick L et al. Agreement between continuous and intermittent pulmonary artery thermodilution for cardiac output measurement in perioperative and intensive care medicine: a systematic review and meta-analysis. Crit Care. 2021;25:125. doi:10.1186/s13054-021-03523-7

Standardwerke

  • Altman DG. Practical Statistics for Medical Research. Chapman and Hall; 1991
  • Bland M. An Introduction to Medical Statistics. 4. Aufl. Oxford University Press; 2015
  • Weiß C. Basiswissen Medizinische Statistik. 7. Aufl. Springer; 2019

© 2026 Ulrich Frey. Alle Rechte vorbehalten. Neufassung für das E-Learning, Recherchestand September 2026. Die Inhalte dienen der Aus- und Weiterbildung und ersetzen keine Leitlinie, keine Fachinformation und keine lokalen Standards.