Weiterbildung, Statistik und Studienbewertung · Stufe WBJ 1

Diagnostische Tests: Vierfeldertafel, Vorhersagewerte und Likelihood-Ratio

Ein Befund ist nur so viel wert wie die Wahrscheinlichkeit, die er verändert.

Lernziele
  • Sensitivität, Spezifität, PPV und NPV aus einer Vierfeldertafel berechnen und klinisch deuten.
  • Die Abhängigkeit der Vorhersagewerte von der Prävalenz mit natürlichen Häufigkeiten erklären.
  • Likelihood-Ratios berechnen und mit Odds von der Vortest- zur Nachtestwahrscheinlichkeit rechnen.
  • Konfidenzintervalle nach Wilson und für Likelihood-Ratios deuten und Nullzellen korrekt behandeln.
  • ROC-Kurve und AUC lesen und die Grenzen der AUC gegenüber Kalibrierung und klinischem Nutzen benennen.
  • Schwellen begründet wählen und das Konzept der Grauzone anwenden.
  • Spektrum-, Verifikations-, Inkorporations- und Beurteilungsbias erkennen.
  • STARD 2015, STARD-AI und QUADAS-3 als Berichts- und Bewertungsstandards einordnen.

Zu dieser Lerneinheit

  1. Sechs Lektionen mit drei interaktiven Rechnern, drei Rechenaufgaben, sechs Übungen, ein klinischer Fall mit drei Fragen, Aufgaben und ein Abschlussquiz mit zehn Fragen.
  2. Voraussetzung: Daten beschreiben; Konfidenzintervalle vertieft Schließende Statistik.
  3. Klinische Anwendung: Perioperative Hypotonie und Volumenreagibilität, Atemwegsmanagement; Lesen von Studien: Publikationsupdates; die Vierfeldertafel im Therapievergleich (RR, NNT): Effektmaße.

Lektion 1

Vierfeldertafel, Sensitivität und Spezifität

Ein diagnostischer Test ist jede Information, die die Wahrscheinlichkeit einer Diagnose verändert: ein Laborwert, ein Ultraschallbefund, eine Kapnographiekurve, ein klinisches Zeichen, ein Score. In der Anästhesie und Intensivmedizin werden solche Tests oft unter Zeitdruck gedeutet, und ihre Fehler haben unmittelbare Folgen: ein übersehener Pneumothorax, eine unerkannte ösophageale Intubation, ein Volumenbolus bei einem Patienten, der nicht davon profitiert. Wer die Logik der Testgüte beherrscht, kann Befunde gewichten, statt sie nur als „positiv“ oder „negativ“ abzuhaken.1

Die Vierfeldertafel

Grundlage ist der Vergleich des zu prüfenden Tests (Indextest) mit einem Referenzstandard, der den tatsächlichen Krankheitsstatus möglichst sicher festlegt, etwa die Computertomographie beim Pneumothorax oder die gemessene Zunahme des Schlagvolumens nach einem Volumenbolus bei der Volumenreagibilität. Jede Person fällt in eines von vier Feldern: richtig positiv (a), falsch positiv (b), falsch negativ (c) oder richtig negativ (d). Alle Kennzahlen lassen sich aus diesen vier Zahlen berechnen, weshalb Berichte diagnostischer Studien die Tafel oder zumindest Zähler und Nenner jeder Kennzahl angeben sollten.2

Tabelle 1: Vierfeldertafel mit eigenem Rechenbeispiel (1000 Personen, Prävalenz 10 %)
Erkrankt (Referenz positiv)Nicht erkrankt (Referenz negativ)Summe
Test positiva = 90 (richtig positiv)b = 180 (falsch positiv)270
Test negativc = 10 (falsch negativ)d = 720 (richtig negativ)730
Summe1009001000

Sensitivität und Spezifität

Die Sensitivität ist der Anteil positiver Tests unter den Erkrankten, also a/(a+c), im Beispiel 90/100 = 90 %. Sie beantwortet die Frage: Wie zuverlässig findet der Test die Kranken? Die Spezifität ist der Anteil negativer Tests unter den Nichterkrankten, also d/(b+d), im Beispiel 720/900 = 80 %. Sie beantwortet die Frage: Wie zuverlässig spricht der Test bei Gesunden nicht an? Beide Größen werden spaltenweise berechnet, jeweils innerhalb einer Gruppe mit bekanntem Krankheitsstatus. Genau deshalb helfen sie am Krankenbett nur indirekt: Dort ist der Krankheitsstatus unbekannt, bekannt ist nur das Testergebnis.3

Sensitivität und Spezifität stehen in einem Spannungsverhältnis. Bei stetigen Tests verschiebt die Wahl der Schwelle beide in entgegengesetzte Richtungen: Eine niedrige Schwelle findet mehr Kranke und erzeugt mehr Fehlalarme, eine hohe Schwelle umgekehrt. Deshalb werden beide Werte immer gemeinsam berichtet; eine Sensitivität ohne Spezifität ist nicht zu bewerten.2 Die verbreiteten Merkhilfen „SnNout“ (bei sehr hoher Sensitivität schließt ein negativer Test aus) und „SpPin“ (bei sehr hoher Spezifität bestätigt ein positiver Test) sind nur Näherungen; ob ein Befund tatsächlich ein- oder ausschließt, hängt zusätzlich von der jeweils anderen Kennzahl und von der Vortestwahrscheinlichkeit ab (Lektion 3).

Ein Beispiel aus dem Atemwegsmanagement

Die Kapnographie ist der wichtigste Test auf die tracheale Tubuslage. Eine internationale Konsensusleitlinie legt fest, dass anhaltend ausgeatmetes CO2 in der Kurvenkapnographie die primäre Methode zur Bestätigung der trachealen Intubation ist und dass der Tubus im Regelfall zu entfernen ist, wenn kein anhaltendes CO2 nachweisbar ist. Ist das Entfernen im Einzelfall gefährlicher, muss eine ösophageale Lage dringend mit anderen, verlässlichen Verfahren ausgeschlossen werden.4 Testtheoretisch ist das eine Entscheidung zugunsten der Sensitivität für die ösophageale Lage: Ein fehlendes Signal wird als ösophageal behandelt, auch wenn einzelne Fälle mit sehr niedrigem Lungenblutfluss falsch positiv erscheinen, denn ein übersehener ösophagealer Tubus ist tödlich, ein unnötiger Tubuswechsel dagegen in der Regel beherrschbar. Die Forderung nach „anhaltendem“ CO2 über mehrere Atemzüge verbessert zugleich die Spezifität gegenüber kurzen Signalen, die nicht aus der Lunge stammen. Das Beispiel zeigt: Welche Fehlerart schwerer wiegt, bestimmt, wie ein Befund gedeutet wird. Das Vorgehen selbst vertieft die Einheit Atemwegsmanagement.

Übung 1.1

Lektion 2

Vorhersagewerte und Prävalenz

Am Krankenbett lautet die Frage nicht „Wie oft ist der Test bei Kranken positiv?“, sondern „Mein Patient hat einen positiven Test; wie wahrscheinlich ist er krank?“ Diese Frage beantworten die Vorhersagewerte. Sie werden zeilenweise berechnet, jeweils unter allen mit demselben Testergebnis.1

Positiver und negativer Vorhersagewert

Der positive Vorhersagewert (PPV) ist a/(a+b), der Anteil tatsächlich Erkrankter unter allen positiv Getesteten. Der negative Vorhersagewert (NPV) ist d/(c+d), der Anteil tatsächlich Gesunder unter allen negativ Getesteten. Im Rechenbeispiel ergibt sich ein PPV von 90/270 = 33,3 % und ein NPV von 720/730 = 98,6 %. Ein positiver Test ist hier also trotz einer Sensitivität von 90 % häufiger falsch als richtig positiv. Das ist kein Rechenfehler, sondern die Folge der niedrigen Prävalenz: Unter 900 Gesunden erzeugen 20 % Fehlalarme 180 falsch Positive, unter 100 Kranken findet der Test nur 90 richtig Positive.

1000 PersonenPrävalenz 10 %100 erkranktSensitivität 90 %900 nicht erkranktSpezifität 80 %90richtig positiv10falsch negativ180falsch positiv720richtig negativTest positiv: 90 + 180 = 270, davon 90 erkrankt: PPV = 90/270 = 33 %Test negativ: 10 + 720 = 730, davon 720 gesund: NPV = 720/730 = 98,6 %
Abbildung 1: Natürliche Häufigkeiten für das Rechenbeispiel: 1000 Personen, Prävalenz 10 %, Sensitivität 90 %, Spezifität 80 %. Rot umrandet sind die Felder mit positivem Test. Eigene Darstellung

Warum Vorhersagewerte von der Prävalenz abhängen

Bleiben Sensitivität und Spezifität gleich und sinkt die Prävalenz, sinkt der PPV und steigt der NPV. Beim Screening einer Population mit seltener Erkrankung überwiegen daher selbst bei guten Tests die falsch Positiven; bei hoher Vortestwahrscheinlichkeit, etwa auf der Intensivstation oder im Schockraum, gewinnt ein positiver Test an Aussagekraft, während ein negativer Test weniger beruhigt. Vorhersagewerte aus einer Studie gelten deshalb nur für Populationen mit ähnlicher Prävalenz. Stammt die Tafel aus einer Studie, die eine feste Zahl Kranker und Gesunder ausgewählt hat (Fall-Kontroll-Design), ist die Prävalenz künstlich und PPV sowie NPV sind nicht übertragbar.3

Mit dem folgenden Rechner lässt sich dieser Zusammenhang erkunden. Stellen Sie Sensitivität 90 % und Spezifität 80 % ein und verschieben Sie die Prävalenz von 1 % auf 50 %: Der PPV steigt von etwa 4 % auf über 80 %, der Test selbst bleibt unverändert.

Prävalenz und Vorhersagewerte

Sensitivität und Spezifität werden als feste Eigenschaften angenommen. Das ist eine Vereinfachung: In der Klinik ändern sie sich mit dem Patientenspektrum (Lektion 6). Die Werte gelten für eine Population mit der gewählten Prävalenz.

Positiver Vorhersagewert
Negativer Vorhersagewert
Von 1000 Getesteten

Natürliche Häufigkeiten

Prozentangaben bedingter Wahrscheinlichkeiten werden auch von Fachleuten häufig falsch verrechnet. Die Darstellung als natürliche Häufigkeiten, also „von 1000 Getesteten sind …“, macht den Rechenweg anschaulich und erleichtert die Aufklärung von Patienten.1 Abbildung 1 zeigt dieses Vorgehen: Erst werden die 1000 Personen nach Krankheitsstatus aufgeteilt, dann jede Gruppe nach Testergebnis. Der PPV ergibt sich, indem die richtig Positiven durch alle Positiven geteilt werden. Wer diese Rechnung einmal mit eigenen Zahlen durchgeführt hat, wird einen positiven Screeningbefund nicht mehr mit einer Diagnose verwechseln.

Woher kommt die Vortestwahrscheinlichkeit?

Weil jede Deutung eines Befunds bei der Vortestwahrscheinlichkeit beginnt, lohnt es sich, sie bewusst zu schätzen, statt sie stillschweigend anzunehmen. Drei Quellen stehen zur Verfügung. Die erste ist die Häufigkeit der Erkrankung in der konkreten Versorgungssituation: Ein Pneumothorax ist nach einem Hochrasanztrauma mit Thoraxschmerz wahrscheinlicher als nach einer unkomplizierten Venenpunktion. Die zweite sind validierte klinische Scores, die Anamnese und Befunde zu einer Wahrscheinlichkeit bündeln. Die dritte ist die klinische Gesamteinschätzung erfahrener Ärzte, die oft erstaunlich gut, aber schwer zu überprüfen ist. Wo die Schätzung unsicher ist, hilft es, die Rechnung für eine niedrige und eine hohe Annahme durchzuspielen: Führt der Befund in beiden Fällen zur selben Entscheidung, ist das Ergebnis robust; führt er zu verschiedenen Entscheidungen, braucht es weitere Information. Ein häufiger Denkfehler ist, die Vortestwahrscheinlichkeit nach einem auffälligen Befund rückwirkend anzuheben und denselben Befund dann noch einmal als Bestätigung zu zählen.

Merke

Sensitivität und Spezifität beschreiben den Test in Gruppen mit bekanntem Status. Vorhersagewerte beschreiben den Patienten nach dem Test und gelten nur bei der Prävalenz, aus der sie stammen.

Übung 2.1

Übung 2.2, Rechenaufgabe

Rechenaufgabe: Ein Test hat eine Sensitivität von 95 % und eine Spezifität von 90 %. Er wird bei 1000 Personen mit einer Prävalenz von 2 % eingesetzt. Wie viele falsch Positive sind zu erwarten, und wie hoch ist der PPV?

Lektion 3

Likelihood-Ratios und Rechnen mit Odds

Likelihood-Ratios verbinden die Stabilität von Sensitivität und Spezifität mit der klinischen Frage nach dem einzelnen Patienten. Sie beschreiben, wie stark ein Befund die Wahrscheinlichkeit einer Erkrankung verschiebt, unabhängig davon, wo die Ausgangsvermutung lag.1

Definition

Die positive Likelihood-Ratio (LR+) ist das Verhältnis der Wahrscheinlichkeit eines positiven Tests bei Kranken zur Wahrscheinlichkeit eines positiven Tests bei Gesunden: Sensitivität geteilt durch (1 − Spezifität). Im Rechenbeispiel ist das 0,9/0,2 = 4,5. Ein positiver Test ist bei Kranken also 4,5-mal so wahrscheinlich wie bei Gesunden. Die negative Likelihood-Ratio (LR−) ist (1 − Sensitivität) geteilt durch Spezifität, hier 0,1/0,8 = 0,125. Eine LR von 1 verändert nichts, Werte über 1 sprechen für, Werte unter 1 gegen die Erkrankung. Weil Likelihood-Ratios aus Sensitivität und Spezifität gebildet werden, hängen sie nicht direkt von der Prävalenz ab; vom Patientenspektrum hängen sie aber ebenso ab wie diese.3

Rechnen mit Odds

Der Satz von Bayes lässt sich mit Odds besonders einfach schreiben. Odds sind das Verhältnis von Wahrscheinlichkeit zu Gegenwahrscheinlichkeit: Eine Wahrscheinlichkeit von 10 % entspricht Odds von 0,1/0,9 = 0,11. Dann gilt: Nachtestodds = Vortestodds × LR. Die Rückrechnung erfolgt mit Wahrscheinlichkeit = Odds/(1 + Odds). Für das Beispiel: Vortestodds 0,11 × 4,5 = 0,5, Nachtestwahrscheinlichkeit 0,5/1,5 = 33,3 %, also genau der PPV aus der Vierfeldertafel. Liegt die Vortestwahrscheinlichkeit dagegen bei 50 %, ergeben sich mit derselben LR+ Nachtestodds von 4,5 und eine Nachtestwahrscheinlichkeit von 81,8 %. Das Fagan-Nomogramm ist nichts anderes als eine grafische Umsetzung dieser Rechnung: Eine Linie von der Vortestwahrscheinlichkeit durch die LR führt zur Nachtestwahrscheinlichkeit.1

Von der Vortest- zur Nachtestwahrscheinlichkeit

Rechenweg nach Bayes in Odds: Nachtestodds = Vortestodds × Likelihood-Ratio. Setzt voraus, dass die Likelihood-Ratio aus einer Population mit vergleichbarem Spektrum stammt; mehrere Tests dürfen nur multipliziert werden, wenn sie bei gegebenem Krankheitsstatus unabhängig sind.

Vortestodds
Nachtestodds
Nachtestwahrscheinlichkeit

Tabelle 2: Grobe Einordnung von Likelihood-Ratios (Faustregel, Lehrbuchwissen; die tatsächliche Verschiebung hängt von der Vortestwahrscheinlichkeit ab)
LR+LR−Verschiebung der WahrscheinlichkeitBeispiel bei Vortest 30 %
über 10unter 0,1groß, oft entscheidendLR 10: 81 %; LR 0,1: 4 %
5 bis 100,1 bis 0,2mäßigLR 5: 68 %; LR 0,2: 8 %
2 bis 50,2 bis 0,5gering, aber manchmal wichtigLR 2: 46 %; LR 0,5: 18 %
1 bis 20,5 bis 1kaumLR 1: 30 %

Mehrere Tests und mehrstufige Befunde

Werden mehrere Befunde nacheinander erhoben, darf die Nachtestwahrscheinlichkeit des ersten Tests als Vortestwahrscheinlichkeit des zweiten verwendet werden, aber nur, wenn beide Tests bei gegebenem Krankheitsstatus unabhängig voneinander sind. Zwei Ultraschallzeichen, die dieselbe Physik nutzen, oder ein klinisches Zeichen und ein Score, der dieses Zeichen enthält, sind nicht unabhängig; ihr Produkt überschätzt die Sicherheit. Stetige oder mehrstufige Tests verschenken bei Dichotomisierung Information: Für verschiedene Wertebereiche lassen sich eigene Likelihood-Ratios angeben, sodass ein extrem auffälliger Befund stärker zählt als ein knapp auffälliger.1

Entscheidungsschwellen

Ein Test lohnt sich nur, wenn sein Ergebnis die Entscheidung ändern kann. Zwischen einer Schwelle, unterhalb derer auf weitere Diagnostik verzichtet wird, und einer Schwelle, oberhalb derer behandelt wird, liegt der Bereich, in dem Testen sinnvoll ist. Wo die Schwellen liegen, hängt von Nutzen und Schaden der Behandlung und von den Risiken des Tests ab. Ein Spannungspneumothorax beim instabilen Patienten liegt oft schon vor jedem Test über der Behandlungsschwelle; die Vorhersage der Volumenreagibilität bei einem Patienten mit Lungenödem dagegen verdient eine sorgfältige Testung, weil ein unnötiger Volumenbolus schadet.5

Übung 3.1

Übung 3.2, Rechenaufgabe

Rechenaufgabe: Sie schätzen die Vortestwahrscheinlichkeit auf 20 %. Der Befund hat eine LR+ von 10 und eine LR− von 0,1. Berechnen Sie die Nachtestwahrscheinlichkeit nach positivem und nach negativem Befund.

Lektion 4

Konfidenzintervalle, Nullzellen und Fallzahl

Jede Kennzahl einer diagnostischen Studie ist eine Schätzung aus einer Stichprobe. Wie genau sie ist, zeigt das Konfidenzintervall. Empfehlungen zur Berichterstattung verlangen deshalb die Vierfeldertafel (oder Zähler und Nenner), gepaart berichtete Kennzahlen und 95-%-Konfidenzintervalle.2

Konfidenzintervalle für Anteile

Sensitivität, Spezifität und Vorhersagewerte sind Anteile. Das einfache Wald-Intervall (Anteil ± 1,96 × Standardfehler) ist bei kleinen Stichproben und bei Anteilen nahe 0 oder 100 % unzuverlässig: Es kann über 100 % hinausreichen oder bei 20 von 20 eine Breite von null ergeben. Das Wilson-Intervall vermeidet diese Schwächen und hält auch bei kleinen Nennern annähernd die angegebene Überdeckung ein.6 Bei 20 von 20 richtig erkannten Kranken liegt die Sensitivität zwar bei 100 %, das Wilson-Intervall reicht aber von etwa 84 bis 100 %. Kleine Studien mit „perfekten“ Ergebnissen beweisen deshalb wenig.

Konfidenzintervalle für Likelihood-Ratios

Likelihood-Ratios sind Quotienten zweier Anteile. Ihr Konfidenzintervall wird auf der logarithmischen Skala berechnet und anschließend zurücktransformiert; es ist deshalb asymmetrisch.7 Diese Methode setzt voraus, dass die beteiligten Zellen nicht null sind. Ist b = 0 (keine falsch Positiven), wird die Spezifität 100 % und die LR+ ist nicht definiert, weil durch null geteilt würde. Manche Programme ersetzen Nullzellen durch 0,5; das ist eine Näherung, die ausdrücklich gekennzeichnet werden muss. Der folgende Rechner zeigt Nullzellen und nicht definierte Quotienten deshalb ausdrücklich an, statt stillschweigend Zahlen zu erzeugen.

Vierfeldertafel-Rechner

Geben Sie absolute Zellzahlen ein (ganze Zahlen von 0 bis 1 000 000). Konfidenzintervalle: Wilson für Anteile, logarithmische Methode für Likelihood-Ratios. Die Vorhersagewerte gelten nur für die Prävalenz dieser Tafel; stammt sie aus einer Fall-Kontroll-Auswahl, sind PPV und NPV nicht auf die Klinik übertragbar.

Beispiele
Sensitivität a/(a+c)
Spezifität d/(b+d)
PPV a/(a+b)
NPV d/(c+d)
LR+ Sens/(1 − Spez)
LR− (1 − Sens)/Spez
Prävalenz in der Tafel

Wie groß muss eine diagnostische Studie sein?

Die Fallzahl richtet sich nach der gewünschten Genauigkeit der wichtigsten Kennzahl. Für eine Sensitivität von erwartet 90 % mit einem Konfidenzintervall von etwa ± 5 Prozentpunkten braucht es nach der Normalapproximation 1,96² × 0,9 × 0,1 / 0,05² ≈ 139 Erkrankte. Liegt die Prävalenz in der Studienpopulation bei 10 %, müssen dafür rund 1390 Personen konsekutiv eingeschlossen werden. Diagnostische Studien mit wenigen Dutzend Patienten liefern entsprechend breite Intervalle, auch wenn Punktschätzungen eindrucksvoll aussehen.1 Eine einzelne Vierfeldertafel beschreibt zudem nur eine Schwelle; eine vollständige ROC-Kurve lässt sich aus ihr nicht ableiten (Lektion 5).

Vorsicht bei Nullzellen

Eine Spezifität von 100 % in einer kleinen Studie bedeutet nicht, dass der Test nie falsch positiv ist. Sie bedeutet, dass in dieser Stichprobe kein falsch positiver Befund auftrat. Die Obergrenze der LR+ ist dann nicht bestimmbar, und das Wilson-Intervall der Spezifität zeigt, wie viel Unsicherheit bleibt.

Übung 4.1

Übung 4.2, Rechenaufgabe

Rechenaufgabe: Ein Ultraschallbefund hat eine Sensitivität von 0,91 und eine Spezifität von 0,99. Berechnen Sie LR+ und LR−.

Lektion 5

Stetige Tests: ROC-Kurve, Schwellen und Kalibrierung

Viele Tests in der Anästhesie liefern stetige Werte: die Pulsdruckvariation, die Zunahme des Herzzeitvolumens beim passiven Anheben der Beine, ein Laktatwert, ein Risikoscore. Aus einem stetigen Wert wird erst durch eine Schwelle ein positiver oder negativer Befund, und jede Schwelle hat ihre eigene Vierfeldertafel.3

ROC-Kurve und AUC

Die ROC-Kurve (receiver operating characteristic) trägt für alle möglichen Schwellen die Sensitivität gegen 1 − Spezifität auf. Ein nutzloser Test liegt auf der Diagonalen, ein perfekter Test läuft durch die linke obere Ecke. Die Fläche unter der Kurve (AUC) fasst die Trennschärfe zusammen: Sie entspricht der Wahrscheinlichkeit, dass ein zufällig gewählter Kranker einen auffälligeren Wert hat als ein zufällig gewählter Gesunder. Eine AUC von 0,5 bedeutet Zufall, 1,0 perfekte Trennung.1

0,00,00,50,51,01,01 − Spezifität (Anteil falsch Positiver)SensitivitätAA streng: Spezifität 0,95, Sensitivität 0,43BB mittel: Spezifität 0,80, Sensitivität 0,74CC großzügig: Spezifität 0,50, Sensitivität 0,93Blaue Kurve: stetiger Test, AUC 0,85Gestrichelt: Zufall, AUC 0,5Jede Schwelle ist ein Punkt;eine einzelne Vierfeldertafelliefert nur einen Punkt.
Abbildung 2: ROC-Kurve eines stetigen Tests (binormales Modell) mit drei Schwellen. A: hohe Spezifität, geringe Sensitivität; C: umgekehrt. Eigene Darstellung

Die AUC hat drei Grenzen, die in Prüfungen und im Alltag gleichermaßen wichtig sind. Erstens beschreibt sie den Test über alle Schwellen, auch über solche, die klinisch niemand verwenden würde. Zweitens sagt sie nichts über die Kalibrierung, also darüber, ob vorhergesagte Wahrscheinlichkeiten mit den beobachteten Häufigkeiten übereinstimmen. Drittens sagt sie nichts über den klinischen Nutzen, der von den Konsequenzen falsch positiver und falsch negativer Entscheidungen abhängt.8

Schwellenwahl und Grauzone

Die „optimale“ Schwelle hängt davon ab, welcher Fehler schwerer wiegt. Der Youden-Index (Sensitivität + Spezifität − 1) wählt die Schwelle, an der beide Fehler gleich gewichtet sind; das ist selten die klinisch beste Wahl. Wird die Schwelle in denselben Daten optimiert, in denen die Testgüte berichtet wird, fällt diese zu optimistisch aus. Ein ehrlicheres Vorgehen für die Klinik ist die Grauzone: ein Bereich zwischen einer Schwelle mit hoher Sensitivität und einer mit hoher Spezifität, in dem der Test keine sichere Aussage erlaubt.9 In einer Studie mit 413 beatmeten Patienten in Allgemeinanästhesie hatte die Pulsdruckvariation eine AUC von 0,89 (95-%-KI 0,86 bis 0,92), der zentrale Venendruck nur 0,57. Zwischen 9 und 13 % war die Pulsdruckvariation jedoch nicht schlüssig, und in diesem Bereich lagen 24 % der Patienten.9 Eine hohe AUC schützt also nicht davor, dass der Test bei jedem vierten Patienten keine verwertbare Antwort liefert. Die Voraussetzungen der Pulsdruckvariation behandelt die Einheit Perioperative Hypotonie.

Der Referenzstandard und die Messgröße des Tests

Wie gut ein Test abschneidet, hängt auch davon ab, woran seine Wirkung gemessen wird. In einer Metaanalyse zum passiven Anheben der Beine (21 Studien, 991 Patienten) erreichte der Test eine AUC von 0,95, wenn seine Wirkung am Herzzeitvolumen gemessen wurde (Schwelle etwa 10 % Anstieg). Wurde dagegen nur der Pulsdruck betrachtet, lagen die gepoolte Sensitivität bei 0,56, die Spezifität bei 0,83 und die AUC bei 0,77.10 Daraus ergibt sich für den Pulsdruck eine LR+ von etwa 0,56/0,17 = 3,3 und eine LR− von etwa 0,44/0,83 = 0,53: Ein unauffälliger Pulsdruck schließt eine Volumenreagibilität praktisch nicht aus. Neuere Übersichten bestätigen den Stellenwert des passiven Beinhebens mit Messung des Herzzeitvolumens oder eines seiner Surrogate.5

Kalibrierung von Vorhersagemodellen

Viele moderne „Tests“ sind Vorhersagemodelle, die eine Wahrscheinlichkeit ausgeben, etwa für postoperative Komplikationen oder für Hypotonie. Für sie reicht die AUC nicht. Ein Modell kann Patienten gut sortieren und trotzdem alle Risiken systematisch überschätzen, etwa wenn es in einer Population mit anderer Ereignisrate eingesetzt wird. Die Kalibrierung wird mit einem Kalibrierungsdiagramm (vorhergesagt gegen beobachtet), der Kalibrierungssteigung und dem Verhältnis erwarteter zu beobachteter Ereignisse beschrieben; eine externe Validierung in der Zielpopulation ist vor dem Einsatz nötig.8 Der aktualisierte Berichtsstandard TRIPOD+AI gilt für Vorhersagemodelle mit Regression oder maschinellem Lernen und verlangt unter anderem die Angabe von Diskrimination und Kalibrierung.11

Selbst ein gut diskriminierendes und gut kalibriertes Modell ist erst dann nützlich, wenn seine Vorhersagen Entscheidungen verbessern. Ob das der Fall ist, hängt davon ab, bei welcher Wahrscheinlichkeit gehandelt wird und wie Nutzen und Schaden einer Handlung gewichtet werden. Verfahren der Entscheidungskurvenanalyse vergleichen dafür den Nettonutzen eines Modells mit den Strategien „alle behandeln“ und „niemanden behandeln“ über einen Bereich plausibler Handlungsschwellen (Lehrbuchwissen). Für Alarmsysteme im Operationssaal kommt eine praktische Größe hinzu: die Zahl der Fehlalarme je Stunde, die über die Akzeptanz im Alltag entscheidet.

Übung 5.1

Lektion 6

Verzerrungen, Berichtsstandards und klinische Beispiele

Sensitivität und Spezifität werden oft als feste Eigenschaften eines Tests beschrieben. Tatsächlich hängen sie davon ab, an wem und wie ein Test geprüft wurde. Viele diagnostische Studien überschätzen die Testgüte, weil ihr Design systematische Fehler begünstigt.12

Spektrumeffekt und Spektrumbias

Ein Test erkennt ausgeprägte Befunde leichter als diskrete. Wird ein Ultraschallzeichen an Patienten mit großem Pneumothorax und an gesunden Freiwilligen geprüft, wirkt es nahezu perfekt; bei kleinen, ventral gelegenen Pneumothoraces und bei Patienten mit Lungenerkrankungen, die ähnliche Artefakte erzeugen, sinkt die Genauigkeit. Diese Abhängigkeit vom Patientenspektrum betrifft Sensitivität, Spezifität und Likelihood-Ratios. Studien mit Fall-Kontroll-Auswahl, also schweren Fällen gegen klar Gesunde, überschätzen die Testgüte deutlich. Aussagekräftig sind Studien, die konsekutiv Patienten einschließen, bei denen die Diagnose tatsächlich unklar ist, wie in der späteren Anwendung.12

Verifikations-, Inkorporations- und Beurteilungsbias

Erhält nur ein Teil der Patienten den Referenzstandard, und hängt die Auswahl vom Ergebnis des Indextests ab, entsteht ein Verifikationsbias: Werden etwa nur Patienten mit positivem Ultraschall computertomographisch untersucht, fehlen die falsch Negativen, und die Sensitivität wird überschätzt. Erhalten Patienten je nach Testergebnis verschiedene Referenzstandards (differenzielle Verifikation), verzerrt das die Tafel ebenfalls. Ist der Indextest Teil des Referenzstandards, etwa wenn ein Score die Diagnose mitbestimmt, die er vorhersagen soll, liegt ein Inkorporationsbias vor. Und wer den Referenzstandard in Kenntnis des Indextests beurteilt oder umgekehrt, erzeugt einen Beurteilungsbias. Schließlich ist der Referenzstandard selbst selten perfekt; ein neuer Test, der besser ist als die Referenz, erscheint dann paradoxerweise schlechter.13

Tabelle 3: Systematische Fehler diagnostischer Studien
FehlerEntstehungWirkungWorauf achten
Spektrumbiasschwere Fälle gegen klar GesundeSensitivität und Spezifität überschätztkonsekutiver Einschluss, klinisch unklare Fälle
Partielle VerifikationReferenz nur bei positivem IndextestSensitivität überschätzt, Spezifität unterschätztReferenz für alle oder statistische Korrektur
Differenzielle Verifikationverschiedene Referenzen je nach ErgebnisRichtung schwer vorhersagbarein einheitlicher Referenzstandard
InkorporationsbiasIndextest ist Teil der ReferenzTestgüte überschätztunabhängige Referenz
BeurteilungsbiasAuswertung in Kenntnis des anderen ErgebnissesÜbereinstimmung überschätztverblindete Befundung
Schwelle aus denselben DatenSchwelle nachträglich optimiertTestgüte zu optimistischvorab festgelegte Schwelle, externe Validierung

Berichtsstandards und Bewertungswerkzeuge

STARD 2015 ist der Berichtsstandard für Studien zur diagnostischen Genauigkeit; er verlangt unter anderem ein Flussdiagramm der Teilnehmer, die Beschreibung von Indextest und Referenzstandard, Angaben zur Verblindung und die Vierfeldertafel.14 Für Studien mit Verfahren der künstlichen Intelligenz wurde 2025 STARD-AI veröffentlicht: 40 Punkte, darunter 18 neue oder veränderte, mit Anforderungen etwa an Datensätze, algorithmischen Bias und Fairness.15 Für die Qualitätsbewertung in systematischen Übersichten wurde QUADAS-2 2026 durch QUADAS-3 abgelöst. Neu ist unter anderem, dass Risiko für Bias und Übertragbarkeit für einzelne Schätzungen statt für ganze Studien beurteilt werden und dass die Bewertung von einer vorab formulierten Fragestellung der Übersicht ausgeht.13

Beispiele aus Anästhesie und Intensivmedizin

Beim Thoraxtrauma zeigt eine Cochrane-Übersicht, wie stark die Wahl des Tests die Vorhersagewerte bestimmt (siehe Kasten). Die Liegendaufnahme des Thorax übersieht bei der Rückenlage viele Pneumothoraces, weil sich die Luft ventral sammelt; ihr negatives Ergebnis hat eine LR− von etwa 0,53 und verändert die Wahrscheinlichkeit kaum. Der Ultraschall durch nicht radiologische Ärzte in der Notaufnahme erreicht eine deutlich höhere Sensitivität bei ähnlich hoher Spezifität.16 Die meisten eingeschlossenen Studien hatten allerdings ein hohes oder unklares Risiko für Bias, vor allem bei der Patientenauswahl, und die Sensitivität schwankte erheblich zwischen den Studien. Auch hier gilt: Die Zahlen beschreiben Untersucher in Studien an einem Traumakollektiv, nicht jeden Anwender in jeder Situation.

Aktuelle Evidenz

Pneumothorax beim Trauma (Cochrane-Übersicht, 9 Studien mit 1271 Patienten in der Hauptanalyse): Ultraschall Sensitivität 0,91 (95-%-KI 0,85 bis 0,94), Spezifität 0,99 (0,97 bis 1,00); Liegendaufnahme Sensitivität 0,47 (0,31 bis 0,63), Spezifität 1,00. Bei einer angenommenen Prävalenz von 30 % übersieht der Ultraschall von 100 Patienten 3, das Röntgen 16.16

Passives Anheben der Beine (21 Studien, 991 Patienten): AUC 0,95 bei Messung des Herzzeitvolumens, AUC 0,77 bei Messung nur des Pulsdrucks.10

Pulsdruckvariation in Allgemeinanästhesie (413 Patienten): AUC 0,89; Grauzone 9 bis 13 % bei 24 % der Patienten.9

Ösophageale Intubation: anhaltendes ausgeatmetes CO2 in der Kurvenkapnographie ist die primäre Methode der Lagekontrolle; ohne anhaltendes CO2 wird der Tubus im Regelfall entfernt.4

Typische Fehlannahmen
  • „Eine hohe Sensitivität bedeutet, dass ein positiver Test die Krankheit beweist.“ Das ist die Aufgabe des PPV, und der hängt von der Prävalenz ab.
  • „Sensitivität und Spezifität sind feste Eigenschaften eines Tests.“ Sie variieren mit dem Patientenspektrum und der Schwelle.
  • „Eine AUC von 0,9 heißt, der Test liegt in 90 % richtig.“ Die AUC ist eine Rangwahrscheinlichkeit über alle Schwellen, keine Trefferquote.
  • „Zwei positive Befunde verdoppeln die Sicherheit.“ Likelihood-Ratios dürfen nur bei bedingt unabhängigen Tests multipliziert werden.
  • „100 % Spezifität in 30 Patienten heißt: nie falsch positiv.“ Das Konfidenzintervall ist breit, die LR+ nicht definiert.

Übung 6.1

Lektion 7

Fälle, Merksätze und Aufgaben

Fall 1: Thoraxtrauma im Schockraum

Ein 46-jähriger Mann stürzt aus etwa 4 m Höhe von einem Gerüst auf die rechte Thoraxseite. Im Schockraum atmet er spontan, Atemfrequenz 30/min, SpO2 90 % unter 15 l/min Sauerstoff über Maske mit Reservoir, Herzfrequenz 118/min, Blutdruck 100/65 mmHg. Das Atemgeräusch rechts ist abgeschwächt, die Auskultation im Lärm unsicher. Die Liegendaufnahme des Thorax zeigt Rippenfrakturen rechts, aber keinen sicheren Pneumothorax. Sie schätzen die Wahrscheinlichkeit eines Pneumothorax vor dem Röntgen auf etwa 40 %. Im anschließenden Lungenultraschall fehlt rechts ventral das Pleuragleiten, lateral ist ein Lungenpunkt darstellbar. Eine Intubation zur Operation der Begleitverletzungen ist geplant.

Fall 1, Frage 1

Fall 1, Frage 2

Fall 1, Frage 3

Merksätze

  • Sensitivität und Spezifität spaltenweise, Vorhersagewerte zeilenweise berechnen.
  • Der PPV sinkt mit der Prävalenz; bei seltenen Erkrankungen überwiegen die falsch Positiven.1
  • Nachtestodds = Vortestodds × Likelihood-Ratio; Wahrscheinlichkeit = Odds/(1 + Odds).
  • LR+ über 10 und LR− unter 0,1 verschieben die Wahrscheinlichkeit stark (Faustregel).
  • Kennzahlen immer mit Vierfeldertafel und 95-%-Konfidenzintervall berichten; für Anteile Wilson.2, 6
  • Die AUC misst Diskrimination, nicht Kalibrierung und nicht Nutzen.8
  • Konsekutiver Einschluss klinisch unklarer Patienten schützt vor Spektrumbias.12
  • Kein anhaltendes CO2 in der Kurvenkapnographie: Der Tubus liegt bis zum Beweis des Gegenteils im Ösophagus.4

Aufgaben

Aufgabe 1: Vierfeldertafel vollständig auswerten

Gegeben:
Eine Studie prüft die Pulsdruckvariation mit Schwelle 13 % an 200 beatmeten Patienten: 70 von 100 Volumenreagiblen und 12 von 100 Nichtreagiblen haben eine Pulsdruckvariation über 13 % (eigenes Rechenbeispiel).

Frage:
Berechnen Sie Sensitivität, Spezifität, PPV, NPV, LR+ und LR− und ordnen Sie das Ergebnis ein.

Lösung

Tafel: a = 70, b = 12, c = 30, d = 88. Sensitivität 70/100 = 70 %, Spezifität 88/100 = 88 %, PPV 70/82 = 85,4 %, NPV 88/118 = 74,6 %, LR+ 0,70/0,12 = 5,8, LR− 0,30/0,88 = 0,34. Ein Wert über 13 % erhöht die Wahrscheinlichkeit mäßig, ein Wert darunter schließt Volumenreagibilität nicht aus. PPV und NPV gelten nur für die Prävalenz von 50 % dieser Stichprobe. Werte knapp unter der Schwelle liegen in der Grauzone, in der die Pulsdruckvariation keine sichere Aussage erlaubt.9

Aufgabe 2: Prävalenz verändert den Befund

Gegeben:
Ein Test mit Sensitivität 90 % und Spezifität 80 % wird einmal bei Patienten mit einer Vortestwahrscheinlichkeit von 10 % und einmal bei Patienten mit 50 % eingesetzt.

Frage:
Wie hoch ist die Nachtestwahrscheinlichkeit nach positivem Befund jeweils, und was folgt daraus?

Lösung

LR+ = 0,9/0,2 = 4,5. Bei 10 %: Odds 0,111 × 4,5 = 0,5, Wahrscheinlichkeit 33,3 %. Bei 50 %: Odds 1 × 4,5 = 4,5, Wahrscheinlichkeit 81,8 %. Derselbe Befund bedeutet in der einen Gruppe „eher gesund“, in der anderen „eher krank“. Ein Test ersetzt nie die Einschätzung der Vortestwahrscheinlichkeit; Vorhersagewerte aus Studien gelten nur bei ähnlicher Prävalenz.1

Aufgabe 3: Nullzelle im Abstract

Gegeben:
Ein Abstract berichtet: „Die neue Methode erreichte bei 25 Patienten mit und 40 Patienten ohne Erkrankung eine Spezifität von 100 % und eine Sensitivität von 88 %.“

Frage:
Welche Informationen fehlen, was können Sie selbst berechnen, und wie ordnen Sie die Aussage ein?

Lösung

Tafel: a = 22, c = 3, b = 0, d = 40. Sensitivität 22/25 = 88 %, Wilson-Intervall etwa 70 bis 96 %; Spezifität 40/40 = 100 %, Wilson-Intervall etwa 91 bis 100 %. Die LR+ ist wegen b = 0 nicht definiert; eine Angabe wie „LR+ unendlich“ wäre irreführend. Die LR− beträgt 0,12/1,0 = 0,12 mit einem breiten Intervall. Es fehlen Konfidenzintervalle, die Art der Patientenauswahl (konsekutiv oder Fall-Kontroll) und der Referenzstandard; STARD verlangt diese Angaben.14, 6, 2

Aufgabe 4: Studie zu einem KI-Vorhersagemodell bewerten

Gegeben:
Ein Hersteller wirbt mit einem Algorithmus, der intraoperative Hypotonie mit einer AUC von 0,92 vorhersagt. Die Daten stammen aus einer Klinik, die Schwelle wurde in denselben Daten optimiert, Angaben zur Kalibrierung fehlen.

Frage:
Welche Fragen stellen Sie vor dem Einsatz?

Lösung

Wurde das Modell extern in einer vergleichbaren Population validiert? Wie gut ist die Kalibrierung (Kalibrierungsdiagramm, Verhältnis erwarteter zu beobachteter Ereignisse)? Wie viele falsch positive Alarme entstehen je Stunde bei der gewählten Schwelle, und wie groß ist die Vortestwahrscheinlichkeit in der eigenen Population? Wie wurde die Schwelle festgelegt, und wurde die Testgüte in unabhängigen Daten bestätigt? Welche Angaben nach TRIPOD+AI oder STARD-AI fehlen?11, 8, 15 Eine hohe AUC in den Entwicklungsdaten beweist weder Übertragbarkeit noch Nutzen.

Aufgabenblock abschließen

Markieren Sie den Block als bearbeitet, wenn Sie alle Aufgaben gelöst und mit den Lösungen verglichen haben.

Abschlussquiz, etwa 10 Minuten

Abschlussquiz

Zehn Fragen. Bestanden ab 80 %.

Zum Nachschlagen

Begriffe und Literatur

BegriffBedeutung
SensitivitätAnteil positiver Tests unter den Erkrankten, a/(a+c)
SpezifitätAnteil negativer Tests unter den Nichterkrankten, d/(b+d)
Positiver VorhersagewertAnteil Erkrankter unter den positiv Getesteten, a/(a+b); prävalenzabhängig
Negativer VorhersagewertAnteil Gesunder unter den negativ Getesteten, d/(c+d); prävalenzabhängig
Likelihood-RatioVerhältnis der Wahrscheinlichkeit eines Befunds bei Kranken zu der bei Gesunden
OddsWahrscheinlichkeit geteilt durch Gegenwahrscheinlichkeit
ROC-Kurve und AUCSensitivität gegen 1 − Spezifität über alle Schwellen; Fläche als Maß der Diskrimination
KalibrierungÜbereinstimmung vorhergesagter und beobachteter Risiken
SpektrumbiasVerzerrung der Testgüte durch eine nicht repräsentative Auswahl von Kranken und Gesunden
VerifikationsbiasVerzerrung, wenn der Referenzstandard nicht bei allen oder nicht einheitlich angewendet wird

Literatur

  1. Schlattmann P. Statistics in diagnostic medicine. Clin Chem Lab Med. 2022;60(6):801-807. doi:10.1515/cclm-2022-0225
  2. Vrbin CM. Recommendations for reporting measures of diagnostic accuracy. Cytopathology. 2023;34(3):185-190. doi:10.1111/cyt.13208
  3. Schober P, Mascha EJ, Vetter TR. Statistics from A (agreement) to Z (z score): a guide to interpreting common measures of association, agreement, diagnostic accuracy, effect size, heterogeneity, and reliability in medical research. Anesth Analg. 2021;133(6):1633-1641. doi:10.1213/ANE.0000000000005773
  4. Chrimes N, Higgs A, Hagberg CA, Baker PA, Cooper RM et al. Preventing unrecognised oesophageal intubation: a consensus guideline from the Project for Universal Management of Airways and international airway societies. Anaesthesia. 2022;77(12):1395-1415. doi:10.1111/anae.15817
  5. Monnet X, Shi R, Teboul JL. Prediction of fluid responsiveness. What’s new? Ann Intensive Care. 2022;12(1):46. doi:10.1186/s13613-022-01022-8
  6. Newcombe RG. Two-sided confidence intervals for the single proportion: comparison of seven methods. Stat Med. 1998;17(8):857-872. doi:10.1002/(SICI)1097-0258(19980430)17:8<857::AID-SIM777>3.0.CO;2-E (Grundlagenarbeit)
  7. Simel DL, Samsa GP, Matchar DB. Likelihood ratios with confidence: sample size estimation for diagnostic test studies. J Clin Epidemiol. 1991;44(8):763-770. doi:10.1016/0895-4356(91)90128-V (Grundlagenarbeit)
  8. Collins GS, Dhiman P, Ma J, Schlussel MM, Archer L et al. Evaluation of clinical prediction models (part 1): from development to external validation. BMJ. 2024;384:e074819. doi:10.1136/bmj-2023-074819
  9. Cannesson M, Le Manach Y, Hofer CK, Goarin JP, Lehot JJ et al. Assessing the diagnostic accuracy of pulse pressure variations for the prediction of fluid responsiveness: a „gray zone“ approach. Anesthesiology. 2011;115(2):231-241. doi:10.1097/ALN.0b013e318225b80a (Grundlagenarbeit)
  10. Monnet X, Marik PE, Teboul JL. Passive leg raising for predicting fluid responsiveness: a systematic review and meta-analysis. Intensive Care Med. 2016;42(12):1935-1947. doi:10.1007/s00134-015-4134-1 (Grundlagenarbeit)
  11. Collins GS, Moons KGM, Dhiman P, Riley RD, Beam AL et al. TRIPOD+AI statement: updated guidance for reporting clinical prediction models that use regression or machine learning methods. BMJ. 2024;385:e078378. doi:10.1136/bmj-2023-078378
  12. Usher-Smith JA, Sharp SJ, Griffin SJ. The spectrum effect in tests for risk prediction, screening, and diagnosis. BMJ. 2016;353:i3139. doi:10.1136/bmj.i3139 (Grundlagenarbeit)
  13. Whiting PF, Tomlinson E, Rutjes AWS, Davenport CF, Yang B et al. QUADAS-3: a revised tool for the quality assessment of diagnostic test accuracy studies. Ann Intern Med. 2026;179(4):548-555. doi:10.7326/ANNALS-25-02104
  14. Bossuyt PM, Reitsma JB, Bruns DE, Gatsonis CA, Glasziou PP et al. STARD 2015: an updated list of essential items for reporting diagnostic accuracy studies. BMJ. 2015;351:h5527. doi:10.1136/bmj.h5527 (Grundlage, gültiger Berichtsstandard)
  15. Sounderajah V, Guni A, Liu X, Collins GS, Karthikesalingam A et al. The STARD-AI reporting guideline for diagnostic accuracy studies using artificial intelligence. Nat Med. 2025;31(10):3283-3289. doi:10.1038/s41591-025-03953-8
  16. Chan KK, Joo DA, McRae AD, Takwoingi Y, Premji ZA, Lang E, Wakai A. Chest ultrasonography versus supine chest radiography for diagnosis of pneumothorax in trauma patients in the emergency department. Cochrane Database Syst Rev. 2020;CD013031. doi:10.1002/14651858.CD013031.pub2

Standardwerke

  • Straus SE, Glasziou P, Richardson WS, Haynes RB. Evidence-Based Medicine: How to Practice and Teach EBM. 5. Aufl. Elsevier; 2019
  • Altman DG. Practical Statistics for Medical Research. Chapman and Hall; 1991
  • Weiß C. Basiswissen Medizinische Statistik. 7. Aufl. Springer; 2019

© 2026 Ulrich Frey. Alle Rechte vorbehalten. Neufassung für das E-Learning, Recherchestand September 2026. Die Inhalte dienen der Aus- und Weiterbildung und ersetzen keine Leitlinie, keine Fachinformation und keine lokalen Standards.