Ein diagnostischer Test ist jede Information, die die Wahrscheinlichkeit einer Diagnose verändert: ein Laborwert, ein Ultraschallbefund, eine Kapnographiekurve, ein klinisches Zeichen, ein Score. In der Anästhesie und Intensivmedizin werden solche Tests oft unter Zeitdruck gedeutet, und ihre Fehler haben unmittelbare Folgen: ein übersehener Pneumothorax, eine unerkannte ösophageale Intubation, ein Volumenbolus bei einem Patienten, der nicht davon profitiert. Wer die Logik der Testgüte beherrscht, kann Befunde gewichten, statt sie nur als „positiv“ oder „negativ“ abzuhaken.1
Die Vierfeldertafel
Grundlage ist der Vergleich des zu prüfenden Tests (Indextest) mit einem Referenzstandard, der den tatsächlichen Krankheitsstatus möglichst sicher festlegt, etwa die Computertomographie beim Pneumothorax oder die gemessene Zunahme des Schlagvolumens nach einem Volumenbolus bei der Volumenreagibilität. Jede Person fällt in eines von vier Feldern: richtig positiv (a), falsch positiv (b), falsch negativ (c) oder richtig negativ (d). Alle Kennzahlen lassen sich aus diesen vier Zahlen berechnen, weshalb Berichte diagnostischer Studien die Tafel oder zumindest Zähler und Nenner jeder Kennzahl angeben sollten.2
| Erkrankt (Referenz positiv) | Nicht erkrankt (Referenz negativ) | Summe | |
|---|---|---|---|
| Test positiv | a = 90 (richtig positiv) | b = 180 (falsch positiv) | 270 |
| Test negativ | c = 10 (falsch negativ) | d = 720 (richtig negativ) | 730 |
| Summe | 100 | 900 | 1000 |
Sensitivität und Spezifität
Die Sensitivität ist der Anteil positiver Tests unter den Erkrankten, also a/(a+c), im Beispiel 90/100 = 90 %. Sie beantwortet die Frage: Wie zuverlässig findet der Test die Kranken? Die Spezifität ist der Anteil negativer Tests unter den Nichterkrankten, also d/(b+d), im Beispiel 720/900 = 80 %. Sie beantwortet die Frage: Wie zuverlässig spricht der Test bei Gesunden nicht an? Beide Größen werden spaltenweise berechnet, jeweils innerhalb einer Gruppe mit bekanntem Krankheitsstatus. Genau deshalb helfen sie am Krankenbett nur indirekt: Dort ist der Krankheitsstatus unbekannt, bekannt ist nur das Testergebnis.3
Sensitivität und Spezifität stehen in einem Spannungsverhältnis. Bei stetigen Tests verschiebt die Wahl der Schwelle beide in entgegengesetzte Richtungen: Eine niedrige Schwelle findet mehr Kranke und erzeugt mehr Fehlalarme, eine hohe Schwelle umgekehrt. Deshalb werden beide Werte immer gemeinsam berichtet; eine Sensitivität ohne Spezifität ist nicht zu bewerten.2 Die verbreiteten Merkhilfen „SnNout“ (bei sehr hoher Sensitivität schließt ein negativer Test aus) und „SpPin“ (bei sehr hoher Spezifität bestätigt ein positiver Test) sind nur Näherungen; ob ein Befund tatsächlich ein- oder ausschließt, hängt zusätzlich von der jeweils anderen Kennzahl und von der Vortestwahrscheinlichkeit ab (Lektion 3).
Ein Beispiel aus dem Atemwegsmanagement
Die Kapnographie ist der wichtigste Test auf die tracheale Tubuslage. Eine internationale Konsensusleitlinie legt fest, dass anhaltend ausgeatmetes CO2 in der Kurvenkapnographie die primäre Methode zur Bestätigung der trachealen Intubation ist und dass der Tubus im Regelfall zu entfernen ist, wenn kein anhaltendes CO2 nachweisbar ist. Ist das Entfernen im Einzelfall gefährlicher, muss eine ösophageale Lage dringend mit anderen, verlässlichen Verfahren ausgeschlossen werden.4 Testtheoretisch ist das eine Entscheidung zugunsten der Sensitivität für die ösophageale Lage: Ein fehlendes Signal wird als ösophageal behandelt, auch wenn einzelne Fälle mit sehr niedrigem Lungenblutfluss falsch positiv erscheinen, denn ein übersehener ösophagealer Tubus ist tödlich, ein unnötiger Tubuswechsel dagegen in der Regel beherrschbar. Die Forderung nach „anhaltendem“ CO2 über mehrere Atemzüge verbessert zugleich die Spezifität gegenüber kurzen Signalen, die nicht aus der Lunge stammen. Das Beispiel zeigt: Welche Fehlerart schwerer wiegt, bestimmt, wie ein Befund gedeutet wird. Das Vorgehen selbst vertieft die Einheit Atemwegsmanagement.