Weiterbildung, Wissen und Werkzeuge · Stufe PJ

Generative KI in der Anästhesiologie: Evidenz, Anwendungen, Grenzen

Sprachmodelle sind im Klinikalltag angekommen, oft schneller als die Regeln für ihren Einsatz. Diese Einheit vermittelt, was sie können, was belegt ist und wo die Verantwortung bleibt.

Neufassung für das E-Learning aus einer Evidenzübersicht des Autors zu generativer KI in der Anästhesiologie und einer aktuellen Übersichtsarbeit, ergänzt um Recherche zu randomisierten Studien und zum europäischen Rechtsrahmen (Stand September 2026). Alle Aussagen sind an den Originalpublikationen belegt; Abbildungen sind eigene Schemata.
Lernziele
  • Die Funktionsweise eines Sprachmodells mit Token, Gewichten und Wahrscheinlichkeiten in eigenen Worten erklären.
  • Große und kleine Modelle, Cloud-Betrieb und lokalen Betrieb nach Nutzen und Risiken unterscheiden.
  • Formen der Halluzination erkennen und Gegenmaßnahmen einschließlich RAG und menschlicher Prüfung einordnen.
  • Die Studienlage zu Dokumentation, SOP-Assistenz und Datenextraktion nach Endpunkten bewerten.
  • Patienteninformation, Patientenfragen und Lehre mit KI kritisch beurteilen.
  • Regeln für den Einsatz von KI in Forschung und Publikation anwenden.
  • Die Fristen der KI-Verordnung, den Datenschutz und die Sicherheitsprinzipien bei der Einführung in einer Klinik benennen.

Zu dieser Lerneinheit

  1. Sechs Lektionen mit fünf Tabellen, zwei eigenen Schemata, einer Rechenaufgabe, zwei Fällen, Aufgabenblock, Abschlussquiz und Nachschlagen.
  2. Ergänzt KI in der Nadelführung und Up to date bleiben.

Lektion 1

Begriffe und Funktionsweise generativer KI

Generative künstliche Intelligenz bezeichnet Verfahren, die nicht nur Daten einordnen, sondern neue Inhalte erzeugen: Text, Bilder, Audio oder Programmcode. Für die Klinik sind vor allem große Sprachmodelle relevant, im Englischen Large Language Models. Sie stecken hinter den bekannten Chatprogrammen und zunehmend hinter Funktionen, die in Praxis- und Kliniksoftware eingebaut werden. Wer diese Werkzeuge beurteilen will, braucht ein Grundverständnis ihrer Funktionsweise. Ohne dieses Verständnis bleibt die Entscheidung über Einsatz und Grenzen den Herstellern und der IT überlassen, obwohl die klinische Verantwortung bei den Ärztinnen und Ärzten liegt.

Wie ein Sprachmodell Text erzeugt

Ein Sprachmodell zerlegt Text in kleine Einheiten, sogenannte Token, die ganzen Wörtern oder Wortteilen entsprechen. Jedes Token wird als Zahlenvektor in einem vieldimensionalen Raum dargestellt. Diese Darstellung ist kontextabhängig: Das Wort Block trägt in einem anästhesiologischen Text eine andere Bedeutung als in einem Text über Stadtplanung. Beim Training lernt das Modell an sehr großen Textsammlungen, welche Tokenfolgen wahrscheinlich sind, und speichert dieses Wissen in Milliarden von Gewichten. Bei der Anwendung erzeugt es seine Antwort Token für Token, indem es jeweils ein wahrscheinliches nächstes Token auswählt.

Daraus folgt die wichtigste Eigenschaft für die Klinik: Ein Sprachmodell erzeugt plausible Sprache, nicht geprüftes Wissen. Auch Rechnen, logisches Schließen und räumliche Zuordnung laufen über Wahrscheinlichkeiten von Text und nicht über formale Regeln. Richtige Antworten entstehen deshalb häufig, aber nicht verlässlich, und das Modell kann einer falschen Antwort dieselbe sprachliche Sicherheit geben wie einer richtigen.

Zwei Architekturen: großes Sprachmodell in der Cloud und kleines Modell in der KlinikGroßes Sprachmodell (LLM)Rechenzentrum des Anbieterssehr viele Parameter, allgemeines TrainingKlinik: Frage mit Kontextverlässt das HausnetzVorteil: hohe LeistungsfähigkeitRisiko: Datenschutz, Halluzination,Abhängigkeit vom AnbieterKleines Modell (SLM) mit RAGKuratierteWissensbasisSOP, LeitlinienLokales Modellquantisiertim HausnetzKlinik: Frage mit Kontextbleibt im HausnetzFirewall, ohne InternetverbindungVorteil: Datenhoheit, Antworten mit QuelleGrenze: kleinere Modelle halluzinieren eher;Aufbau und Pflege erfordern FachwissenRAG: retrieval augmented generation, Antworten werden an eine geprüfte Quelle gebunden. EigeneDarstellung, nicht maßstabsgetreu.
Abbildung 1: Großes Sprachmodell in der Cloud und kleines Modell mit klinikeigener Wissensbasis. Eigene Darstellung

Große und kleine Modelle

Große Sprachmodelle besitzen sehr viele Parameter und laufen in Rechenzentren der Anbieter. Jede Anfrage verlässt damit das Kliniknetz. Kleine Sprachmodelle werden aus großen Modellen abgeleitet, etwa durch Quantisierung, also die Speicherung der Gewichte mit geringerer Rechengenauigkeit. Sie laufen auf einem einzelnen leistungsfähigen Rechner und können vollständig vom Internet getrennt betrieben werden. Der Preis ist eine geringere Leistungsfähigkeit und eine höhere Neigung zu Fehlern, weil die Fehlerrate mit sinkender Modellgröße steigt. Für eng umrissene Aufgaben erreichen größere lokale Modelle jedoch eine Genauigkeit, die der kommerzieller Systeme nahekommt (Chuan und Nanda 2026).

Tabelle 1: Begriffe, die in Gesprächen mit IT und Herstellern fallen
BegriffBedeutungKlinische Relevanz
Tokenkleinste Texteinheit, die das Modell verarbeitetbestimmt, wie viel Text in eine Anfrage passt
KontextfensterMenge an Text, die das Modell gleichzeitig berücksichtigtlange Akten können abgeschnitten werden
Halluzinationsachlich falsche Ausgabe mit plausibler SpracheHauptrisiko jeder klinischen Anwendung
RAGAnbindung einer externen, geprüften WissensbasisAntworten lassen sich an Quellen binden
Prompt Engineeringgezielte Formulierung der Arbeitsanweisung an das Modelllegt Rolle, Grenzen und Verhalten bei Unsicherheit fest
FeinabstimmungNachtraining eines Modells mit Fachtextenein speziell anästhesiologisches Modell gibt es bisher nicht
AgentModell, das selbstständig mehrere Arbeitsschritte ausführtmehr Automatisierung, weniger menschliche Kontrolle
air-gappedvom Internet getrennter BetriebPatientendaten verlassen die Klinik nicht
Messfehler Box, SuchmaschineHäufig wird angenommen, ein Sprachmodell schlage Informationen nach wie eine Suchmaschine. Das trifft nur zu, wenn eine Suchfunktion oder Wissensbasis ausdrücklich angebunden ist. Ohne diese Anbindung antwortet das Modell aus dem, was es beim Training gelernt hat. Wissen nach dem Trainingsstand fehlt dann, und Quellenangaben können erfunden sein.

Übung 1.1

Übung 1.2

Übung 1.3

Lektion 2

Halluzinationen und was dagegen hilft

Halluzinationen sind kein seltener Programmfehler, sondern eine Folge der Bauweise. Training und Bewertung heutiger Modelle belohnen eine flüssige, wahrscheinliche Antwort stärker als das Eingeständnis von Unsicherheit. Ein Modell, das die Antwort nicht kennt, erzeugt deshalb oft trotzdem eine. In Fächern mit technischer Präzision wie der Anästhesiologie ist dieses Risiko besonders relevant, weil die allgemeinen Trainingstexte das Fachwissen nur ungleichmäßig abbilden.

Tabelle 2: Formen der Halluzination mit anästhesiologischen Beispielen
FormBeispiel
ErfindungVerweis auf eine Leitlinie oder Studie, die es nicht gibt
sachlicher Fehlerfalsche Indikation oder Kontraindikation eines Medikaments
falsche Zuordnungrichtige Aussage mit falscher Quelle
Widerspruchin derselben Zusammenfassung keine Allergien und eine Medikamentenallergie
ÜbergeneralisierungErgebnis einer Studie wird auf eine nicht untersuchte Gruppe übertragen
Grenzverletzungfeste Dosis ohne Berücksichtigung von Alter, Gewicht oder Nierenfunktion
KausalfehlerAssoziation aus Beobachtungsdaten wird als Ursache dargestellt
räumlicher FehlerVerwechslung von Schichten, Seiten oder Lagebeziehungen in der Anatomie
Reihenfolgefehlerfalsche Abfolge der Schritte bei einer mehrstufigen Prozedur

Was Halluzinationen verringert

Die wirksamste technische Maßnahme ist die Anbindung einer geprüften Wissensbasis. Das Modell sucht zuerst die passenden Textstellen heraus und formuliert die Antwort erst dann, gestützt auf diese Stellen. Die Wissensbasis lässt sich aktualisieren, ohne das Modell neu zu trainieren. Ergänzend wirkt eine sorgfältig formulierte Arbeitsanweisung: Sie legt eine Rolle fest, beschränkt die Antworten auf die Wissensbasis, verlangt das Eingeständnis von Unsicherheit und verbietet bestimmte Antworten ausdrücklich, etwa Dosisempfehlungen ohne Patientendaten. Mehrere unabhängige Modelle können dieselbe Frage beantworten, und nur eine übereinstimmende Antwort wird übernommen.

Tabelle 3: Strategien gegen Halluzinationen
StrategiePrinzipGrenze
Mensch prüfteine fachkundige Person kontrolliert jede klinisch relevante Ausgabeverhindert Halluzinationen nicht, fängt sie ab
geprüfte WissensbasisAntwort wird an ausgewählte Quellen gebundennur so gut wie Auswahl und Pflege der Quellen
ArbeitsanweisungRolle, Grenzen, Pflicht zur Unsicherheitsangabekann umgangen werden und ist nicht verlässlich
FeinabstimmungNachtraining mit Fachtextenaufwendig, für die Anästhesiologie bisher nicht verfügbar
Ensemblemehrere Modelle, nur übereinstimmende Antworten zählenweniger automatisch verarbeitete Fälle
KalibrierungAntwort mit Angabe der Sicherheitnoch nicht breit umgesetzt
Evidence Box, AutomatisierungsbiasWie gut ein Mensch Fehler abfängt, hängt davon ab, ob er genau hinsieht. Mit der Zeit steigt das Vertrauen in ein System, das meistens richtig liegt, und die Kontrolle wird flüchtiger. Dieser Automatisierungsbias ist aus der Anästhesie mit Monitoring und Alarmen bekannt und gilt für Sprachmodelle ebenso. Gute Systeme machen deshalb sichtbar, auf welche Quelle sich eine Antwort stützt, und geben unsichere Fälle ausdrücklich an den Menschen zurück, statt eine Antwort zu erzwingen.
Messfehler Box, neue ModelleDie Aussage, neuere Modelle halluzinierten nicht mehr, ist unzutreffend. Die Häufigkeit sinkt mit größeren Modellen und besserer Anbindung an Quellen, aber sie wird nicht null. Jede Modellversion und jedes Softwareupdate kann das Fehlerverhalten ändern. Ein System, das im letzten Jahr geprüft wurde, ist deshalb nach einem Update nicht automatisch weiterhin geprüft.

Übung 2.1

Übung 2.2

Übung 2.3

Lektion 3

Dokumentation, SOP-Assistenz und Datenextraktion

Die Studienlage zu generativer KI in der Anästhesiologie wächst schnell, ist aber noch überwiegend durch kleine Studien, einzelne Zentren und technische Endpunkte geprägt. Die folgende Übersicht ordnet die wichtigsten Arbeiten nach Anwendungsfeld. Entscheidend ist jeweils die Frage, was genau gemessen wurde: eine Arbeitszeit, eine Übereinstimmung mit einer Referenz oder ein Ergebnis für Patientinnen und Patienten.

Tabelle 4: Studien zu generativer KI in der perioperativen Medizin
AnwendungStudieDesignKernergebnisWesentliche Grenze
Dokumentation PrämedikationRahrisch 2026randomisierte Simulationsstudie, 30 AnästhesistenGespräch 18 % kürzer, 87 % weniger TastatureingabenKI-Dokumentation qualitativ schlechter als manuell
Dokumentation, reale FälleKe 2025randomisierte Crossover-Studiekeine signifikante Zeitersparnis, bessere Qualität bei komplexer Vorgeschichteeinzelnes Gesundheitssystem mit geschützter Umgebung
SOP-AssistentKe 2026 (PEACH)stiller Echtbetrieb, 35 Protokolle, 240 Durchläufe97,9 % Übereinstimmung mit Protokollen, 1 HalluzinationReferenz war das Protokoll, nicht ein Patientenergebnis
DatenextraktionMacKay 2025Validierung an 500 Befunden der transösophagealen Echokardiographiebis 99,4 % Genauigkeit bei einstimmigem Ensemblenur drei Parameter, geringere Ausbeute
Dokumentation allgemeinLukac 2025randomisierte Studie, 238 Ärztinnen und Ärzte, ambulantmoderat weniger Schreibzeit bei einem Produkt, weniger Belastungaußerhalb der Anästhesie, gelegentliche Fehler

Dokumentation: die bisher am besten belegte Anwendung

In einer randomisierten Simulationsstudie führten 30 Anästhesistinnen und Anästhesisten jeweils zwei standardisierte Prämedikationsgespräche, einmal mit einer KI-Anwendung, die das Gespräch mitschrieb und strukturierte, und einmal mit manueller Dokumentation. Mit KI war das Gespräch im Mittel um 252 Sekunden oder 18 % kürzer, die Blickfixationen auf den Bildschirm sanken um 78 %, die Tastatureingaben um 87 %, und die Arzt-Patienten-Interaktion wurde besser bewertet. Zugleich bewerteten externe Gutachter die manuell erstellte Dokumentation als besser. 60 % der Teilnehmenden bevorzugten die KI-gestützte Arbeitsweise (Rahrisch 2026). Die Konsequenz ist eindeutig: Die KI erzeugt einen Entwurf, die Ärztin oder der Arzt prüft und gibt frei.

Außerhalb der Anästhesie liegen inzwischen randomisierte Studien zu Sprachassistenten vor, die Gespräche mitschreiben und Arztbriefentwürfe erzeugen. In einer pragmatischen Studie mit 238 ambulant tätigen Ärztinnen und Ärzten aus 14 Fachgebieten sank die Schreibzeit je Notiz mit einem der beiden getesteten Produkte moderat, und Werte für Erschöpfung und Arbeitsbelastung verbesserten sich; gelegentliche Ungenauigkeiten erforderten weiterhin Aufmerksamkeit (Lukac 2025). Eine zweite randomisierte Studie untersuchte vorrangig berufliche Zufriedenheit und Erschöpfung (Afshar 2025). Für die anästhesiologische Aufklärung, das Narkoseprotokoll und die Prozedurendokumentation fehlen bisher eigene Studien.

SOP-gebundene Assistenz

Das System PEACH wurde am Singapore General Hospital mit 35 klinikeigenen perioperativen Protokollen in einer geschützten Umgebung aufgebaut. In einem stillen Echtbetrieb, in dem die Antworten die Versorgung nicht beeinflussten, stimmte die überarbeitete Version in 235 von 240 Durchläufen mit den Protokollen überein, das sind 97,9 %. Es traten eine Halluzination und zwei relevante Abweichungen auf (Ke 2026). Die Studie zeigt nicht, dass ein Sprachmodell bessere Medizin macht, sondern dass es ein begrenztes, geprüftes Regelwerk sehr konsistent auf konkrete Fragen anwenden kann. Genau darin liegt der realistische Nutzen.

Datenextraktion mit Sicherheitsschwelle

Aus Freitextbefunden der intraoperativen transösophagealen Echokardiographie extrahierten fünf lokal betriebene Modelle drei definierte Größen vor und nach dem Eingriff. Wurde nur ein einstimmiges Ergebnis aller fünf Modelle übernommen, lag die Genauigkeit präoperativ bei 99,4 %, allerdings wurden nur 81,7 % der Befunde automatisch verarbeitet. Bei einer Mehrheitsregel stieg die Ausbeute auf 99,4 %, die Fehlerrate aber auf 3,3 % (MacKay 2025). Die Studie zeigt ein Prinzip, das für jede klinische KI gilt: Ein System muss nicht jeden Fall beantworten. Unsichere Fälle gehen an einen Menschen.

Übung 3.4, Rechenaufgabe

Ein Haus möchte 1 000 Echokardiographiebefunde für ein Register strukturieren. Bei einstimmiger Regel werden 81,7 % automatisch verarbeitet, der Rest geht in die manuelle Prüfung. Bei Mehrheitsregel liegt die Fehlerrate bei 3,3 %, vereinfachend bezogen auf alle Befunde. Wie viele Befunde müssen bei einstimmiger Regel manuell geprüft werden, und wie viele fehlerhafte Einträge sind bei Mehrheitsregel zu erwarten?

Reifegrad generativer KI in der Anästhesiologie, Stand September 2026Belegt für Arbeitsabläufe•Dokumentationsentwurf in derPrämedikation•SOP-gebundene Antworten mitQuelle•Extraktion definierter Datenaus FreitextPlausibel, klinisch ungeprüft•Patienteninformation ineinfacher Sprache•Antworten auf häufigePatientenfragen•virtuelle Patienten in derLehreNicht gezeigt•Besseres Outcome durchKI-Entscheidungen•sichere unbeaufsichtigtePatientenkommunikation•Übertragbarkeit über Häuserund Spracheneng definierte Aufgabe, kontrollierte Quelle, Mensch prüftoffene Aufgabe, freie Quelle, autonome EntscheidungNach der Studienlage 2025 bis 2026; Einordnung ohne Anspruch auf Vollständigkeit. EigeneDarstellung, nicht maßstabsgetreu.
Abbildung 2: Reifegrad der Anwendungen generativer KI. Eigene Darstellung

Übung 3.1

Übung 3.2

Übung 3.3

Lektion 4

Patienteninformation, Patientenfragen, Lehre und Suche

Sprachmodelle werden für Patienteninformationen, für die Beantwortung von Patientenfragen und für die Lehre eingesetzt. In allen drei Feldern sind die Ergebnisse vielversprechend, aber stark vom Modell, von der Formulierung der Anfrage und vom Versionsstand abhängig. Außerdem messen die Studien meist die Qualität eines Textes und nicht, ob Patientinnen und Patienten tatsächlich besser verstehen oder Lernende tatsächlich besser handeln.

Patienteninformation

Ein etabliertes britisches Informationsblatt zur Kaudalanästhesie bei Kindern wurde mit Texten verglichen, die drei Sprachmodelle unter derselben Anweisung erzeugten. Die fachliche Richtigkeit, bewertet von zehn erfahrenen Kinderanästhesistinnen und Kinderanästhesisten, unterschied sich nicht signifikant. Zwei der KI-Texte waren leichter lesbar als das Original, einer schwerer (Khan 2026). Daraus folgt eine sinnvolle Arbeitsteilung: Fachlich freigegebene Inhalte können mit KI in einfache Sprache oder verschiedene Detailstufen übertragen werden. Die ungeprüfte Neuerstellung einer Aufklärung ist dagegen nicht vertretbar.

Patientenfragen

Zehn häufige Patientenfragen zu peripheren Nervenblockaden wurden vier Chatprogrammen gestellt und von 15 Fachleuten verblindet bewertet. Zwei Programme erreichten deutlich bessere Werte als die beiden anderen, bei einem Modell fanden sich eine zu pauschale Sicherheitsaussage und eine unpassende Abbildung. Die Übereinstimmung der Gutachter untereinander war allerdings mit einem Kappa-Wert von 0,01 praktisch nicht vorhanden (Tulgar 2026). Das relativiert jeden Modellvergleich erheblich, und solche Vergleiche sind ohnehin Momentaufnahmen, weil sich die Modelle laufend ändern.

Lehre und Simulation

Sprachmodelle können virtuelle Patientinnen und Patienten spielen, auf freie Anamnesefragen antworten und unmittelbar strukturierte Rückmeldung geben. In einer randomisierten Studie mit Medizinstudierenden verbesserte eine solche Simulation mit strukturierter Rückmeldung die klinische Entscheidungsfindung (Brügge 2024). Ein anderes System wurde von 84,4 % der Studierenden als zufriedenstellend bewertet, aber nur 60,4 % hielten die Antworten für ausreichend genau, und eine objektive Kompetenzmessung fand nicht statt (Liu 2026). Beschrieben sind außerdem Anwendungen für schwierige Gespräche, etwa das Überbringen schlechter Nachrichten und die offene Kommunikation nach einem Zwischenfall, sowie ein virtueller Patient für die Aufklärung zu einer interskalenären Blockade (Chuan und Nanda 2026).

Messfehler Box, GefälligkeitSprachmodelle neigen dazu, den Nutzerinnen und Nutzern zuzustimmen. In der Lehre ist diese Gefälligkeit problematisch, weil eine falsche Annahme der oder des Lernenden bestätigt statt korrigiert werden kann. Eine gute Lernanwendung wird deshalb ausdrücklich angewiesen, Fehler zu benennen, und ihre Rückmeldungen werden stichprobenartig von Lehrenden geprüft.

Medizinische Suchsysteme

Spezialisierte Suchsysteme binden ein Sprachmodell an eine Sammlung medizinischer Fachliteratur und geben Antworten mit Quellenangabe. In Vergleichen lieferten sie relevantere und besser belegte Antworten als allgemeine Chatprogramme. Ihre Grenzen liegen im eingeschränkten Zugang zu kostenpflichtiger Literatur, in wenig transparenten Such- und Bewertungsregeln und im Fehlen einer redaktionellen Synthese, wie sie eine Leitlinie leistet (Chuan und Nanda 2026). Sie eignen sich als Einstieg in eine Recherche, nicht als deren Abschluss. Zur strukturierten Literatursuche siehe Up to date bleiben.

Übung 4.1

Übung 4.2

Lektion 5

Generative KI in Forschung und Publikation

In der Forschung kann generative KI Zeit sparen: beim Sichten von Studien, bei der Planung einer statistischen Auswertung, beim Überarbeiten von Texten und als kritischer Gesprächspartner. Sie birgt aber Risiken, die die wissenschaftliche Integrität unmittelbar betreffen. Das bekannteste Beispiel ist die Übersichtsarbeit zur Regionalanästhesie, die ein älteres Modell mit erfundenen Literaturstellen verfasste. Neuere Modelle haben glaubwürdige Empfehlungen, etwa zu perioperativen neurokognitiven Störungen, erzeugt, die dem publizierten Konsens nahekamen, sie ersetzen aber keine Prüfung jeder einzelnen Quelle (Chuan und Nanda 2026).

Regeln für wissenschaftliches Arbeiten

  1. Jede Quelle selbst prüfen. Titel, Autorinnen und Autoren, Zeitschrift, Jahr, Seiten und DOI werden im Original oder in PubMed kontrolliert, bevor eine Stelle zitiert wird.
  2. Keine vertraulichen Daten eingeben. Patientendaten, unveröffentlichte Ergebnisse und Gutachten gehören nicht in öffentliche Chatprogramme.
  3. Nutzung offenlegen. Zeitschriften verlangen zunehmend eine Angabe, ob und wofür KI eingesetzt wurde; Sprachmodelle können keine Autorschaft übernehmen.
  4. Inhaltliche Verantwortung behalten. Die Autorinnen und Autoren verantworten jede Aussage, unabhängig davon, wer den ersten Entwurf geschrieben hat.
  5. Berichtsstandards beachten. Für Studien mit Sprachmodellen gibt es eigene Standards, etwa TRIPOD-LLM, und für die frühe klinische Prüfung von Entscheidungshilfen DECIDE-AI.
Evidence Box, OffenlegungEin Delphi-Verfahren aus Regionalanästhesie und Schmerzmedizin hat Empfehlungen zur Offenlegung von KI-Nutzung beim wissenschaftlichen Schreiben erarbeitet (Fettiplace 2025); die Zeitschriften der JAMA-Gruppe haben eigene Vorgaben veröffentlicht (Flanagin 2024). Übereinstimmend gilt, dass die Nutzung beschrieben werden muss, dass Sprachmodelle nicht als Autoren genannt werden und dass die menschlichen Autorinnen und Autoren für den Inhalt einstehen.
Messfehler Box, ÜbersichtsarbeitenDie Vorstellung, ein Sprachmodell könne eine systematische Übersichtsarbeit eigenständig erstellen, ist verfrüht. Modelle können Schritte wie die Vorauswahl von Titeln und Abstracts beschleunigen, die Übereinstimmung mit menschlicher Auswahl schwankt aber, und fehlende oder erfundene Studien fallen ohne menschliche Kontrolle nicht auf.

Übung 5.1

Lektion 6

Rechtsrahmen, Datenschutz und sichere Einführung

Die Einführung generativer KI in einer Klinik ist kein IT-Projekt allein. Sie berührt Datenschutz, Medizinprodukterecht, Haftung, Arbeitsabläufe und Ausbildung. Die folgenden Punkte beschreiben den Rahmen in Deutschland und Europa und ein Vorgehen, das sich an der Studienlage orientiert.

Rechtlicher Rahmen

Die europäische KI-Verordnung gilt seit 2024 und tritt stufenweise in Kraft. Seit Februar 2025 gelten die Verbote bestimmter Praktiken und die Pflicht zur KI-Kompetenz. Diese Pflicht wurde im Juli 2026 neu gefasst: Betreiber müssen Maßnahmen ergreifen, die die KI-Kompetenz ihres Personals fördern, ohne ein bestimmtes Niveau jeder einzelnen Person garantieren zu müssen. Seit August 2025 gelten Pflichten für Anbieter allgemeiner KI-Modelle, seit August 2026 Transparenzpflichten, etwa zur Kennzeichnung KI-erzeugter Inhalte. Die Pflichten für Hochrisikosysteme, zu denen KI in Medizinprodukten gehört, wurden durch den sogenannten Digital Omnibus verschoben: Für KI in Produkten, die bereits dem Medizinprodukterecht unterliegen, gelten sie ab dem 2. August 2028. Die Anforderungen der Medizinprodukteverordnung bleiben davon unberührt. Parallel gilt die Datenschutz-Grundverordnung: Gesundheitsdaten dürfen nur auf gesicherter Rechtsgrundlage und mit einem Anbieter verarbeitet werden, mit dem eine entsprechende Vereinbarung besteht.

Messfehler Box, öffentliche ChatprogrammeEin frei zugängliches Chatprogramm ist kein zugelassenes Medizinprodukt und keine datenschutzkonforme Klinikanwendung. Wer Patientendaten dort eingibt, gibt sie an einen Dritten weiter. Das gilt auch für scheinbar anonymisierte Fälle, wenn seltene Diagnosen, Daten und Orte eine Zuordnung erlauben.

Drei realistische Anwendungsfälle

Tabelle 5: Anwendungsfälle mit vertretbarem Nutzen-Risiko-Verhältnis
AnwendungsfallUmsetzungMessgrößen für einen Pilotversuch
Dokumentationsassistenz PrämedikationGesprächsmitschrift, Strukturierung nach Anamnese, Medikation, Allergien, Risiken und Plan; ärztliche Prüfung vor Übernahme in die AkteDokumentationszeit, Bildschirmzeit, Vollständigkeit, Korrekturbedarf, Fehlerquote, Zufriedenheit
SOP-Assistentnur freigegebene klinikeigene Standards als Wissensbasis, Antwort mit Verweis auf die Textstelle, keine AnordnungÜbereinstimmung mit dem Standard, Halluzinationen, Abweichungen, Nutzung
Datenausleitung für RegisterExtraktion definierter Größen aus Freitext, hohe Sicherheitsschwelle, unsichere Fälle in eine PrüflisteAusbeute, Fehlerrate, Anteil manueller Prüfung

Sicherheitsprinzipien

  • Die klinische Verantwortung bleibt bei der Ärztin oder dem Arzt; die KI erzeugt Entwürfe, keine Entscheidungen.
  • Eine kontrollierte Wissensbasis ersetzt freie Antworten aus dem Modellwissen.
  • Vor dem Echtbetrieb wird im eigenen Haus validiert, nicht nur beim Hersteller.
  • Modell, Arbeitsanweisung, Wissensbasis und Standards werden versioniert; nach jedem Update wird erneut geprüft.
  • Klinisch relevante Antworten werden protokolliert und sind nachvollziehbar.
  • Findet das System keine eindeutige Antwort, sagt es das und verweist an einen Menschen.
  • Datenschutz, Informationssicherheit und die regulatorische Einordnung sind vor der Anbindung an klinische Systeme geklärt.
Aus der Praxis
  • Keine Patientendaten in öffentliche Chatprogramme.
  • KI-erzeugte Texte in der Patientenversorgung werden vor Verwendung vollständig gelesen und verantwortet.
  • Dosierungen, Indikationen und Kontraindikationen werden nie aus einer KI-Antwort übernommen, sondern aus Fachinformation oder Leitlinie.
  • Neue KI-Anwendungen werden vor dem Einsatz mit der Abteilungsleitung, dem Datenschutz und der IT abgestimmt.
  • Die Nutzung von KI in Lehre und Forschung wird offen angegeben.
Evidence Box, RessourcenRechenzentren verbrauchen erhebliche Mengen an Energie und Wasser, und die Rechenlast durch generative KI wächst. Die Internationale Energieagentur erwartet bis 2030 etwa eine Verdopplung des Stromverbrauchs von Rechenzentren. Für eine Abteilung, die sich mit der Klimawirkung von Narkosegasen beschäftigt, gehört der Ressourcenverbrauch digitaler Werkzeuge in dieselbe Abwägung. Kleine lokale Modelle für eng umrissene Aufgaben sind auch unter diesem Gesichtspunkt eine vernünftige Wahl.

Übung 6.1

Übung 6.2

Lektion 7

Fälle, Merksätze und Aufgaben

Fall 1: Der schnelle Narkoseplan

Eingabe einer vollständigen Vorgeschichte in ein öffentliches Chatprogramm.

Fall 1

Fall 2: Zwölf Quellen, drei Geister

Literaturstellen aus einem Sprachmodell für eine Übersichtsarbeit.

Fall 2

Merksätze

  • Ein Sprachmodell erzeugt plausible Sprache, nicht geprüftes Wissen.
  • Halluzinationen sind in der Bauweise angelegt und werden seltener, aber nicht null.
  • Antworten gehören an geprüfte Quellen gebunden.
  • Die KI schreibt den Entwurf, die Ärztin oder der Arzt verantwortet das Ergebnis.
  • Ein gutes System beantwortet nicht jeden Fall und gibt Unsicheres an Menschen zurück.
  • Belegt sind heute Arbeitsabläufe, nicht Patientenergebnisse.
  • Keine Patientendaten in öffentliche Chatprogramme.
  • Jede Literaturstelle wird im Original geprüft.
  • Nach jedem Update wird neu geprüft.
  • Betreiber müssen die KI-Kompetenz ihres Personals fördern.

Aufgaben

Aufgabe 1: Anwendungsfall bewerten

Gegeben:
Die Abteilung soll entscheiden, ob ein Sprachassistent für die Prämedikationsambulanz erprobt wird.

Frage:
Welche Voraussetzungen und welche Messgrößen legen Sie für einen Pilotversuch fest?

Lösung

Voraussetzungen sind eine datenschutzkonforme, vertraglich geregelte Umgebung, die Integration in das Dokumentationssystem, die Kennzeichnung als Entwurf und die verpflichtende ärztliche Prüfung vor Übernahme in die Akte. Gemessen werden Dokumentationszeit, Bildschirmzeit, Vollständigkeit, Korrekturbedarf, Fehlerquote mit Art der Fehler und die Zufriedenheit von Ärztinnen, Ärzten und Patienten. Vor dem Start wird festgelegt, bei welcher Fehlerquote der Versuch abgebrochen wird, und nach jedem Softwareupdate wird eine Stichprobe erneut geprüft.

Aufgabe 2: Arbeitsanweisung formulieren

Gegeben:
Für einen SOP-Assistenten mit den Standards der Abteilung soll die Arbeitsanweisung an das Modell geschrieben werden.

Frage:
Welche Elemente gehören hinein?

Lösung

Eine Rollenbeschreibung, die Beschränkung auf die hinterlegten Standards, die Pflicht, jede Antwort mit der Fundstelle zu belegen, die Anweisung, bei fehlender Fundstelle ausdrücklich zu sagen, dass keine Antwort in den Standards steht, das Verbot, Dosierungen ohne Patientendaten und ohne Fundstelle zu nennen, und der Hinweis, dass die Antwort keine ärztliche Anordnung ist. Die Anweisung wird versioniert und gemeinsam mit den Standards geprüft.

Aufgabe 3: Evidenz einordnen

Gegeben:
Ein Hersteller wirbt mit der Aussage, sein System sei zu 98 % genau.

Frage:
Welche Fragen stellen Sie, bevor Sie diese Zahl bewerten?

Lösung

Genau in Bezug worauf: auf ein Protokoll, auf ein Expertenurteil oder auf ein Patientenergebnis? An wie vielen Fällen, aus wie vielen Häusern, in welcher Sprache und mit welcher Modellversion? Wie wurden unsichere Fälle behandelt, und wie hoch war der Anteil der Fälle, die das System gar nicht beantwortet hat? Welche Art von Fehlern trat in den übrigen 2 % auf, und wären sie klinisch gefährlich gewesen? Und wurde unabhängig vom Hersteller geprüft?

Aufgabenblock abschließen

Markieren Sie den Block als bearbeitet, wenn Sie alle Aufgaben gelöst und mit den Lösungen verglichen haben.

Abschlussquiz, etwa 12 Minuten

Abschlussquiz

Zwölf Fragen. Bestanden ab 80 %.

Zum Nachschlagen

Begriffe und Literatur

BegriffBedeutung
Großes Sprachmodell (LLM)generatives Modell mit sehr vielen Parametern, meist in der Cloud betrieben
Kleines Sprachmodell (SLM)verkleinertes Modell, lokal und ohne Internet betreibbar
Tokenkleinste vom Modell verarbeitete Texteinheit
Halluzinationsachlich falsche Ausgabe mit plausibler Sprache
RAGretrieval augmented generation, Antwort gestützt auf eine angebundene Wissensbasis
Prompt Engineeringgezielte Formulierung der Arbeitsanweisung an ein Modell
Ambient ScribeSprachassistent, der Gespräche mitschreibt und Dokumentationsentwürfe erzeugt
Human in the loopMensch prüft und verantwortet jede klinisch relevante Ausgabe
Automatisierungsbiasübermäßiges Vertrauen in ein meist richtiges automatisches System
Digital OmnibusEU-Verordnung 2026/1744 zur Änderung der KI-Verordnung, verschiebt Hochrisikopflichten

Literatur

  1. Chuan A, Nanda M. Generative artificial intelligence in anesthesiology: current evidence, clinical applications, and the emerging role of small models. Anesthesiology 2026;144:1420–1430.
  2. Rahrisch A, Braun J, Ganter MT, et al. Generative AI in preanesthetic consultations: effects on efficiency, documentation workload, quality, and physician-patient interaction: a simulation trial. J Clin Anesth 2026;110:112163.
  3. Ke YH, Jin L, Elangovan K, et al. Real-world deployment and evaluation of PEri-operative AI CHatbot (PEACH): a large language model chatbot for peri-operative medicine. Anaesthesia 2026;81:62–71.
  4. Ke YH, Yang Ong BS, Jin L, et al. Clinical and economic impact of a large language model in perioperative medicine: a randomized crossover trial. NPJ Digit Med 2025;8:462.
  5. MacKay EJ, Goldfinger S, Chan TJ, et al. Automated structured data extraction from intraoperative echocardiography reports using large language models. Br J Anaesth 2025;134:1308–1317.
  6. Khan A, Kundu A, Saha S, Gondode P. Caudal anesthesia patient education materials: comprehensive analysis of generative artificial intelligence and traditional patient information leaflets. Paediatr Anaesth 2026;36:1153–1155.
  7. Tulgar S, Aksu C, Selvi O, et al. A comparative evaluation of the quality of responses provided by different large language model chatbots to frequently asked questions regarding nerve blocks. BMC Anesthesiol 2026;26:98.
  8. Liu H, Cheng H, Zhang Y, et al. Revolutionizing clinical skills training with generative AI: the Intelligent Inquiry Training System framework. Front Med 2026;13:1781314.
  9. Lukac PJ, Turner W, Vangala S, et al. Ambient AI scribes in clinical practice: a randomized trial. NEJM AI 2025;2(12). doi:10.1056/AIoa2501000.
  10. Afshar M, Baumann MR, Resnik F, et al. A pragmatic randomized controlled trial of ambient artificial intelligence to improve health practitioner well-being. NEJM AI 2025;2(12). doi:10.1056/AIoa2500945.
  11. Brügge E, Ricchizzi S, Arenbeck M, et al. Large language models improve clinical decision making of medical students through patient simulation and structured feedback: a randomized controlled trial. BMC Med Educ 2024;24:1391.
  12. De Cassai A, Dost B. Concerns regarding the uncritical use of ChatGPT: a critical analysis of AI-generated references in the context of regional anesthesia. Reg Anesth Pain Med 2024;49:378–380.
  13. Fettiplace MR, Bhatia A, Chen Y, et al. Recommendations for disclosure of artificial intelligence in scientific writing and publishing: a regional anesthesia and pain medicine modified Delphi study. Reg Anesth Pain Med 2025. doi:10.1136/rapm-2025-106852.
  14. Flanagin A, Pirracchio R, Khera R, et al. Reporting use of AI in research and scholarly publication: JAMA Network guidance. JAMA 2024;331:1096–1098.
  15. Gallifant J, Afshar M, Ameen S, et al. The TRIPOD-LLM reporting guideline for studies using large language models. Nat Med 2025;31:60–69.
  16. Vasey B, Nagendran M, Campbell B, et al. Reporting guideline for the early stage clinical evaluation of decision support systems driven by artificial intelligence: DECIDE-AI. BMJ 2022;377:e070904.
  17. Verordnung (EU) 2024/1689 des Europäischen Parlaments und des Rates zur Festlegung harmonisierter Vorschriften für künstliche Intelligenz (KI-Verordnung). ABl. L, 12.7.2024.
  18. Verordnung (EU) 2026/1744 zur Änderung der Verordnung (EU) 2024/1689 (Digital Omnibus zur KI), in Kraft seit 27.7.2026.
  19. World Health Organization. Ethics and governance of artificial intelligence for health. Genf, WHO 2021, Leitlinie zu großen multimodalen Modellen 2024.
  20. International Energy Agency. Energy and AI. Paris, IEA 2025.

© 2026 Ulrich Frey. Alle Rechte vorbehalten. Neufassung für das E-Learning, Recherchestand September 2026. Die Inhalte dienen der Aus- und Weiterbildung und ersetzen keine Leitlinie, keine Fachinformation und keine lokalen Standards.