Generative künstliche Intelligenz bezeichnet Verfahren, die nicht nur Daten einordnen, sondern neue Inhalte erzeugen: Text, Bilder, Audio oder Programmcode. Für die Klinik sind vor allem große Sprachmodelle relevant, im Englischen Large Language Models. Sie stecken hinter den bekannten Chatprogrammen und zunehmend hinter Funktionen, die in Praxis- und Kliniksoftware eingebaut werden. Wer diese Werkzeuge beurteilen will, braucht ein Grundverständnis ihrer Funktionsweise. Ohne dieses Verständnis bleibt die Entscheidung über Einsatz und Grenzen den Herstellern und der IT überlassen, obwohl die klinische Verantwortung bei den Ärztinnen und Ärzten liegt.
Wie ein Sprachmodell Text erzeugt
Ein Sprachmodell zerlegt Text in kleine Einheiten, sogenannte Token, die ganzen Wörtern oder Wortteilen entsprechen. Jedes Token wird als Zahlenvektor in einem vieldimensionalen Raum dargestellt. Diese Darstellung ist kontextabhängig: Das Wort Block trägt in einem anästhesiologischen Text eine andere Bedeutung als in einem Text über Stadtplanung. Beim Training lernt das Modell an sehr großen Textsammlungen, welche Tokenfolgen wahrscheinlich sind, und speichert dieses Wissen in Milliarden von Gewichten. Bei der Anwendung erzeugt es seine Antwort Token für Token, indem es jeweils ein wahrscheinliches nächstes Token auswählt.
Daraus folgt die wichtigste Eigenschaft für die Klinik: Ein Sprachmodell erzeugt plausible Sprache, nicht geprüftes Wissen. Auch Rechnen, logisches Schließen und räumliche Zuordnung laufen über Wahrscheinlichkeiten von Text und nicht über formale Regeln. Richtige Antworten entstehen deshalb häufig, aber nicht verlässlich, und das Modell kann einer falschen Antwort dieselbe sprachliche Sicherheit geben wie einer richtigen.
Große und kleine Modelle
Große Sprachmodelle besitzen sehr viele Parameter und laufen in Rechenzentren der Anbieter. Jede Anfrage verlässt damit das Kliniknetz. Kleine Sprachmodelle werden aus großen Modellen abgeleitet, etwa durch Quantisierung, also die Speicherung der Gewichte mit geringerer Rechengenauigkeit. Sie laufen auf einem einzelnen leistungsfähigen Rechner und können vollständig vom Internet getrennt betrieben werden. Der Preis ist eine geringere Leistungsfähigkeit und eine höhere Neigung zu Fehlern, weil die Fehlerrate mit sinkender Modellgröße steigt. Für eng umrissene Aufgaben erreichen größere lokale Modelle jedoch eine Genauigkeit, die der kommerzieller Systeme nahekommt (Chuan und Nanda 2026).
| Begriff | Bedeutung | Klinische Relevanz |
|---|---|---|
| Token | kleinste Texteinheit, die das Modell verarbeitet | bestimmt, wie viel Text in eine Anfrage passt |
| Kontextfenster | Menge an Text, die das Modell gleichzeitig berücksichtigt | lange Akten können abgeschnitten werden |
| Halluzination | sachlich falsche Ausgabe mit plausibler Sprache | Hauptrisiko jeder klinischen Anwendung |
| RAG | Anbindung einer externen, geprüften Wissensbasis | Antworten lassen sich an Quellen binden |
| Prompt Engineering | gezielte Formulierung der Arbeitsanweisung an das Modell | legt Rolle, Grenzen und Verhalten bei Unsicherheit fest |
| Feinabstimmung | Nachtraining eines Modells mit Fachtexten | ein speziell anästhesiologisches Modell gibt es bisher nicht |
| Agent | Modell, das selbstständig mehrere Arbeitsschritte ausführt | mehr Automatisierung, weniger menschliche Kontrolle |
| air-gapped | vom Internet getrennter Betrieb | Patientendaten verlassen die Klinik nicht |