OpenAIs Chat-4.0 übertrifft die menschliche Leistung bei der neurologischen Prüfung

12. Dezember 2023

OpenAIs ausgeklügeltes Sprachmodell Chat-4.0 hat an der Schnittstelle zwischen künstlicher Intelligenz und Gesundheitswesen einen bedeutenden Fortschritt erzielt. In einer aktuellen Proof-of-Concept-Studie hat dieses große Sprachmodell (LLM) eine Prüfung in klinischer Neurologie erfolgreich bestanden und 85 % der Fragen richtig beantwortet. Diese beeindruckende Leistung deutet darauf hin, dass LLMs mit weiteren Verbesserungen eine bedeutende Nische im Bereich der klinischen Neurologie erobern könnten.

Die bahnbrechende Studie wurde von einem Forscherteam des Universitätsklinikums Heidelberg und des Deutschen Krebsforschungszentrums Heidelberg durchgeführt. Die am 7. Dezember veröffentlichten Ergebnisse unterstreichen das Potenzial der KI bei der Neugestaltung des Gesundheitswesens. Der Test wurde durchgeführt Chat-4.0 enthielt eine Reihe von Fragen des American Board of Psychiatry and Neurology, ergänzt durch eine Auswahl des European Board for Neurology.

Chat-4.0 übertraf seinen Vorgänger, Chat-3.5, Chat-4.0 beantwortete 1,306 von 1,956 Fragen richtig und erreichte damit eine Punktzahl von 66.8 %. Das neuere Modell hingegen konnte mit 1,662 korrekten Antworten und einer Erfolgsquote von 85 % überzeugen. Zum Vergleich: Die durchschnittliche menschliche Punktzahl liegt bei 73.8 %, was bedeutet, dass Chat-4.0 die menschliche Leistung übertroffen hat. Da 70 % die übliche Bestehensnote im akademischen Bereich sind, kann man mit Sicherheit sagen, dass Chat-4.0 die neurologische Prüfung erfolgreich bestanden hat.

Die Studie zeigte jedoch auch Bereiche auf, in denen die Modelle verbessert werden könnten. Beispielsweise zeigten beide Modelle eine schwächere Leistung bei Aufgaben, die „Denken höherer Ordnung“ erfordern, im Vergleich zu Aufgaben, die nur „Denken niedrigerer Ordnung“ erfordern. Dies deutet darauf hin, dass LLMs im Bereich der klinischen Neurologie zwar vielversprechend sind, es aber noch Raum für Verbesserungen gibt.

Trotz dieser Einschränkungen sind die an der Studie beteiligten Forscher hinsichtlich der möglichen Anwendungen von LLMs in der klinischen Neurologie optimistisch. Dr. Varun Venkataramani, einer der Autoren der Studie, erklärte gegenüber Cointelegraph: „Wir sehen unsere Studie eher als Proof-of-Concept für die Fähigkeiten von LLMs.“ Es besteht noch Entwicklungsbedarf und wahrscheinlich sogar eine spezifische Feinabstimmung der LLMs, um sie für die klinische Neurologie richtig anwendbar zu machen.“

Der erfolgreiche Einsatz von KI in wichtigen Bereichen des Gesundheitswesens, wie beispielsweise in der Krebsforschung von AstraZeneca oder im Kampf gegen die Überverschreibung von Antibiotika in Hongkong, unterstreicht das Potenzial dieser Technologie. Der kürzlich erfolgte Erfolg von Chat-4.0 bei einer neurologischen Prüfung signalisiert eine spannende Zukunft für KI im Gesundheitswesen und markiert einen weiteren Schritt auf dem Weg zu KI-gestützten medizinischen Fortschritten.