ChatGPT Viser 72 % diagnostisk nøjagtighed i klinisk beslutningstagning

August 30, 2023

I den hastigt udviklende verden af ​​medicinsk teknologi er kunstig intelligens (AI) dukket op som et kontroversielt, men lovende værktøj. Anvendelsen af ​​kunstig intelligens i komplekse medicinske scenarier har udløst betydelig debat blandt sundhedspersonale. En nylig undersøgelse, der udforsker AIs evne til at hjælpe med klinisk beslutningstagning, har bragt denne diskussion i skarpere fokus.

Udført af forskere kl Messe General Brigham, evaluerede undersøgelsen OpenAI's Chats ydeevne i diagnosticering af medicinske tilstande baseret på casestudier fra lærebøger. Overraskende nok opnåede Chat en succesrate på 72% i klinisk beslutningstagning, hvilket indikerer dens potentiale som et støttende værktøj i medicinsk diagnose.

I takt med at sundhedssystemer verden over kæmper med stigende omkostninger og kompleksitet, kan AI tilbyde en løsning til at forbedre effektiviteten og nøjagtigheden i diagnostik. Med sundhedsvæsenet, der tegnede sig for cirka 18 % af det amerikanske BNP i 2021, næsten dobbelt så meget som gennemsnittet blandt avancerede økonomier, er behovet for mere effektive diagnostiske metoder tydeligt. AI-værktøjer som Chat kan potentielt revolutionere sundhedssektoren og gøre diagnostik hurtigere, mere præcis og omkostningseffektiv.

Undersøgelsen var en af ​​de første til at vurdere mulighederne for store sprogmodeller i et bredt spektrum af klinisk pleje. Chats ydeevne blev evalueret fra den indledende patientinteraktion til plejehåndtering efter diagnose. AI-modellen viste en succesrate på 77 % i den endelige diagnose, men havde en lavere succesrate på 60 %, når det kom til differentialdiagnose, hvilket involverer forståelse af alle mulige tilstande, som et sæt symptomer kan indikere.

Selvom resultaterne er lovende, er det vigtigt at bemærke, at effektiviteten af ​​AI-applikationer i kliniske omgivelser i den virkelige verden kan variere betydeligt fra kontrollerede forskningsmiljøer. Kritikere hævder, at mange AI-studier ikke er funderet i faktiske kliniske behov og ofte overser de praktiske udfordringer ved at implementere AI i virkelige sundhedsmiljøer, såsom risici for fejlbehandling.

Marc Succi, administrerende direktør ved Mass General Brighams innovationsinkubator og medforfatter af rapporten, erkender dette hul. Han påpeger, at mens AI viser et stort potentiale i tidlig patientbehandling, når informationen er begrænset, skal den betydelige forbedringer i differentialdiagnostik, før den kan integreres fuldt ud i sundhedssystemet.

Succi sammenligner Chats nuværende evner med en nyuddannet læges. Uden etablerede benchmarks for succesrater blandt læger på forskellige anciennitetsniveauer er det dog udfordrende at kvantificere den værdi, som AI tilføjer til en læges arbejde.

Fremadrettet opfordrer Succi til mere benchmark-forskning, regulatorisk vejledning og forbedringer i diagnostiske succesrater. Dette, mener han, er afgørende for at fremme implementeringen af ​​AI-modeller som Chat på hospitaler. AI's rolle i sundhedsvæsenet er stadig under udvikling, og selvom Chats resultater er bemærkelsesværdige, er det tydeligt, at vi kun er i begyndelsen af ​​at forstå, hvordan AI kan udnyttes til at transformere sundhedsvæsenet.