ChatGPT Viser 72 % diagnostisk nøyaktighet i klinisk beslutningstaking

August 30, 2023

I den raskt utviklende verden av medisinsk teknologi, har kunstig intelligens (AI) dukket opp som et kontroversielt, men lovende verktøy. Anvendelsen av kunstig intelligens i komplekse medisinske scenarier har utløst betydelig debatt blant helsepersonell. En fersk studie som undersøker evnen til AI til å hjelpe til med kliniske beslutninger har satt denne diskusjonen i skarpere fokus.

Utført av forskere kl Massegeneral Brigham, evaluerte studien ytelsen til OpenAIs Chat i diagnostisering av medisinske tilstander basert på casestudier fra lærebøker. Overraskende nok oppnådde Chat en suksessrate på 72 % i klinisk beslutningstaking, noe som indikerer potensialet som et støttende verktøy i medisinsk diagnose.

Etter hvert som helsesystemer verden over sliter med økende kostnader og kompleksitet, kan AI tilby en løsning for å forbedre effektiviteten og nøyaktigheten i diagnostikk. Med helsevesen som sto for omtrent 18 % av USAs BNP i 2021, nesten dobbelt så mye som gjennomsnittet blant avanserte økonomier, er behovet for mer effektive diagnostiske metoder tydelig. AI-verktøy som Chat kan potensielt revolusjonere helsesektoren og gjøre diagnostikk raskere, mer nøyaktig og kostnadseffektiv.

Studien var en av de første som vurderte egenskapene til store språkmodeller i et bredt spekter av klinisk behandling. Chats ytelse ble evaluert fra første pasientinteraksjon til behandling etter diagnose. AI-modellen viste en suksessrate på 77 % i den endelige diagnosen, men hadde en lavere suksessrate på 60 % når det gjaldt differensialdiagnose, som innebærer å forstå alle mulige tilstander som et sett med symptomer kan indikere.

Selv om resultatene er lovende, er det viktig å merke seg at effektiviteten til AI-applikasjoner i kliniske miljøer i den virkelige verden kan variere betydelig fra kontrollerte forskningsmiljøer. Kritikere hevder at mange AI-studier ikke er basert på faktiske kliniske behov og ofte overser de praktiske utfordringene ved å implementere AI i virkelige helsemiljøer, som risiko for feilbehandling.

Marc Succi, administrerende direktør ved Mass General Brighams innovasjonsinkubator og medforfatter av rapporten, erkjenner dette gapet. Han påpeker at mens AI viser et stort potensial i tidlig fase av pasientbehandling når informasjonen er begrenset, trenger den betydelige forbedringer i differensialdiagnose før den kan integreres fullt ut i helsevesenet.

Succi sammenligner Chats nåværende evner med en nyutdannet leges. Uten etablerte målestokker for suksessrater blant leger på ulike seniornivåer er det imidlertid utfordrende å tallfeste verdien AI tilfører en leges arbeid.

Succi etterlyser mer referanseforskning, regulatorisk veiledning og forbedringer i diagnostiske suksessrater fremover. Dette mener han er avgjørende for å legge til rette for utrulling av AI-modeller som Chat på sykehus. AIs rolle i helsevesenet er fortsatt i utvikling, og selv om Chats prestasjoner er bemerkelsesverdige, er det tydelig at vi bare er i begynnelsen av å forstå hvordan AI kan utnyttes til å transformere helsevesenet.