Chat-4.0 van OpenAI overtreft menselijke prestaties bij neurologie-examens

December 12, 2023

Het geavanceerde taalmodel van OpenAI, Chat-4.0, heeft een flinke stap voorwaarts gezet op het snijvlak van kunstmatige intelligentie en gezondheidszorg. In een recente proof-of-conceptstudie slaagde dit grote taalmodel (LLM) met succes voor een examen klinische neurologie, waarbij 85% van de vragen correct werd beantwoord. Deze indrukwekkende prestatie suggereert dat LLM's met verdere verfijning een belangrijke niche zouden kunnen veroveren in de klinische neurologie.

De baanbrekende studie werd uitgevoerd door een team van onderzoekers afkomstig van het Universitair Ziekenhuis Heidelberg en het Duitse Kankeronderzoekscentrum in Heidelberg. De resultaten, gepubliceerd op 7 december, onderstrepen het potentieel van AI bij het hervormen van de gezondheidszorg. De test die wordt afgenomen Chat-4.0 bevatte een reeks vragen van de American Board of Psychiatry and Neurology, aangevuld met een selectie van de European Board for Neurology.

Chat-4.0 presteerde beter dan zijn voorganger, Chat-3.5, die 1,306 van de 1,956 vragen correct beantwoordde, goed voor een score van 66.8%. Het nieuwere model behaalde echter een prestatie door 1,662 vragen correct te beantwoorden, wat neerkomt op een slagingspercentage van 85%. Ter vergelijking: de gemiddelde menselijke score ligt op 73.8%, wat aangeeft dat Chat-4.0 de menselijke prestaties overtrof. Bovendien, aangezien 70% de standaardscore is voor een voldoende in de academische wereld, kunnen we gerust stellen dat Chat-4.0 het neurologie-examen met succes heeft afgelegd.

Het onderzoek bracht echter ook gebieden aan het licht waarop de modellen zouden kunnen verbeteren. Beide modellen lieten bijvoorbeeld zwakkere prestaties zien bij taken die 'denken van een hogere orde' vereisen, vergeleken met taken die alleen 'denken van een lagere orde' vereisen. Dit geeft aan dat, hoewel LLM's veelbelovend zijn op het gebied van de klinische neurologie, er nog steeds ruimte is voor verbetering.

Ondanks deze beperkingen zijn de bij het onderzoek betrokken onderzoekers optimistisch over de mogelijke toepassingen van LLM's in de klinische neurologie. Dr. Varun Venkataramani, een van de auteurs van de studie, legde aan Cointelegraph uit: “We zien onze studie meer als een proof-of-concept voor de mogelijkheden van LLM’s. Er is nog steeds ontwikkeling nodig en waarschijnlijk zelfs specifieke verfijning van LLM’s om ze goed toepasbaar te maken voor de klinische neurologie.”

Het succesvolle gebruik van AI in belangrijke zorgtaken, zoals kankeronderzoek bij AstraZeneca of de strijd tegen overmatig antibioticagebruik in Hongkong, onderstreept het potentieel van deze technologie. De recente prestatie van Chat-4.0 bij het behalen van een neurologie-examen voorspelt een veelbelovende toekomst voor AI in de zorg en markeert een nieuwe stap in de richting van AI-gedreven medische vooruitgang.