OpenAIのChat-4.0が神経学試験で人間の成績を上回る

2023 年 12 月 12 日

OpenAIの洗練された言語モデル「Chat-4.0」は、人工知能とヘルスケアの融合分野において大きな前進を遂げました。最近の概念実証研究において、この大規模言語モデル(LLM)は臨床神経学試験に合格し、問題の85%を正答しました。この素晴らしい成果は、さらなる改良により、LLMが臨床神経学の分野で重要なニッチを切り開く可能性を示唆しています。

この画期的な研究は、ハイデルベルク大学病院とハイデルベルクのドイツがん研究センターの研究者チームによって実施されました。 7 月 XNUMX 日に発表されたこの結果は、医療の再構築における AI の可能性を強調しています。 実施されたテストは、 チャット4.0 これには、米国精神神経学会からの一連の質問が含まれており、欧州神経学会からの選択によって補足されています。

Chat-4.0は前身を上回り、 チャット-3.5、 Chat-4.0は1,956問中1,306問を正答し、66.8%の正解率を達成しました。一方、新モデルは1,662問を正答し、85%の正解率という快挙を成し遂げました。ちなみに、人間の平均正解率は73.8%であり、Chat-4.0は人間のパフォーマンスを上回ったことを示しています。さらに、学術界では70%が標準合格点であるため、Chat-4.0は神経学試験に合格したと言っても過言ではありません。

ただし、この研究では、モデルが改善できる領域も明らかになりました。 たとえば、どちらのモデルも、「低次の思考」のみを必要とするタスクと比較して、「高次の思考」を必要とするタスクのパフォーマンスが低いことを示しました。 これは、LLM が臨床神経学の分野で有望である一方で、まだ改善の余地があることを示しています。

こうした制限にもかかわらず、この研究に参加した研究者らは、臨床神経学におけるLLMの潜在的な応用について楽観的である。 研究著者の一人であるヴァルン・ヴェンカタラマニ博士はコインテレグラフに対し、次のように説明した。 LLM を臨床神経学に適切に適用できるようにするには、開発がまだ必要であり、おそらく LLM の特定の微調整も必要です。」

アストラゼネカのがん研究や香港における抗生物質の過剰処方対策など、重要な医療分野におけるAI活用の成功は、この技術の可能性を浮き彫りにしています。Chat-4.0が神経内科試験に合格したという最近の快挙は、医療分野におけるAIの輝かしい未来を予感させ、AI主導の医療の進歩に向けた新たな一歩を踏み出したことを示しています。