GPT-4を用いた外科医の資格試験に関するパイロット研究
カテゴリ:医学教育
公開日:2026年2月19日
タイトル:GPT-4 as a Board-Certified Surgeon: A Pilot Study
雑誌名:Med Sci Educ. 2025 Jun; 35(3): 1557-1566.
概 要:
本研究は、GPT-4が外科教育においてどの程度の知識を持つかを評価することを目的としています。大規模言語モデル(LLM)の精度と信頼性に対する懸念が広範な採用の障壁となっていますが、GPT-4は選択問題テストを通過する能力を示しています。本研究では、模擬の筆記および口頭試験を通じて、GPT-4の一般外科に関する知識を評価し、外科教育と実践を革新するための改善点を明らかにします。
方 法:
GPT-4の能力を評価するために、外科教育委員会(SCORE)の問題バンクからランダムに選ばれた250の選択問題(MCQ)と、信頼できる専門的活動(EPA)トピックリストに基づく4つの口頭試験シナリオを使用しました。2人の元口頭試験官が、正確性について独立して回答を評価しました。
結 果:
MCQにおいて、GPT-4は250問中197問(78.8%)を正答し、アメリカ外科専門医資格試験(ABS QE)に合格する確率は92%と推定されました。一方、口頭試験シナリオでは、GPT-4は4つの臨床ケースのうち3つ(75%)で重大な失敗を犯しました。失敗の主な理由は、介入のタイミングの誤りと提案された手術の不正確さでした。
結 論:
GPT-4はMCQで高いパフォーマンスを示しましたが、模擬口頭試験では正確な長文コンテンツを生成するのに苦労しました。今後は、専門的なデータセットと高度な強化学習を用いて、複雑で高リスクな臨床意思決定におけるLLMのパフォーマンスを向上させる必要があります。