韓国医療ライセンス試験における大規模言語モデルの性能評価:3年間の比較分析
カテゴリ:医学教育
公開日:2026年2月19日
タイトル:Performance evaluation of large language models on Korean medical licensing examination: a three-year comparative analysis.
雑誌名:Sci Rep. 2025 Oct 15; 15(1): 36082.
概 要:
本研究は、韓国医療ライセンス試験(KMLE)の問題を用いて、非英語の医療文脈における大規模言語モデル(LLM)の性能を評価しました。2022年から2024年の942のKMLE問題を分析し、テキストのみならず画像ベースの質問も含めました。GPT-4oが最も高い正確性(83.2%)を示し、次いでClaude 3.5 Sonnet(79.5%)、Gemini 1.5 Pro(76.6%)が続きました。LLMは内科、小児科、精神科で強い性能を示しましたが、医療法に関しては比較的弱い結果でした。再現性は優れており、Claude 3.5 Sonnet、Gemini 1.5 Pro、GPT-4oはそれぞれ99.9%、99.5%、97.7%を示しました。この研究は、医療教育や評価におけるLLMの将来の開発と応用に貴重な洞察を提供します。
方 法:
本研究は、2022年から2024年のKMLE問題942問を対象にした比較分析です。テキストのみおよび画像ベースの質問を含むさまざまな医療専門分野からの問題を評価しました。再現性は繰り返しテストを通じて評価され、モデル間の一致はペアワイズ比較を用いて分析されました。
結 果:
GPT-4oは83.2%の正確性を達成し、Claude 3.5 Sonnetは79.5%、Gemini 1.5 Proは76.6%でした。LLMは内科、小児科、精神科で最も強い性能を示し、医療法では比較的弱い結果でした。再現性はClaude 3.5 Sonnetが99.9%、Gemini 1.5 Proが99.5%、GPT-4oが97.7%でした。特にGPT-4oとClaude 3.5 Sonnetの間で強いモデル間の一致が観察されました。
結 論:
LLMは非英語の医療知識評価においても有能な性能を示しましたが、画像ベースの質問や専門領域においては課題が残ります。今後の医療教育や評価におけるLLMの実用性を確立するためには、実際の教育現場でのさらなる検証が必要です。