MEDICINE & AI

ペルシャ語外科専門医試験における大規模言語モデルのベンチマーク:ChatGPT-4o、ChatGPT-5、およびGemini 2.5 Flashの比較研究

カテゴリ:手術支援

公開日:2026年5月9日

タイトル:Benchmarking large language models on persian surgical subspecialty board examinations: a comparative study of ChatGPT-4o, ChatGPT-5, and Gemini 2.5 Flash 雑誌名:Sci Rep. 2026 May 08; doi: 10.1038/s41598-026-51934-9. 概 要: 本研究では、2025年のイラン外科専門医試験からの532のペルシャ語の選択問題に対するChatGPT-4o、ChatGPT-5、およびGemini 2.5 Flashの3つの大規模言語モデルの性能を評価しました。問題は小児外科、心血管外科、血管および内視鏡外科、胸部外科、形成および再建外科の5つの領域にわたりました。標準化されたプロンプトを使用して、全体的な正確性、専門分野や問題タイプによる変動、問題の長さの影響を評価しました。Gemini 2.5 FlashとChatGPT-5は、ChatGPT-4oよりも高い正確性を示しました(それぞれ73.9%および73.3%対68.2%)。公式キーとの一致度は、Gemini 2.5 Flash(κ=0.651)およびChatGPT-5(κ=0.642)で高く、ChatGPT-4o(κ=0.575)では中程度から高い一致を示しました。モデルの性能は専門分野間で安定していましたが、すべてのモデルが外科手技に関する問題では臨床シナリオや基礎科学の項目に比べて低い正確性を示しました。問題の長さはChatGPT-5やGemini 2.5 Flashには影響しませんでしたが、長い問題文はChatGPT-4oの性能を低下させました。これらの結果は、新しいLLMが外科的質問応答において測定可能な改善を提供することを示していますが、外科手技に関する項目での低い性能は慎重な統合とさらなるマルチモーダル開発の必要性を支持しています。 方 法: 本研究は、532のペルシャ語の選択問題を用いた比較研究です。対象は2025年のイラン外科専門医試験からの問題で、5つの専門分野にわたる質問が含まれています。標準化されたプロンプトを使用して、各モデルの正確性を評価し、専門分野や問題タイプによる変動、問題の長さの影響を分析しました。 結 果: Gemini 2.5 FlashとChatGPT-5はそれぞれ73.9%および73.3%の正確性を示し、ChatGPT-4oは68.2%でした。公式キーとの一致度は、Gemini 2.5 Flash(κ=0.651)およびChatGPT-5(κ=0.642)が高く、ChatGPT-4o(κ=0.575)は中程度でした。すべてのモデルは外科手技に関する問題で低い正確性を示しましたが、問題の長さはChatGPT-5やGemini 2.5 Flashには影響しませんでした。 結 論: 新しい大規模言語モデルは、外科的質問応答において測定可能な改善を提供することが示されましたが、外科手技に関する項目での低い性能は、慎重な統合とさらなるマルチモーダル開発の必要性を示唆しています。