MEDICINE & AI

プラグイン拡張ChatGPTの性能と不確実性の定量化能力:ドイツ医療ボード試験に関するシミュレーション研究

カテゴリ:高齢者医療・介護

公開日:2026年2月19日

タイトル:Performance of Plug-In Augmented ChatGPT and Its Ability to Quantify Uncertainty: Simulation Study on the German Medical Board Examination 雑誌名:JMIR Med Educ. 2025 Mar 21; 11: e58375. doi: 10.2196/58375. Epub 2025 Mar 21. 概 要: 本研究は、GPT-3.5、GPT-4、プラグインを使用したGPT-4、および翻訳された英語テキストを用いたプラグイン付きGPT-4の性能を、ドイツ医療ボード試験において評価することを目的としています。特に、医療におけるLLM(大規模言語モデル)の応用において不確実性を定量化する重要性を認識し、新たに「信頼性精度」という指標を開発してその能力を評価しました。 方 法: GPT-3.5、GPT-4、プラグイン付きGPT-4、および翻訳を用いたプラグイン付きGPT-4を使用して、ドイツ医療ボード試験の質問に回答しました。さらに、モデルがどのように回答を正当化し、回答の正確性や誤りの構造を評価するかを分析しました。ブートストラップ法と信頼区間を用いて、結果の統計的有意性を評価しました。 結 果: 本研究では、利用可能なGPTモデルがドイツ医療ボードによって設定された医療学生の最低能力基準を超える性能を示しました。また、モデルは回答の不確実性を評価できるものの、過信の傾向が見られました。さらに、GPTが回答を生成する際に現れる特定の正当化および推論構造が明らかになりました。 結 論: 医療に関する質問に対するGPTの高い性能は、学術および臨床実践における応用の可能性を示唆しています。回答の不確実性を定量化する能力は、臨床意思決定のループ内で価値ある人工知能エージェントとなる可能性があります。しかし、医療分野で人工知能エージェントを安全に実装するためには、重要な課題に対処する必要があります。