エージェント型GPT-5.0システムは、標準的な大規模言語モデルおよび人間の専門家を上回る重症管理における臨床意思決定を実現:シミュレーション研究
カテゴリ:災害・救急医療
公開日:2026年5月9日
タイトル:Agentic GPT-5.0 system outperforms standard large language models and human experts in critical care clinical decision-making: a simulation study.
雑誌名:BMC Med Inform Decis Mak. 2026 May 08; doi: 10.1186/s12911-026-03555-5.
概 要:
本研究は、エージェント型AIシステム(GPT-5.0とGemini 2.0 Flashを組み合わせたもの)が、酸塩基障害の解釈と敗血症管理において、標準的な大規模言語モデル(LLM)および人間の専門家と比較してどのようにパフォーマンスを発揮するかをシミュレーションで評価しました。結果として、エージェント型システムは、酸塩基障害において91.0%の正確性を達成し、他のモデルや専門家を有意に上回りました。
方 法:
本研究では、独立した専門家パネルによって開発された45の臨床ビネット(酸塩基障害20件、敗血症25件)を評価しました。評価対象は、Gemini 2.0 Flash、GPT-4o、エージェント型システム、20人のボード認定医師です。回答は匿名化され、事前に設定されたゴールドスタンダードに基づいて2人のブラインド評価者によって評価されました。
結 果:
酸塩基障害において、エージェント型システムは91.0%の正確性を示し、GPT-4o(78.0%)、Gemini(74.5%)、人間専門家(83.0%)を有意に上回りました。SSC hour-1バンドルの遵守率は、エージェント型システムが96.8%で、他のモデルや専門家よりも高い結果を示しました。ROC分析では、エージェント型システムのAUCは0.932であり、他のモデルや専門家よりも優れた識別能力を示しました。
結 論:
このシミュレーション研究において、エージェント型AIシステムは、酸塩基解釈および敗血症バンドル遵守の構造化タスクにおいて、標準的なLLMおよび人間の医療専門家よりも有意に高いパフォーマンスを示しました。これらの結果は、エージェント型アーキテクチャが構造化された臨床意思決定支援の有望な方向性を示唆しており、実際の患者データを用いた前向きな検証が必要です。