MEDICINE & AI

緊急内科における意思決定支援ツールとしての大規模言語モデルおよび大規模推論モデルの評価

カテゴリ:災害・救急医療

公開日:2026年2月19日

タイトル:Evaluating large language and large reasoning models as decision support tools in emergency internal medicine 雑誌名:Comput Biol Med. 2025 Jun; 192(Pt B): 110351. 概 要: 本研究は、緊急内科における臨床意思決定支援のための大規模言語モデル(LLM)の実際の性能を評価することを目的としています。OpenAIの「o1」大規模推論モデル、AnthropicのClaude-3.5-Sonnet、MetaのLlama-3.2-70Bの3つのモデルを、専門医と比較しました。73件の匿名患者ケースを用いて、モデルの診断テストの推奨の関連性や最終診断、治療計画を評価しました。 方 法: 2024年6月から9月にかけて、クロアチアのスプリット大学病院の緊急内科病棟から73件の匿名患者ケースを対象にした前向き比較研究を実施しました。2人の独立した内科専門医が、モデルの生成したレポートを評価し、診断テストの関連性や最終診断、治療計画を評価しました。評価にはLikertスケールを使用し、統計的比較にはFriedman検定とWilcoxon符号付順位検定を用いました。 結 果: o1モデルは平均評価点3.63で、専門医の3.67と統計的に有意差がありませんでした(p=0.62)。一方、Claude-3.5-Sonnet(3.38)とLlama-3.2-70B(3.23)は有意に低い評価を受けました(p<0.01)。全モデルは最終診断と患者入院決定において90%以上の精度を示し、o1モデルは異常な検査値を100%正しく分類しました。 結 論: 実際の緊急ケースで評価した結果、推論能力を強化したo1モデルは専門医レベルの臨床性能を発揮し、意思決定支援ツールとしての有用性が示されました。