MEDICINE & AI

救急医療におけるAI:医療スコア計算におけるGPTモデルと医師の有効性の評価

カテゴリ:災害・救急医療

公開日:2026年2月19日

タイトル:AI in the ED: Assessing the efficacy of GPT models vs. physicians in medical score calculation 雑誌名:Am J Emerg Med. 2024 May; 79: 161-166. 概 要: 本研究は、救急医療におけるAIモデル(GPT-3.5およびGPT-4)の医療スコア計算における有効性を、経験豊富な救急科医と比較して評価することを目的としています。救急科では、NIHSSやHEARTスコアなどの確立されたスコアリングシステムが臨床判断に利用されています。150人の患者データを用いて、AIモデルと2人の医師が5つの医療スコアを計算し、その結果を比較しました。 方 法: この回顧的研究では、1週間に救急科を訪れた150人の患者のデータを分析しました。AIモデルと2人の医師が、NIH脳卒中スケール、カナダの失神リスクスコア、急性虫垂炎のアルバラドスコア、カナダのCT頭部ルール、HEARTスコアの計算を行いました。評価にはCohenのカッパ統計量とAUC値を使用し、評価者間の一致度と予測性能を分析しました。 結 果: 医師間の一致度は最も高く(Kappa = 0.681)、GPT-4は医師との間で中程度から実質的な一致を示しました(Kappa値は0.473および0.576)。GPT-3.5は医師との一致度が最も低かったです。人間の医師は5つのスコアのうち3つで高いROC-AUCを達成しましたが、統計的に有意な差はありませんでした。 結 論: AIモデルは人間の専門知識と一定の一致を示しましたが、医師が行う複雑な臨床判断を模倣するには至りませんでした。現在のAIモデルは補助ツールとしての役割を果たす可能性がありますが、救急医療のような高リスクの場面で人間の専門知識に取って代わる準備は整っていません。今後の研究が、救急医療におけるAIの能力と限界を探る必要があります。