MEDICINE & AI

GPT-4大規模言語モデルによるHEARTスコアの自動計算

カテゴリ:災害・救急医療

公開日:2026年2月19日

タイトル:Automated computation of the HEART score with the GPT-4 large language model 雑誌名:Am J Emerg Med. 2025 Jul; 93: 120-125. 概 要: 本研究は、HEARTスコアの自動計算が臨床意思決定支援や安全対策に寄与する可能性を探ることを目的としています。GPT-4大規模言語モデル(LLM)のHEARTスコア計算および60日間の重大有害心血管イベント(MACE)の予測性能を評価しました。2022年2月から2023年9月までの間に胸痛観察ユニットに入院した患者601人を対象に、医療従事者が計算したHEARTスコアとLLMによる計算結果の一致を比較しました。 方 法: この研究は、2022年2月から2023年9月までの回顧的コホート研究です。胸痛観察ユニットに入院した患者601人を特定し、HEARTスコアは医師助手または看護師が通常のケアの一環として計算しました。LLMは、匿名化されたチャート文書から開発したプロンプトを用いてHEARTスコアを計算しました。医療従事者のスコアとの不一致は、臨床結果を知らない救急医によって審査されました。 結 果: 601人の参加者のうち、50人がプロンプト開発に使用され、残りの551人でLLMと審査者間のCohenの重み付きカッパは0.67で、医療従事者との一致(0.66)と類似していました。LLMは、審査者(平均4.69)や医療従事者(平均4.23)と比較して、平均HEARTスコアが高く(平均5.06)、60日間のMACEに関する診断性能に有意差は見られませんでした(全てp > .05)。 結 論: 言語モデルによる自動リスクスコア計算は、臨床意思決定支援などの介入を促進する可能性がありますが、医師の判断とは体系的な違いがあります。今後の前向き研究が必要です。