MEDICINE & AI

ChatGPTは非外傷性胸痛患者のリスク層別化において一貫性を欠く

カテゴリ:医学教育

公開日:2026年2月19日

タイトル:ChatGPT provides inconsistent risk-stratification of patients with atraumatic chest pain. 雑誌名:PloS One. 2024; 19(4): e0301854. 概 要: 本研究は、ChatGPT-4が非外傷性胸痛患者のリスク層別化においてどの程度の一貫性を持つかを評価しました。TIMIスコアおよびHEARTスコアと比較し、ChatGPT-4のリスク評価の信頼性を検証しました。3つのシミュレーションデータセットを用いて、ChatGPT-4のリスクスコアを計算し、従来のツールとの相関を調査しました。結果として、ChatGPT-4は平均スコアにおいては高い相関を示しましたが、個々のリスク評価の一貫性には問題がありました。 方 法: 3つのシミュレーションデータセットを作成しました。1つはTIMIスコアの変数に基づき、もう1つはHEARTスコアの変数、最後の1つは非外傷性胸痛に関連する44の無作為変数から構成されました。ChatGPT-4は各データセットを独立して5回評価し、そのリスクスコアを計算されたTIMIおよびHEARTスコアと比較しました。 結 果: ChatGPT-4はTIMIスコアおよびHEARTスコアと高い相関を示しました(r = 0.898および0.928)。しかし、固定されたTIMIまたはHEARTスコアに対して、リスク評価が45-48%の確率で異なる結果を示しました。44変数モデルでは、5つのChatGPT-4モデルの診断カテゴリーの一致率は56%にとどまり、リスクスコアの相関は低かった(r = 0.605)。 結 論: ChatGPT-4は平均スコアにおいては確立されたリスク層別化ツールと密接に相関していますが、同一患者データに対する評価の一貫性の欠如は信頼性に疑問を投げかけます。大規模言語モデルは医療応用の可能性を秘めていますが、特に非外傷性胸痛患者の臨床リスク評価においてはさらなる改良とカスタマイズが必要です。