MEDICINE & AI

人間の知能とChat-GPT:トリアージにおける患者分類の正確性はどちらが優れているか?

カテゴリ:災害・救急医療

公開日:2026年2月19日

タイトル:Human intelligence versus Chat-GPT: who performs better in correctly classifying patients in triage? 雑誌名:Am J Emerg Med. 2024 May; 79: 44-47. 概 要: 本研究は、緊急部門におけるトリアージ評価中の患者のリスク層別化において、医療従事者とChat-GPTの一致度を比較しました。30の実際の臨床ケースから再現したビネットを用いて、トリアージ看護師とChat-GPTのリスク層別化の一致度を評価しました。結果、トリアージ看護師の方が高い一致度を示し、特に72時間以内の死亡率において顕著な差が見られました。Chat-GPTの信頼性は現時点では不十分であり、さらなる開発が必要です。 方 法: 本研究は、実際の臨床ケースから再現した30のビネットを用いた比較研究です。トリアージ看護師とChat-GPTのリスク層別化の一致度はCohenのカッパを用いて評価し、パフォーマンスは受信者動作特性曲線(AUROC)で評価しました。主要な評価指標には、72時間以内の死亡、入院の必要性、重篤または時間依存の状態の有無を含めました。 結 果: トリアージ看護師とChat-GPTのトリアージコードの一致度は0.278(未重みCohenのカッパ;95%信頼区間:0.231-0.388)でした。全ての評価指標において、ROC値はトリアージ看護師の方が高く、特に72時間以内の死亡率において看護師はAUROC 0.910(0.757-1.000)を示し、Chat-GPTは0.669(0.153-1.000)でした。 結 論: Chat-GPTの現在の信頼性は、緊急部門の患者の優先順位付けにおいてトリアージ看護師の専門知識の有効な代替とは言えません。リスク層別化の安全性と効果を高めるためには、さらなる開発が必要です。