緊急トリアージにおけるLLMベースの生成AIツールの評価:ChatGPT Plus、Copilot Pro、トリアージ看護師の比較研究
カテゴリ:災害・救急医療
公開日:2026年2月19日
タイトル:Evaluating LLM-based generative AI tools in emergency triage: A comparative study of ChatGPT Plus, Copilot Pro, and triage nurses.
雑誌名:Am J Emerg Med. 2025 Mar; 89: 174-181.
概 要:
この研究は、緊急科におけるトリアージ精度向上のために、ChatGPTとCopilotの性能を評価しました。急増する緊急外来訪問に対処するため、これらのAIツールが訓練された医師の精度に匹敵し、EDの混雑の中で人間のバイアスを軽減できるかを検証しました。都市部の高ボリューム病院で行われたこの研究では、トリアージ看護師の判断とAIツールの比較が行われました。
方 法:
この研究は、都市の緊急科で1週間にわたって行われた単一施設の前向き観察研究です。成人患者が24時間のランダムな間隔で登録され、未成年者、外傷例、不完全なデータは除外されました。トリアージ看護師が患者を評価し、救急医学の医師が臨床の概要を記録し、緊急度指数(ESI)を割り当てました。これらの概要はChatGPTとCopilotに提示され、看護師の判断と比較されました。
結 果:
トリアージの全体的な精度は、看護師が65.2%、ChatGPTが66.5%、Copilotが61.8%であり、有意差はありませんでした(p=0.000)。高アキュイティ患者の認識において、ChatGPTとCopilotは看護師を上回りました(それぞれ87.8%および85.7%対32.7%)。看護師はChatGPTおよびCopilotと比較して、患者を過小評価する傾向がありました(p<0.05)。AIツールは年齢、性別、入院時間に関して一貫した精度を示しましたが、看護師は45歳未満の患者を誤ってトリアージする可能性が高かったです。
結 論:
ChatGPTとCopilotは、高アキュイティ患者の特定において従来の看護師トリアージを上回る性能を示しましたが、混雑を防ぎ、高品質な緊急ケアを確保するためには、リアルタイムのED容量データが重要です。