トリアージ推奨におけるChatGPT Healthのパフォーマンスの構造化テスト
カテゴリ:災害・救急医療
公開日:2026年2月24日
タイトル:ChatGPT Health performance in a structured test of triage recommendations
雑誌名:Nat Med. 2026 Feb 23; doi: 10.1038/s41591-026-04297-7. Epub 2026 Feb 23.
概 要:
本研究は、2026年1月にOpenAIが提供する消費者向け健康ツール「ChatGPT Health」のトリアージ推奨に関する構造化ストレステストを実施しました。60の臨床医が作成した事例を21の臨床領域で16の因子条件の下で評価し、960件の応答を分析しました。パフォーマンスは逆U字型のパターンを示し、最も危険な失敗は非緊急の症状(35%)と緊急事態(48%)に集中しました。特に、糖尿病性ケトアシドーシスや呼吸不全の危機的な症例では、52%が適切にトリアージされず、緊急部門ではなく24-48時間後の評価に誘導されました。家族や友人が症状を軽視すると、トリアージ推奨が大きく変化することが示されました。高リスクの緊急事態の見逃しや危機介入メッセージの不一致な発動が確認され、安全性に関する懸念が生じました。
方 法:
本研究は、60の臨床医が作成した事例を用いた構造化ストレステストで、21の臨床領域にわたる16の因子条件下で960件の応答を評価しました。トリアージのパフォーマンスを分析し、特に緊急事態における適切なトリアージの実施状況を確認しました。
結 果:
トリアージのパフォーマンスは逆U字型のパターンを示し、特に緊急事態では52%が適切にトリアージされませんでした。家族や友人が症状を軽視した場合、トリアージ推奨が大きく変化し、緊急性が低い方向にシフトしました。また、危機介入メッセージは自殺の考えを持つ患者に対して不規則に発動しました。
結 論:
ChatGPT Healthは高リスクの緊急事態を見逃す可能性があり、危機介入メッセージの発動が一貫していないことが明らかになりました。これらの結果は、消費者向けAIトリアージシステムの展開前に前向きな検証が必要であることを示唆しています。