MEDICINE & AI

GPT-3人工知能モデルの診断およびトリアージ精度:観察研究

カテゴリ:災害・救急医療

公開日:2026年2月19日

タイトル:The diagnostic and triage accuracy of the GPT-3 artificial intelligence model: an observational study. 雑誌名:Lancet Digit Health. 2024 Aug; 6(8): e555-e561. 概 要: 本研究は、一般的なAI言語モデルであるGPT-3の診断およびトリアージ能力を、米国の一般人5000人およびハーバード医科大学の医師21人と比較しました。48の合成症例を用いて、GPT-3は88%の正確性で診断を行い、トリアージでは70%の正確性を示しました。GPT-3の診断精度は医師に近いものの、トリアージでは医師に劣り、一般人と同程度でした。これにより、GPT-3は医療現場での利用可能性が示唆されます。 方 法: 本研究は、48の合成症例を用いた観察研究で、GPT-3の診断およびトリアージ精度を評価しました。症例は、緊急、1日以内、1週間以内、自己管理の4つのトリアージカテゴリに分類され、正しい診断はハーバード医科大学の内科医2人によって決定されました。GPT-3と人間の回答者は、診断の可能性をリストアップし、正確なトリアージを評価しました。Brierスコアを用いてGPT-3の信頼性を測定しました。 結 果: GPT-3は、診断において88%の正確性を示し、一般人の54%および医師の96%と比較されました。トリアージでは70%の正確性を示し、一般人の74%および医師の91%に対して劣りました。GPT-3の診断信頼性はBrierスコア0.18、トリアージは0.22であり、ケースの重症度が上がるにつれて精度が低下する傾向が見られました。 結 論: GPT-3は、医師に近い診断精度を示しましたが、トリアージにおいては医師に劣り、一般人と同程度の精度でした。この結果は、GPT-3が医療現場での補助ツールとしての可能性を持つことを示唆していますが、特にトリアージにおいては注意が必要です。