ChatGPT(GPT-4)が救急科医を上回る診断精度を示す:後ろ向き分析
カテゴリ:災害・救急医療
公開日:2026年2月19日
タイトル:ChatGPT With GPT-4 Outperforms Emergency Department Physicians in Diagnostic Accuracy: Retrospective Analysis
雑誌名:J Med Internet Res. 2024 Jul 08; 26: e56110. doi: 10.2196/56110. Epub 2024 Jul 08.
概 要:
本研究は、救急科におけるChatGPTの診断精度を評価し、GPT-3.5およびGPT-4と救急科の研修医の診断精度を比較することを目的としています。100人の成人患者を対象に、EDでの診断を行った研修医とChatGPTの診断を、最終的な入院診断と比較しました。結果として、GPT-4は診断精度において研修医やGPT-3.5を上回ることが示されました。
方 法:
2023年1月に内科的問題で救急科に入院した100人の成人患者を対象に、ED研修医の診断とChatGPT(GPT-3.5およびGPT-4)の診断を、最終的な入院診断と比較し、診断精度を評価しました。診断の正確さはポイントシステムを用いて評価されました。
結 果:
患者の中央値年齢は72歳(IQR 58.5-82.0)で、主に心血管、内分泌、消化器、感染症の問題で入院しました。GPT-4は、内科的緊急事態において、GPT-3.5(P<.001)および研修医(P=.01)を上回る診断精度を示しました。特に心血管疾患(GPT-4対研修医:P=.03)および内分泌・消化器疾患(GPT-4対GPT-3.5:P=.01)で顕著な優位性を示しましたが、他のカテゴリーでは統計的有意差はありませんでした。
結 論:
本研究では、GPT-3.5、GPT-4、およびED研修医の診断精度を入院診断のゴールドスタンダードと比較した結果、GPT-4が研修医およびその前のバージョンであるGPT-3.5を上回ることが示されました。後ろ向きデザインと限られたサンプルサイズにもかかわらず、AIがEDにおける診断支援ツールとしての可能性を示しています。