臨床意思決定における生成事前学習トランスフォーマー(GPT)の評価:GPT-3.5とGPT-4の比較分析
カテゴリ:災害・救急医療
公開日:2026年2月19日
タイトル:Assessing Generative Pretrained Transformers (GPT) in Clinical Decision-Making: Comparative Analysis of GPT-3.5 and GPT-4
雑誌名:J Med Internet Res. 2024 Jun 27; 26: e54571.
概 要:
本研究は、ChatGPT-3.5とChatGPT-4が複雑な臨床および倫理的ジレンマに対処する能力を分析し、医療意思決定におけるそれらの潜在的役割を示すことを目的としています。176の実世界の臨床質問が4人の専門医によって作成され、8人の上級医師と研修医がGPT-3.5とGPT-4の応答を評価しました。評価は、正確性、関連性、明確性、有用性、包括性の5つのカテゴリーで行われました。
方 法:
この研究は、176の臨床質問を4人の専門医が作成し、8人の上級医師と研修医がGPT-3.5とGPT-4の応答を1-5のスケールで評価しました。評価は内科、救急医療、倫理の分野で行われ、評価基準は正確性、関連性、明確性、有用性、包括性の5つのカテゴリーに分かれています。
結 果:
GPT-4は平均スコア4.4(SD 0.8)、GPT-3.5は4.1(SD 1.0)を獲得し、全ての評価基準でGPT-4がGPT-3.5を上回りました。上級医師は両モデルに対して一貫して高い評価を与え、特に倫理的な質問に対する評価が高かったです。GPT-4は、緊急、内科、倫理の質問において、包括性の面で特に高いスコアを示しました。
結 論:
ChatGPTは医師の診断や治療、倫理的問題に対する支援の可能性を示しており、臨床業務に統合することで価値を提供する可能性がありますが、人間の専門知識を補完するものであるべきです。安全で効果的な実装を確保するためには、さらなる研究が必要です。