MEDICINE & AI

ChatGPTのパフォーマンスに影響を与える質問特性の分析:3000のUSMLE®スタイルの質問に関する研究

カテゴリ:医療現場の業務効率化

公開日:2026年2月19日

タイトル:Analyzing Question Characteristics Influencing ChatGPT's Performance in 3000 USMLE®-Style Questions 雑誌名:Med Sci Educ. 2025 Feb; 35(1): 257-267. 概 要: 本研究は、医療分野における人工知能(AI)および大規模言語モデルであるChatGPTの能力を評価し、USMLE® Step 2CKの質問に対するパフォーマンスを分析しました。3000のテキストベースの質問を用いて、医療専門分野、質問タイプ、難易度に応じたChatGPTの正答率を評価しました。この結果は、質問作成者がAIに対抗する試験問題を開発し、医学生がAIを活用した学習の理解を深めるのに役立つことを目的としています。 方 法: 本研究では、AMBOSS®学習プラットフォームから抽出した3302のUSMLE® Step 2CK練習問題のうち、302の画像ベースの質問を除外し、3000のテキストベースの質問をChatGPTに手動で入力しました。各質問に対する正確性とパフォーマンスを評価しました。 結 果: ChatGPTは全体の57.7%の質問に正しく回答しました。最高のパフォーマンスは「男性生殖系」のカテゴリーで71.7%、最低は「免疫系」で46.3%でした。表形式の質問ではパフォーマンスが低下し、質問の難易度とパフォーマンスには負の相関が見られました(r_s=-0.285, p<0.001)。長い質問は誤答率が高く、正答と誤答の質問の長さには有意差がありました。 結 論: ChatGPTはUSMLE® Step 2CKの合格基準に近い能力を示しましたが、カテゴリー、質問タイプ、難易度によってパフォーマンスが異なりました。この結果は、医療教育者が試験をAIに対抗させるための参考となり、ChatGPTのようなAIツールを教育戦略に統合する際の情報提供に役立ちます。学生にとっては、モデルの限界と能力を理解することが、学習の補助資源としての活用を促進します。この研究は、医療教育および意思決定におけるAIモデルのさらなる改善の必要性を強調しています。