泌尿器科の能力評価のためのAI生成質問:前向き教育研究
カテゴリ:医学教育
公開日:2026年2月19日
タイトル:AI-generated questions for urological competency assessment: a prospective educational study
雑誌名:BMC Med Educ. 2025 Apr 25; 25(1): 611. doi: 10.1186/s12909-025-07202-x. Epub 2025 Apr 25.
概 要:
本研究は、医療教育におけるAIの統合が未開拓である中、泌尿器科の専門的評価におけるAI生成の質問の有効性を評価しました。従来の質問作成方法は時間がかかり、進化する医療知識に追いつくのが難しいため、AIによる300の選択肢問題を生成し、経験豊富な泌尿器科医によって評価しました。最終的に100の質問が検証され、医学生の能力評価に用いられました。
方 法:
ChatGPTとGeminiという2つのAI言語モデルが、6つの泌尿器科サブスペシャリティにわたる300の選択肢問題を生成しました。7人の経験豊富な泌尿器科医が、修正されたデルファイ法を用いて質問を評価し、技術的正確性、臨床的関連性、構成妥当性、回転目標との整合性を基準にしました。合意が得られた質問が選定されました。
結 果:
45人の対象者のうち42人が全ての評価を完了し(完了率93.3%)、パフォーマンスは基準値(平均45.2%)から中間評価(平均62.8%)、最終評価(平均78.4%)へと有意に改善しました。AIプラットフォーム間での技術的正確性は同等でした(ChatGPT: 84.3%、Gemini: 83.8%)。臨床シナリオの質問は、記憶に基づく質問よりも優れた識別能力を示しました。
結 論:
AI生成の質問は、泌尿器科の臨床能力評価において適切な技術的正確性と難易度を示しました。特に臨床シナリオにおいて有望ですが、高リスクのテストにおいては慎重な考慮が必要です。臨床経験とパフォーマンス向上の強い相関が、知識習得の測定における有効性を裏付けています。AI生成の質問の専門的評価への統合の可能性が支持されますが、専門家の監視と継続的な検証が重要です。