大規模言語モデルによる臨床 vignette と選択肢問題の大学院医学教育への応用
カテゴリ:医学教育
公開日:2026年2月19日
タイトル:Large Language Model Clinical Vignettes and Multiple-Choice Questions for Postgraduate Medical Education
雑誌名:Acad Med. 2025 Oct 01; 100(10): 1163-1166.
概 要:
本研究は、臨床 vignette に基づく選択肢問題(MCQs)の作成に大規模言語モデル(AI)を活用する可能性を探ります。従来の方法では多大な時間と労力が必要ですが、AIを用いることで効率化が期待されます。ChatGPT-4を用いたプロンプトエンジニアリング技術を駆使し、産婦人科のレジデント向けに臨床 vignette とMCQsを生成しました。レジデントと指導医が人間とAI生成のコンテンツを区別できるかどうかを評価しました。
方 法:
著者は、権威ある文書を取り入れた構造化プロンプトエンジニアリングアプローチを用いてMCQsを生成しました。50の人間生成と50のAI生成のMCQsをランダムに配置し、10のクイズ(各10問)を作成しました。調査は2024年9月に行われ、北ウェルヘルスまたはホフストラ大学の医学校の産婦人科レジデントと指導医がオンライン調査に参加し、各MCQの著者を人間またはAIと判断しました。
結 果:
33名の参加者(16名のレジデント、17名の指導医)が調査に回答し、応答率は80.5%でした。参加者はMCQの著者を正しく特定できた割合は中央値39.1%であり、人間とAI生成の質問を区別するのが難しいことを示しました。人間生成のMCQsの正答率は中央値62.3%、AI生成のMCQsは64.4%であり、両者に有意差はありませんでした(P = .74)。難易度や識別指数においても有意差は見られず、大規模言語モデル生成のMCQsが医学教育において実用的であることが支持されました。
結 論:
今後の研究では、AI生成コンテンツと専門家レビューの最適なバランスを探り、効率を最大化しつつ正確性を損なわない戦略を特定する必要があります。著者は実践試験を開発し、その予測妥当性を標準化試験結果と比較して評価する予定です。