MEDICINE & AI

医療教育におけるAIと人間生成の選択肢問題の比較:高リスク試験におけるコホート研究

カテゴリ:医療現場の業務効率化

公開日:2026年2月19日

タイトル:AI versus human-generated multiple-choice questions for medical education: a cohort study in a high-stakes examination. 雑誌名:BMC Med Educ. 2025 Feb 08; 25(1): 208. doi: 10.1186/s12909-025-06796-6. Epub 2025 Feb 08. 概 要: 本研究は、高品質な選択肢問題(MCQs)の作成が医療教育評価において重要であるが、専門家による作成はリソースを多く消費し時間がかかることを背景に、ChatGPT-4oが生成したMCQsの質と心理測定特性を人間が作成したMCQsと比較することを目的としています。2024年8月に香港緊急医学大学院が主催する試験に向けて準備中の医師24名を対象に、AI生成と人間生成の2セットのMCQsを実施し、専門家による評価を行いました。 方 法: 前向きコホート研究を実施し、参加者はAI生成と人間生成の各100問のMCQsに挑戦しました。専門家がMCQsの事実の正確性、関連性、難易度、ブルームの分類との整合性、問題作成の欠陥を評価しました。心理測定分析として、難易度や識別指数、KR-20信頼性を評価し、候補者のパフォーマンスと時間効率も評価しました。 結 果: 24名の参加者の結果、AI生成のMCQsは人間生成のものよりも難易度が低く(平均難易度指数0.78 vs. 0.69, p<0.01)、識別指数は類似していました(平均0.22 vs. 0.26)。専門家レビューでは、AI MCQsにおいて事実の不正確さ(6% vs. 4%)、関連性の欠如(6% vs. 0%)、不適切な難易度(14% vs. 1%)が多く指摘されました。AIによる問題は主に低次の認知スキルを評価し、人間生成のMCQsは高次のスキルをより良く評価しました(χ² = 14.27, p=0.003)。AIは問題生成にかかる時間を大幅に短縮しました(24.5 vs. 96人時)。 結 論: ChatGPT-4oはMCQsを効率的に生成する可能性を示しましたが、複雑な評価には深みが欠けています。質を確保するためには人間のレビューが不可欠です。AIの効率性と専門家の監視を組み合わせることで、高リスク試験のための問題作成を最適化し、医療教育における時間効率と内容の質のバランスを取るスケーラブルなモデルを提供できる可能性があります。