MEDICINE & AI

チャットボットによる医学部生評価のための単一最良解答問題生成の役割:比較分析

カテゴリ:医学教育

公開日:2026年2月19日

タイトル:Chatbots' Role in Generating Single Best Answer Questions for Undergraduate Medical Student Assessment: Comparative Analysis 雑誌名:JMIR Med Educ. 2025 May 30; 11: e69521. doi: 10.2196/69521. Epub 2025 May 30. 概 要: この研究は、異なるAIチャットボットが医学部生向けの単一最良解答(SBA)問題を作成する際の内容の妥当性と一貫性を検討することを目的としています。プログラム評価は柔軟な学習を支援しますが、教育者は異なる能力を反映した頻繁な評価を開発する必要があります。AI技術の導入がこの課題に対処する試みがなされていますが、生成された情報の妥当性が懸念されています。 方 法: この研究は3つのステップで実施されました。まず、3人の研究者が統一されたプロンプトスクリプトを使用して4つのチャットボットプラットフォームで10のSBA問題を生成しました。次に、評価者がチャットボットの出力の一貫性を評価しました。最後に、7人の評価者が研究チームが開発した評価スケールを用いて科学的正確性と教育的質を評価しました。 結 果: すべてのチャットボットは各10問を生成しましたが、Bingは1つのプロンプトに応答できませんでした。ChatGPT-4は質問生成の変動が最も大きかったものの、「カバーテスト」を完全には満たしませんでした。Geminiは評価基準のほとんどで良好な結果を示しましたが、アイテムバランスに欠け、回答に対して特定の選択肢を好む傾向がありました。Bingは内容の明確さや全体的な妥当性で低いスコアを示しました。2-way ANOVAではチャットボット間に統計的に有意な差が認められましたが、Tukey-Kramer HSDテストでは個々のチャットボット間に有意な差は見られませんでした。 結 論: AIチャットボットは学習目標に沿った問題の生成を支援できる可能性があり、各チャットボットにはそれぞれの強みと弱みがあります。しかし、使用に際しては専門家による評価が必要です。AIを用いたSBA生成は、創造を認知の最高レベルと位置付けるブルームのタキソノミーの再考を促します。