AI生成の単一最良解答問題の品質保証と妥当性
カテゴリ:医学教育
公開日:2026年2月19日
タイトル:Quality assurance and validity of AI-generated single best answer questions.
雑誌名:BMC Med Educ. 2025 Feb 25; 25(1): 300. doi: 10.1186/s12909-025-06881-w.
概 要:
本研究は、生成的人工知能(AI)が医療教育における評価問題バンクの枯渇に対処できるかを評価することを目的としています。特に、Covid時代におけるオープンブック試験の普及により、この課題は深刻化しています。研究では、商業的に利用可能なAI大規模言語モデル(LLM)であるOpenAI GPT-4を使用し、220の単一最良解答(SBA)問題を生成しました。これらの問題は、専門家パネルによって正確性と品質が評価され、最終的に50のAI生成問題と50の人間作成問題を用いて、スコットランドの大学院医学プログラム(ScotGEM)の学生向けの形成的試験を作成しました。AI生成問題は、69%がほとんど修正なしで試験に適合し、31%は事実誤認や学習内容との不一致により却下されました。
方 法:
この研究は、商業的に利用可能なAI大規模言語モデルを用いたコホート研究です。220のSBA問題を生成し、専門家パネルによる評価を受けました。最終的に、50のAI生成問題と50の人間作成問題を用いて、スコットランドの大学院医学プログラムの学生向けに形成的試験を実施しました。試験は、Speedwell eSystemを通じてオンラインで実施され、施設指数と識別指数を主要評価指標として評価しました。
結 果:
AI生成のSBA問題の69%が試験に適合し、31%は事実誤認や学習内容との不一致により却下されました。試験実施後の統計分析では、AI生成問題と人間作成問題の間に、施設指数および識別指数において有意差は見られませんでした。
結 論:
AI LLMは、最良の実践ガイドラインおよび特定の学習成果に沿ったSBA問題を生成できる可能性が示されました。しかし、誤った問題を特定し却下するための堅牢な品質保証プロセスが必要です。この研究から得られた知見は、AIによるカリキュラムに沿った問題生成の信頼性向上に向けたさらなる調査の基盤を提供します。AIは、医療教育における伝統的な問題生成方法を補完する有望な手段となるでしょう。