GPT-4と人間の初心者および専門家による臨床的に複雑なMCQの心理測定特性の比較
カテゴリ:医学教育
公開日:2026年2月19日
タイトル:A comparison of the psychometric properties of GPT-4 versus human novice and expert authors of clinically complex MCQs in a mock examination of Australian medical students.
雑誌名:Med Teach. 2026 Jan; 48(1): 74-84.
概 要:
本研究は、医療評価のための臨床的に複雑な選択式問題(MCQ)を作成する際に、GPT-4などの大規模言語モデルが有用なツールとなる可能性を探ります。AI生成のMCQの心理測定特性を評価することは、質の確保に不可欠です。120項目の模擬試験を構築し、初心者、専門家、AIの各レベルから生成された問題を比較しました。
方 法:
120項目の模擬試験を作成し、初心者レベルの人間生成MCQ40項目、専門家レベル40項目、AI生成MCQ40項目を含めました。すべての試験項目はパネルレビューを受け、高次の認知スキルをテストし、最低限の基準を満たすことを確認しました。オーストラリアの医学生に対してオンライン模擬試験を実施し、受験者は各項目の著者を知らされませんでした。
結 果:
234人の医学生が試験を完了しました。分析の結果、信頼性は許容範囲内(Cronbachのα=0.836)であり、AI、初心者、専門家の項目間での難易度や識別力に差は見られませんでした。全グループの平均項目難易度は「易しい」、平均識別力は「公平」となりました。AI項目の選択肢の効率は39%で、初心者項目の55%(p=0.035)に比べて低く、専門家項目の48%(p=0.382)とは差がありませんでした。
結 論:
AI生成のMCQの心理測定特性は、初心者および専門家による人間生成のMCQと同等であることが示されました。すべての著者グループにおいて項目の質を向上させる余地があり、AI生成の項目は選択肢の効率を高めるために人間によるレビューを受けるべきです。