大規模言語モデル生成の放射線学学習教材の実現可能性と心理測定評価:前向きパイロット研究
カテゴリ:医学教育
公開日:2026年6月16日
タイトル:Feasibility and psychometric evaluation of large language model-generated radiology learning materials for board examination preparation: a prospective pilot study.
雑誌名:BMC Med Educ. 2026 Jun 15; doi: 10.1186/s12909-026-09704-8.
概 要:
本研究は、大規模言語モデル(LLM)が生成した放射線学のボード試験準備教材の実現可能性と心理測定特性を評価することを目的としています。41名の放射線科レジデントを対象に、LLMを用いて生成した6,000枚のAnkiフラッシュカード、833枚のインフォグラフィック要約、プレゼンテーションスライドを配布しました。結果として、参加者の保持率は58.5%であり、ボランティアによる採用率は62.5%でした。教育の質は5点満点中3.33と評価され、86.7%が事実誤認を報告しませんでした。
方 法:
この前向き観察パイロット研究では、2026年の韓国放射線ボード試験に向けた41名の放射線科レジデントを対象に実施しました。LLMパイプラインを用いて教材を生成し、参加者の登録率、保持率、ボランティア採用率、適応した認知負荷と満足度の内部一貫性を評価しました。主要評価指標は、認知負荷(ECL)と自己効力感(SE)の変化スコアです。
結 果:
114名の登録候補者のうち44名がリクルートされ、41名が登録されました。保持率は58.5%で、ボランティア採用率は62.5%でした。ECLスケールは許容可能な信頼性を示しましたが、AIに対する信頼スケールは0.583と従来の基準を下回りました。ユーザーの教育の質は3.33と評価され、86.7%が事実誤認を報告しませんでした。
結 論:
保持率58.5%、信頼スケールのα値0.583、-40のネットプロモータースコアは、データ収集プロトコルやAI信頼性の測定、ユーザー体験デザインの修正が必要であることを示しています。運用展開は参加者の登録率とボランティア採用率の面で実現可能でしたが、保持率は満たされませんでした。認知負荷と満足度のスケールは許容可能な信頼性に達しましたが、AIに対する信頼と自己効力感の結果は従来の基準を満たしませんでした。