MEDICINE & AI

MSTテスト条件下におけるAI生成の生化学テスト項目パラメータ

カテゴリ:医学教育

公開日:2026年2月19日

タイトル:AI-generated biochemistry test item parameters in MST test conditions 雑誌名:BMC Med Educ. 2025 Dec 22; 25(1): 1705. 概 要: 本研究は、ChatGPT 4oが医療評価項目の難易度を正確に推定できるかを検討し、その予測を多段階テストシミュレーションから得られた実証的パラメータと比較しました。研究者は、ChatGPT 4oに80の選択式生化学問題を生成させ、5,000人の仮想受験者に対してシミュレーションを通じて実施しました。結果、AI生成の難易度パラメータとシミュレーション由来のパラメータとの間に中程度の一致が見られましたが、AIは系統的に項目の難易度を過大評価していました。 方 法: ハイブリッドシミュレーション検証デザインを用いて、ChatGPT 4oが生成した80の選択式生化学問題を5,000人の仮想受験者に対して多段階テストシミュレーションで実施しました。難易度推定(b-パラメータ)を比較し、AIの推定値とシミュレーションから得られたパラメータの一致度を分析しました。 結 果: AI生成の難易度パラメータとシミュレーション由来のパラメータとの間に中程度の相関(r = 0.612)が見られましたが、ChatGPTは項目の難易度を過大評価し、平均バイアスは0.240でした。平均絶対誤差は0.447であり、91%の項目が誤差1.0 logits未満でしたが、非常に簡単な項目では83%が0.5 logitsを超える誤差を示しました。 結 論: ChatGPT 4oは医療教育評価における初期項目生成ツールとしての可能性を示しましたが、実際のパフォーマンスフィードバックが不足しているため、実施前に実証的なキャリブレーションと専門家の監視が必要です。また、シミュレーションに基づく検証に依存しているため、厳密な心理測定の検証が求められます。