MEDICINE & AI

回答は多様である:大規模言語モデルの応答パターンがテスト項目分析における使用を挑戦する

カテゴリ:医療現場の業務効率化

公開日:2026年2月19日

タイトル:The answer may vary: large language model response patterns challenge their use in test item analysis 雑誌名:Med Teach. 2025 Nov; 47(11): 1761-1766. doi: 10.1080/0142159X.2025.2497891. Epub 2025 May 04. 概 要: 本研究は、選択肢問題(MCQ)の評価において、大規模言語モデル(LLM)が問題の難易度や点バイセリアル指数を予測できるかを調査しました。従来の方法では、テスト集団に対する実施が必要であり、リソースを多く消費します。LLMがこれらの指標を予測できれば、事前分析の必要性を軽減できる可能性があります。 方 法: 麻酔学の専門家が作成した60のMCQを、5つの異なるLLM(ChatGPT-4o、o1-preview、Claude 3.5 Sonnet、Grok-2、Llama 3.2)と臨床フェローにそれぞれ100回提示しました。応答パターンを分析し、難易度指数(正答率)と点バイセリアル指数(項目-テストスコアの相関)を計算しました。スピアマンの相関係数を用いて、LLMとフェロー間の難易度および点バイセリアル指数を比較しました。 結 果: LLM間で応答パターンに顕著な違いが見られ、ChatGPT-4o、o1-preview、Grok-2は試行ごとに変動する応答を示しましたが、Claude 3.5 SonnetとLlama 3.2は一貫した応答を示しました。LLMはフェローよりも高い平均スコア(58%から85%)を示し、フェローは57%でした。3つのLLMはフェローの難易度指数との相関が弱く(r = 0.28-0.29)、最高得点の2つのモデルは相関を示しませんでした。点バイセリアル指数を予測できたLLMはありませんでした。 結 論: LLMはMCQのパフォーマンス指標を予測する上で限られた有用性を持つことが示唆されました。特に、高得点のモデルは人間のパフォーマンスとの相関が低く、モデルが強力になるほど人間のパフォーマンスを予測する能力が低下する可能性があります。LLMの応答パターンの一貫性を理解することは、研究方法論やテスト開発の実用的な応用において重要です。今後の研究では、項目特性の予測ではなく、全体的な評価の最適化に向けたLLMの言語処理能力の活用に焦点を当てるべきです。