人工知能支援による自動短答式問題採点ツールは人間の採点者の採点と高い相関を示す
カテゴリ:医学教育
公開日:2026年2月19日
タイトル:Artificial intelligence assisted automated short answer question scoring tool shows high correlation with human examiner markings
雑誌名:BMC Med Educ. 2025 Aug 05; 25(1): 1146.
概 要:
この研究は、医学生が短答式問題(SAQ)に回答するスキルを最適化し、個別のフィードバックを提供するための自動SAQ採点ツール(ASST)を人工知能(AI)を用いて開発することを目的としています。学生数の増加やスタッフ不足により、従来の採点が困難になっているため、AIを活用した自動採点が求められています。具体的には、システマティックファーマコロジーコースの短答式問題を対象に、AIが学生の回答を評価し、フィードバックを提供する方法を検討しました。
方 法:
この研究では、大規模言語モデル(LLM)を用いて自動SAQ採点を行い、採点基準に基づいて学生の回答を評価しました。LLMは、モデル回答と採点基準を基に学生の回答を分析し、重要な部分を抽出してスコアを付け、フィードバックを提供しました。評価プロセスはGPT-4に依存し、最終スコアは5回のサンプリング結果の平均で決定されました。人間の採点者も同じ回答を採点し、その結果を比較して相関を測定しました。
結 果:
30人の学生の回答に対する自動採点スコアは、人間の採点者の採点と高い相関を示し(相関係数0.93および0.96)、また、内因性相関係数は0.94であり、LLMと人間の採点者間の優れた評価者間信頼性を示しました。
結 論:
AI支援の自動SAQ採点ツールは、人間の採点者の採点と高い相関を示し、透明で柔軟な自動採点と詳細なフィードバックを提供する可能性があります。この基準に基づく評価アプローチは、教育において貴重な応用が期待され、教員の採点負担を軽減し、学生に対してより具体的で実行可能なフィードバックを提供することができます。