MEDICINE & AI

医療教育における評価の未来はAIか?OSCEにおけるAIと人間の評価の比較

カテゴリ:医学教育

公開日:2026年2月19日

タイトル:Is AI the future of evaluation in medical education? AI vs. human evaluation in objective structured clinical examination. 雑誌名:BMC Med Educ. 2025 May 01; 25(1): 641. doi: 10.1186/s12909-025-07241-4. Epub 2025 May 01. 概 要: 本研究は、医療教育における客観的構造化臨床試験(OSCE)において、学生の臨床スキルを評価する際の人間とAI評価者の一貫性を探求することを目的としています。トルコの州立大学で行われた横断研究では、1年生から3年生の医学生196人を対象に、筋肉内注射、結び目の結び方、基本的な救命処置、尿カテーテル挿入の4つの臨床スキルが評価されました。評価は、リアルタイムの人間評価者、2人のビデオベースの専門家評価者、2つのAIシステム(ChatGPT-4oおよびGemini Flash 1.5)によって行われました。 方 法: この研究は、トルコの州立大学で行われた横断研究で、1年生から3年生の医学生196人を対象としました。評価されたスキルは、筋肉内注射、結び目の結び方、基本的な救命処置、尿カテーテル挿入の4つです。学生のパフォーマンスはビデオ録画され、5人の評価者によって評価されました。データは標準化されたチェックリストに基づいて収集され、統計的手法を用いて評価者間の一貫性が分析されました。 結 果: AIモデルは、すべてのスキルにおいて人間評価者よりも一貫して高いスコアを付けました。筋肉内注射ではAIの平均スコアが28.23で、人間は25.25でした。結び目の結び方ではAIが16.07、人間が10.44でした。基本的な救命処置ではAIが17.05、人間が16.48でした。尿カテーテル挿入ではAIが26.68、人間が27.02と類似しましたが、個々の基準には大きなばらつきが見られました。視覚的に観察可能なステップに対する評価者間の一貫性は高かった一方で、聴覚的タスクではAIと人間の評価者間に大きな差異が見られました。 結 論: AIは、特に視覚的な臨床スキルのOSCE評価において補完的なツールとしての可能性を示しています。しかし、その信頼性は評価されるスキルの知覚的要求に依存しており、言語コミュニケーションや聴覚的手がかりを必要とするスキルの正確な評価にはさらなる改良が必要です。