台湾の伝統中国医学ライセンス試験におけるChatGPT-4のパフォーマンス:横断研究
カテゴリ:医学教育
公開日:2026年2月19日
タイトル:Performance of ChatGPT-4 on Taiwanese Traditional Chinese Medicine Licensing Examinations: Cross-Sectional Study
雑誌名:JMIR Med Educ. 2025 Mar 19; 11: e58897.
概 要:
本研究は、台湾の伝統中国医学(TCM)ライセンス試験におけるChatGPTのパフォーマンスを評価し、TCM関連の質問に対するモデルの説明可能性を検討することを目的としています。AIの統合は医療教育において有望な結果を示していますが、TCM試験におけるその有効性は十分に研究されていません。480の質問に対するChatGPTの回答を分析し、ライセンスを持つTCM医師とのパフォーマンスを比較しました。
方 法:
GPT-4モデルを使用し、2022年のTCMライセンス試験から480の質問に回答しました。モデルのパフォーマンスは、直接的な回答選択と回答選択前の説明提供の2つのアプローチで評価されました。AI生成の回答の正確性と一貫性を分析し、質問の特性を認知レベル、知識の深さ、質問の種類、ビネットスタイル、質問の極性に基づいて分類しました。
結 果:
ChatGPTは全体で43.9%の正確性を達成し、2人の人間参加者(70%および78.4%)よりも低い結果となりました。モデルの正確性と質問の特性との間に有意な相関は見られませんでした。詳細な分析では、誤りの主な原因はTCMの概念の誤解(55.3%)であり、モデルのTCM知識ベースと推論能力の限界を強調しています。
結 論:
ChatGPTは教育ツールとしての可能性を示していますが、TCMライセンス試験における現在のパフォーマンスは不十分です。これは、専門的なTCMトレーニングを施したAIモデルの強化の必要性を示唆しており、TCM教育におけるAIの利用には慎重なアプローチが求められます。今後の研究は、モデルの改善とTCM学習を支援するための特化した教育アプリケーションの開発に焦点を当てるべきです。