MEDICINE & AI

医療教育における人工知能の役割:トルコ医療専門研修入試における大規模言語モデル(LLMs)の評価

カテゴリ:医学教育

公開日:2026年2月19日

タイトル:The role of artificial intelligence in medical education: an evaluation of Large Language Models (LLMs) on the Turkish Medical Specialty Training Entrance Exam. 雑誌名:BMC Med Educ. 2025 Apr 25; 25(1): 609. doi: 10.1186/s12909-025-07148-0. Epub 2025 Apr 25. 概 要: 本研究は、トルコ医療専門研修入試の問題に対する大規模言語モデル(LLMs)の性能を評価し、英語以外の言語におけるユーザーの解釈可能性を分析することを目的としています。2021年の試験から240問を選び、ChatGPT 4、Gemini 1.5 Pro、Cohere-Command R+、Llama 3 70Bの4つのモデルに対してトルコ語で提示し、公式の回答と照らし合わせて評価しました。 方 法: 2021年3月21日に実施されたトルコ医療専門研修入試の基礎医学および臨床医学の試験から240問を使用しました。これらの質問はトルコ語でLLMsに提示され、回答は学生選抜および配置センターが発表した公式回答に基づいて評価されました。 結 果: ChatGPT 4は全体的な正答率88.75%で最も優れた性能を示しました。次いでLlama 3 70Bが79.17%、Gemini 1.5 Proが78.13%、Command R+は50%の正答率でした。ChatGPT 4は基礎医学および臨床医学の問題において強みを発揮し、難易度の高い問題でも高い正答率を維持しました。 結 論: GPT-4とLlama 3 70Bはトルコ医療専門研修入試で満足のいく結果を示し、英語以外の言語における基礎医学および臨床医学の知識の安全な情報源としての可能性を示しました。これらのLLMsは、非英語圏における医療教育や臨床支援において貴重なリソースとなる可能性があります。一方で、Gemini 1.5 ProとCommand R+は改善の余地が大きく、最良のモデルと競うためにはさらなる向上が必要です。