MEDICINE & AI

生化学教育における大規模言語モデルの性能比較評価

カテゴリ:医学教育

公開日:2026年2月19日

タイトル:Large Language Models in Biochemistry Education: Comparative Evaluation of Performance 雑誌名:JMIR Med Educ. 2025 Apr 10; 11: e67244. doi: 10.2196/67244. Epub 2025 Apr 10. 概 要: 本研究は、最新の大規模言語モデル(LLMs)であるClaude(Anthropic)、GPT-4(OpenAI)、Gemini(Google)、Copilot(Microsoft)の性能を、医学生の生化学コースの学業成績と比較することを目的としています。200のUSMLEスタイルの多肢選択問題を用いて、各チャットボットの正答率を評価しました。結果は、チャットボットが医学生の成績を8.3%上回ることが示され、特にClaudeが最も高い正答率を示しました。この結果は、医療教育におけるAIの可能性を示唆しています。 方 法: 本研究では、200のUSMLEスタイルの多肢選択問題を使用し、23の異なるトピックにわたる問題を評価しました。表や画像を含む問題は除外しました。Claude 3.5 Sonnet、GPT-4-1106、Gemini 1.5 Flash、Copilotの5回の回答結果を基に、正確性を評価しました。データの基本統計はStatistica 13.5.0.17を使用し、カイ二乗検定を用いてチャットボット間の結果を比較しました。 結 果: 選択したチャットボットは平均81.1%(SD 12.8%)の正答率を示し、医学生の成績を8.3%上回りました。Claudeは92.5%(185/200)の正答率を示し、次いでGPT-4が85%(170/200)、Geminiが78.5%(157/200)、Copilotが64%(128/200)でした。特に、エイコサノイドや生体エネルギー学などのトピックで高い正答率を示しました。 結 論: 異なるAIモデルは特定の医療分野において独自の強みを持つ可能性があり、生化学コースでのターゲットサポートに活用できることが示唆されました。この性能は、医療教育と評価におけるAIの可能性を強調しています。