中国の国家医療ライセンス教育におけるLLMの性能ベンチマーキング:クロスリンガルおよび質問タイプの影響
カテゴリ:医学教育
公開日:2026年4月9日
タイトル:Performance benchmarking of LLMs on Chinese national medical licensing education: Cross-lingual and question-type effects
雑誌名:PLoS One. 2026; 21(4): e0346518. doi: 10.1371/journal.pone.0346518.
概 要:
本研究は、中国の国家医療ライセンス教育における大規模言語モデル(LLM)の精度に対するクロスリンガルおよび質問タイプの影響を探求しています。396の教育質問(198の英中ペア)を抽出し、複数のLLMを用いて回答を生成し、正確性を評価しました。質問タイプは基本知識、ケース分析、統合的判断の3種類に分類され、結果を比較しました。
方 法:
2025年5月13日から20日にかけて実施された横断研究で、396の教育質問が中国の国家医療ライセンス試験から抽出されました。ChatGPT-4o、ChatGPT-o3、Gemini-2.5-pro、Deepseek-V3、Deepseek-R1、Doubao-1.5-proが回答を提供し、正確性を基本知識(タイプA)、ケース分析(タイプB)、統合的判断(タイプC)の3つの質問タイプに対して計算しました。
結 果:
全ての質問タイプおよび言語において、Doubao-1.5-proが92.0%±1.3%の最高精度を達成し、ChatGPT-4oが82.8%±3.7%で最低でした。質問タイプには有意な主効果があり(P=0.0038)、言語には有意な影響がありませんでした(P=0.56)。ポストホックテストでは、タイプAのパフォーマンスがタイプBおよびCを上回ることが確認されました(P<0.01)。Doubao-1.5-pro、Deepseek-R1、Deepseek-V3は、クロスリンガルの安定性が顕著で、正確性の差は5%未満でした。
結 論:
質問タイプは、中国の医療ライセンス試験におけるLLMの性能に影響を与える重要な要因であり、言語の影響は有意ではありませんでした。Doubao-1.5-pro、Deepseek-R1、Deepseek-V3は特に強いクロスリンガルの一貫性を示しました。これらの結果は、中国の医療教育を向上させるための専門的なLLMの潜在的な価値を示唆しています。