MEDICINE & AI

世界の医療試験における大規模言語モデル:プラットフォームの開発と包括的分析

カテゴリ:医療現場の業務効率化

公開日:2026年2月19日

タイトル:Large Language Models in Worldwide Medical Exams: Platform Development and Comprehensive Analysis 雑誌名:J Med Internet Res. 2024 Dec 27; 26: e66114. doi: 10.2196/66114. Epub 2024 Dec 27. 概 要: 本研究は、医療教育における大規模言語モデル(LLM)の性能を世界中の医療試験で系統的に評価するためのプラットフォーム「MedExamLLM」を紹介します。このプラットフォームは、さまざまなLLMの性能データを収集・整理し、地域、言語、文脈におけるLLMの能力の傾向や格差を分析し、研究者や教育者、開発者が人工知能の医療教育への統合を探求・推進するためのリソースを提供します。 方 法: 2024年4月25日にPubMedデータベースで関連文献を系統的に検索し、医療試験におけるLLMを評価した英語の査読済み原著論文を対象としました。193件の論文が最終分析に含まれ、MedExamLLMプラットフォームには、2009年から2023年までの28カ国、15言語で実施された198の医療試験に関する16のLLMの情報が統合されました。 結 果: アメリカ合衆国が最も多くの医療試験と関連出版物を占め、英語が主な言語として使用されていました。特にGPT-4を含む生成型事前学習トランスフォーマー(GPT)シリーズモデルは、他のLLMよりも高い合格率を示しました。また、地理的および言語的文脈によるLLMの能力の大きな変動が明らかになりました。 結 論: MedExamLLMは、世界中の医療試験におけるLLMの性能評価情報を提供するオープンソースのプラットフォームです。このプラットフォームは、臨床医学と人工知能の分野における教育者、研究者、開発者にとって貴重なリソースとなります。今後の研究では、データソースの偏りや非英語文献の除外といった限界を克服し、さまざまな文脈でのLLMの性能向上を探求する必要があります。