医療タスクにおける大規模言語モデルの包括的評価:MedHELMの導入
カテゴリ:医学教育
公開日:2026年3月21日
タイトル:Holistic evaluation of large language models for medical tasks with MedHELM
DOI:10.1038/s41591-025-04151-2
概 要:本研究では、医療ライセンス試験での大規模言語モデル(LLM)の高得点が、実際の臨床実践の複雑さや多様性を十分に反映していないことを指摘し、MedHELMという拡張可能な評価フレームワークを提案します。MedHELMは、臨床意思決定支援、臨床ノート生成、患者コミュニケーション、医療研究、管理の5つのカテゴリーに分類された医療AIアプリケーションのタクソノミーを提供し、日常的な医療実践を反映した121の具体的なタスクを網羅しています。また、37の評価を含む包括的なベンチマークスイートを構築し、9つの最前線のLLMを自動化された評価方法で比較しました。これにより、医療AIシステムの選択におけるエビデンスに基づくアプローチが可能になります。
方 法:本研究は、医療AIアプリケーションを5つのカテゴリーに分類し、37の評価を含むベンチマークスイートを使用して、9つの大規模言語モデル(Claude 3.5 Sonnet、Claude 3.7 Sonnet、DeepSeek R1、Gemini 1.5 Pro、Gemini 2.0 Flash、GPT-4o、GPT-4o mini、Llama 3.3、o3-mini)を比較しました。自動化されたLLM評価方法を用いて、専門家が定義した基準に対してモデル出力を評価しました。
結 果:高度な推論モデル(DeepSeek R1、o3-mini)は66%の勝率を示し、優れた性能を発揮しました。一方、Claude 3.5 Sonnetは、計算コストが15%低いにもかかわらず、同等の結果を達成しました。これらの結果は、現在のモデルの能力を強調するとともに、MedHELMが医療アプリケーションにおける医療AIシステムの選択を支援する可能性を示しています。
結 論:MedHELMは、医療タスクにおける大規模言語モデルの評価を包括的に行うフレームワークであり、医療AIシステムのエビデンスに基づく選択を可能にすることが期待されます。