多発性硬化症に関連する医療質問に対する大規模言語モデルの性能評価:ChatGPT、Gemini、Grok、Copilotのケーススタディ
カテゴリ:公衆衛生・予防医療
公開日:2026年5月12日
タイトル:Evaluation of the performance of large language models in responding to medical questions related to multiple sclerosis: A case study of large language models including ChatGPT, Gemini, Grok and Copilot.
雑誌名:PLoS One. 2026; 21(5): e0346445. doi: 10.1371/journal.pone.0346445.
概 要:
本研究は、ChatGPT、Gemini、Copilot、Grokの4つの公開されている大規模言語モデルが、多発性硬化症に関連する医療質問に対してどのように応答するかを評価し、比較することを目的としています。特に、正確性、透明性、臨床的実行可能性に焦点を当てています。25の質問を作成し、各モデルの応答を評価しました。
方 法:
4つの大規模言語モデル(ChatGPT、Gemini、Grok、Copilot)を選定し、診断、治療、予防、病気管理、病気制御の5つの主要領域に関してそれぞれ5つの質問を作成しました。モデルが生成した応答は、DISCERN-AIおよびNLAT-AI評価ツールを用いて評価されました。
結 果:
評価の結果、Geminiが全体的な品質で最も高いスコアを示し、関連性、透明性、バランス、不確実性の認識において優れていました。Grokは2位で、一般的にバランスの取れた結果を示しました。ChatGPTは強いパフォーマンスを示しましたが、一部の脆弱な集団に対する内容に弱点がありました。Copilotは全体的に最も低いパフォーマンスを示しました。
結 論:
Geminiは全領域で最も強力で一貫したパフォーマンスを示し、次いでGrokがバランスの取れた結果を示しました。ChatGPTは強いが不均一な結果を示し、脆弱な集団への対応に弱点がありました。Copilotは一貫して低いスコアを示しました。これらの結果は、多発性硬化症に関する正確で臨床的に関連する応答を生成する際の大規模言語モデル間の重要な違いを浮き彫りにし、医療応用における各モデルの強みと限界を考慮する重要性を強調しています。