臨床研究質問に対する大規模言語モデルの精度:系統的レビューとネットワークメタアナリシス
カテゴリ:災害・救急医療
公開日:2026年2月19日
タイトル:Accuracy of Large Language Models When Answering Clinical Research Questions: Systematic Review and Network Meta-Analysis
雑誌名:J Med Internet Res. 2025 Apr 30; 27: e64486. doi: 10.2196/64486. Epub 2025 Apr 30.
概 要:
本研究は、大規模言語モデル(LLMs)が臨床研究質問に対する精度を評価するためにネットワークメタアナリシスを用いた系統的レビューを実施しました。医療分野におけるLLMsの利用に関する議論が続く中、35,896の質問と3063の臨床ケースを含む168件の研究を分析しました。結果として、ChatGPT-4oが客観的な質問に対して優れた精度を示し、他のモデルと比較しても高い評価を得ました。人間の専門家は、診断の精度において最も高い結果を示しました。
方 法:
この系統的レビューとネットワークメタアナリシスでは、2024年10月14日までに発表された研究をPubMed、Embase、Web of Science、Scopusから検索しました。臨床研究質問に対するLLMsの精度に関する研究を対象とし、バイエイジアン頻度理論を用いてNMAを実施しました。主要な評価指標は、客観的質問、オープンエンド質問、診断のトップ1、トップ3、トップ5、トリアージおよび分類における精度です。
結 果:
168件の研究を通じて、ChatGPT-4o(SUCRA=0.9207)が客観的質問に対する精度で最も高い評価を受け、次いでAeyeconsult(SUCRA=0.9187)とChatGPT-4(SUCRA=0.8087)が続きました。オープンエンド質問ではChatGPT-4(SUCRA=0.8708)が優れていました。診断精度では、人間の専門家がトップ1(SUCRA=0.9001)およびトップ3(SUCRA=0.7126)で最も高い評価を得ました。Claude 3 Opus(SUCRA=0.9672)はトップ5診断で良好な結果を示し、Gemini(SUCRA=0.9649)はトリアージおよび分類で最高の評価を得ました。
結 論:
ChatGPT-4oは客観的質問に対して優位性を示し、オープンエンド質問ではChatGPT-4がより信頼性が高いとされました。診断においては人間が最も正確であり、Claude 3 Opusはトップ5診断で優れた性能を発揮しました。これらの結果は、臨床医がLLMsを効果的に活用し、学習や診断、管理において意思決定を改善するための貴重な洞察を提供します。