MEDICINE & AI

腫瘍学における意思決定のための大規模言語モデルの多次元ベンチマークフレームワーク

カテゴリ:医療現場の業務効率化

公開日:2026年7月24日

タイトル:A multidimensional benchmarking framework for large language models in oncologic decision making 雑誌名:Sci Rep. 2026 Jul 21; 16(1): doi: 10.1038/s41598-026-61195-1. 概 要: 本研究は、大規模言語モデル(LLMs)が腫瘍学における臨床意思決定支援ツールとしての可能性を探るもので、従来の単一の評価指標に依存することの限界を克服するための多次元評価フレームワークを提案しています。非小細胞肺癌に関する5つの臨床シナリオを用いて、3つのLLM(Gemini 2.5 Pro、GPT-5、Claude Opus 4.1)の出力を、エビデンスに基づく参照回答と比較しました。評価は、臨床精度、説明可能性、コスト、応答時間、生成効率を含む複数の指標に基づいて行われ、最終的にComposite Performance Score(CPS)を算出しました。 方 法: この比較観察研究では、非小細胞肺癌に関する30の臨床質問に対して、3つのLLMが公式APIを通じて回答しました。モデルの出力は、専門家による臨床精度と説明可能性の評価に加え、コスト、応答時間、生成効率といった運用指標を用いて評価されました。これらの指標は、専門家の重み付けを行ったCPSに統合されました。 結 果: 全ての指標において、モデル間で有意な差が観察され(p < 0.001)、GPT-5が最も高い精度、説明可能性、生成効率を示しました。一方、Gemini 2.5 Proは最も低コストで、Opus 4.1は最も迅速な応答時間を記録しました。統合分析の結果、GPT-5が最も高いCPSを獲得し、次いでGemini 2.5 Pro、Opus 4.1の順でした(Kendall's W = 0.87)。 結 論: 臨床の質と運用効率を統合した多次元評価フレームワークは、単一の指標評価よりも実用的な洞察を提供し、腫瘍学の実践におけるモデル選択を可能にします。ただし、この分野におけるLLMsの使用は、医師の監督の下で行うべきです。