MEDICINE & AI

神経シンボリック大規模言語モデルシステムと従来のAIモデルおよび人間の専門家との胆管炎管理における性能比較

カテゴリ:災害・救急医療

公開日:2026年6月2日

タイトル:Performance comparison of a neuro-symbolic large language model system versus conventional AI models and human experts in cholangitis management 雑誌名:BMC Med Inform Decis Mak. 2026 Jun 01; doi: 10.1186/s12911-026-03593-z. 概 要: 本研究は、胆管炎管理における神経シンボリック大規模言語モデル(LLM)システムの性能を従来のLLMや人間の専門家と比較することを目的としています。従来のLLMでは複雑な肝胆道疾患の管理における有効性が十分に検証されていない中、我々は遺伝的神経シンボリックLLMシステムを開発しました。このシステムは、複数のAIエージェントと神経シンボリック推論を統合しています。 方 法: この多施設横断研究では、急性胆管炎に関するアメリカ内科学会(ABIM)の消化器専門医試験からの30のケースベースの質問を使用しました。質問は診断(n=10)、治療(n=10)、合併症/予後(n=10)に分類されました。遺伝的神経シンボリックLLMシステムの性能は、Claude 4.5 Sonnet、ChatGPT 5.2、Gemini 2.0 Flash、トルコの4つの三次医療機関からの10人の消化器専門医および4人の救急医と比較されました。 結 果: 遺伝的神経シンボリックシステムは、全体の正確性で100%(30/30)を達成し、Claude 4.5 Sonnet(90.0%)、ChatGPT 5.2(60.0%)、Gemini 2.0 Flash(63.3%)、消化器専門医(平均95.7% ± 3.2%)、救急医(平均84.2% ± 8.8%)を大きく上回りました。このシステムは、すべてのカテゴリおよび胆管炎のサブタイプにおいて優れた性能を示しました。人間の参加者の中では、消化器専門医が治療判断において救急医を上回りました(p=0.012)。 結 論: 遺伝的神経シンボリックLLMシステムは、胆管炎管理においてすべての従来のAIモデルおよび人間の専門家よりも優れた正確性を示しました。この概念実証研究は、神経シンボリック推論を用いたマルチエージェントアーキテクチャが複雑な肝胆道疾患におけるAI支援の臨床意思決定支援において有望な方向性を提供する可能性があることを示唆していますが、より広範な実施主張には前向きな臨床検証が必要です。