MEDICINE & AI

大規模言語モデルエージェントはツールを使用して臨床計算を実行できる

カテゴリ:手術支援

公開日:2026年2月19日

タイトル:Large language model agents can use tools to perform clinical calculations. 雑誌名:NPJ Digit Med. 2025 Mar 17; 8(1): 163. doi: 10.1038/s41746-025-01475-8. Epub 2025 Mar 17. 概 要: 本研究では、大規模言語モデル(LLM)が医療における専門的な質問に答える能力を持つ一方で、幻覚や算術エラーを起こす傾向があることを指摘しています。LLMが臨床計算を信頼性高く実行できないことが示唆されており、臨床業務への統合が制限されています。ChatGPTの48の医療計算タスクにおけるパフォーマンスを評価したところ、約3分の1の試行(n=212)で不正確な応答が見られました。次に、情報検索を活用した生成、コードインタープリターツール、特定の計算ツール(OpenMedCalc)を用いた3つのエージェント強化形式を10,000回の試行で評価しました。特定のツールにアクセスできるモデルは最も改善が見られ、LLaMaとGPTベースのモデルはそれぞれ5.5倍(88% vs 16%)および13倍(64% vs 4.8%)の不正確な応答の減少を示しました。この結果は、機械可読の特定タスクツールの統合がLLMの医療計算における限界を克服する助けになる可能性を示唆しています。 方 法: 本研究は、ChatGPTの48の医療計算タスクにおけるパフォーマンスを評価し、3つのエージェント強化形式を用いて10,000回の試行を実施しました。評価には、情報検索を活用した生成、コードインタープリターツール、特定の計算ツール(OpenMedCalc)が含まれています。 結 果: ChatGPTは48の医療計算タスクにおいて約3分の1の試行で不正確な応答を示しましたが、特定のツールにアクセスできるモデルは大幅な改善を示しました。LLaMaモデルは不正確な応答を88%から16%に、GPTベースのモデルは64%から4.8%に減少させました。 結 論: 特定のタスクツールの統合は、LLMの医療計算における限界を克服する可能性があり、臨床業務への統合に向けた重要なステップとなることが示されました。