MEDICINE & AI

膀胱癌予後における臨床データ抽出のための大規模言語モデルの信頼性評価

カテゴリ:診断支援・画像解析

公開日:2026年2月19日

タイトル:Evaluating the reliability of large language models for clinical data extraction in bladder cancer prognosis 雑誌名:Sci Rep. 2025 Nov 21; 15(1): 43773. doi: 10.1038/s41598-025-27593-7. Epub 2025 Nov 21. 概 要: 本研究は、自然言語処理(NLP)と機械学習の進展が、非構造化電子医療記録(EMR)からの臨床データ抽出において人間のユーザーを支援する可能性を探求しています。膀胱癌の生存予測に関連する重要な臨床情報を抽出するために、Dolly、Vicuna、Llama、GPT-4などの複数の大規模言語モデル(LLM)の精度と一貫性を評価しました。163人の膀胱癌患者のEMRを使用し、モデルの違いや進化、入力テキストの長さ、ケース入力の順序がLLMのパフォーマンスに与える影響を調査しました。GPT-4は、Fleissのカッパ値が0.97を超え、精度が常に93%以上で、生存予測指標が真実と密接に一致することが示されました。 方 法: 本研究は、膀胱癌患者163人のEMRを用いた評価研究です。複数の大規模言語モデル(Dolly、Vicuna、Llama、GPT-4)の性能を比較し、モデルの違いや進化、入力テキストの長さ、ケース入力の順序が抽出精度に与える影響を分析しました。主要評価指標は、Fleissのカッパ値、精度、AUCなどです。 結 果: GPT-4はFleissのカッパ値が0.97を超え、精度が常に93%以上を維持しました。生存予測指標は真実とAUC±0.02の範囲で一致しました。オフラインモデルでは、Llama-2.0-13bとLlama-3.3-70bが情報抽出と生存予測の両方で最も高い信頼性を示しました。 結 論: 大規模言語モデルは、予測モデルのための臨床データ抽出を自動化する可能性を示しましたが、モデルの変動性と信頼性に関する課題も浮き彫りになりました。