MEDICINE & AI

ドライアイ疾患における臨床意思決定における大規模言語モデルの応用

カテゴリ:手術支援

公開日:2026年5月27日

タイトル:Application of large language models in clinical decision-making for dry eye disease 雑誌名:BMC Med Inform Decis Mak. 2026 May 26; doi: 10.1186/s12911-026-03586-y. 概 要: 本研究は、ドライアイ疾患(DED)における大規模言語モデル(LLMs)の診断、分類、治療決定のパフォーマンスを体系的に評価し、ジュニア眼科医との比較を通じて臨床支援ツールとしての実用性を検討することを目的としています。100件の標準化されたDEDケースを分析し、LLMsの性能を評価しました。 方 法: 2023年8月から2025年8月までの間に、福州大学附属省立病院から収集した100件の標準化されたDEDケースを分析しました。4つのLLMs(ChatGPT-4o、DeepSeek-V3、Gemini-2.5-Pro、ERNIE Bot-4.5-turbo)が初期テストを受け、95%の精度基準を満たしたモデルのみがケースベースの評価に進みました。診断および治療の出力は、シニア眼科医によって評価され、応答時間も記録されました。 結 果: ChatGPT-4o、DeepSeek-V3、Gemini-2.5-Proはスクリーニング基準を満たしました。治療の必要性を判断する際、LLMsの精度は96-99%で、ジュニア眼科医の97%と同等でした。DEDの分類において、DeepSeek-V3は92%の精度を達成し、専門家との一致度も高く(kappa=0.80)、ChatGPT-4oおよびジュニア眼科医(71%、kappa≈0.53)を上回りました。Gemini-2.5-Proは89%の精度を示し、最も高いGlobal Quality Score(4.87±0.37)を獲得しました。LLMsの意思決定効率は有意に高く(p≤0.001)、応答時間は16-36秒で、ジュニア眼科医の315±57秒よりも短かったです。 結 論: Gemini-2.5-ProとDeepSeek-V3は、ケースベースのDED管理において高い精度、安全性、効率を示し、臨床意思決定を強化し、経験の少ない臨床医を支援するための補助ツールとしての強い可能性を持つことが示されました。