MEDICINE & AI

外来クリニックにおける前庭診断のための会話型大規模言語モデル:前向き多施設診断精度研究

カテゴリ:災害・救急医療

公開日:2026年8月10日

タイトル:Conversational Large Language Models for Vestibular Diagnosis in Outpatient Clinics: Prospective Multicenter Diagnostic Accuracy Study 雑誌名:J Med Internet Res. 2026 Aug 07; 28: e100442. doi: 10.2196/100442. 概 要: この研究は、前庭障害の診断精度を評価するために、会話型大規模言語モデル(LLM)を用いた新しいアプローチを提案しています。前庭障害は一般的であり、特に専門外の医療現場では誤診が多く、症状の elicitation を標準化するデジタルヘルスツールが必要とされています。本研究では、静的な前庭歴を用いたLLMの診断性能を評価し、外来のめまいクリニックに埋め込まれた会話型LLMエージェントの効果を前向きに評価しました。 方 法: 本研究は2段階の診断精度研究を実施しました。歴史に基づく評価(HBE)では、10のLLMと5人の上級耳鼻咽喉科医が227件の構造化されためまい歴を独立してレビューしました。前向き臨床評価(PCE)では、中国の5つのセンターで176人の外来患者が対象となり、看護師支援のタブレットベースのエージェントが多段階の症状歴対話を行いました。主要評価指標は、基準診断とのTop-1診断一致率でした。 結 果: HBEでは、Gemini-2.5-proとo1が最高のTop-1精度(69.6%)を達成しましたが、専門家パネルの多数決を有意に上回るモデルはありませんでした。PCEでは、会話型エージェントが176人中140人(79.55%)の患者で基準診断と一致しました。特に良性発作性頭位めまい症(97.73%)とメニエール病(90.00%)で高い一致率を示しました。 結 論: 看護師支援の外来ワークフロー内で運用された会話型LLMエージェントは、専門医の最終診断と約80%の一致率を達成しました。この結果は、エージェント単独の性能ではなく、看護師支援のワークフローの効果を反映しています。今後の研究では、こうしたシステムが臨床判断を改善し、リソースの無駄を減らし、安全性を維持できるかを検証する必要があります。