MEDICINE & AI

希少疾患における初回訪問専門医のトリアージに関する大規模言語モデルの使用:回顧的ベンチマーク研究

カテゴリ:災害・救急医療

公開日:2026年7月24日

タイトル:Initial-Visit Specialty Triage in Rare Diseases Using Large Language Models: Retrospective Benchmarking Study 雑誌名:J Med Internet Res. 2026 Jul 23; 28: e101711. doi: 10.2196/101711. 概 要: 希少疾患における初回訪問時の専門医トリアージは、早期診断経路において見落とされがちなステップです。本研究は、希少疾患における初回訪問専門医のトリアージに対する大規模言語モデル(LLMs)の精度、応答時間、一貫性を評価し、登録看護師や非医療参加者とのパフォーマンスを比較することを目的としています。 方 法: 本研究は回顧的ベンチマーク研究であり、5つの希少疾患データセットを使用しました。14のLLMsを評価し、各ケースについて5回の独立した実行を行いました。性能は精度、応答時間、一貫性を用いて評価し、モデルのアクセス性、推論モード、パラメータスケール、表現型数によるサブグループ分析を行いました。 結 果: データセット全体で、モデルの精度は0.4378から0.7141までの範囲でした。Claude-opus-4-5が最高の精度(0.7141)と一貫性(0.9653)を達成し、ケースあたり平均10.79秒の応答時間を示しました。GPT-5.1は最短の応答時間(3.39秒/ケース)と高い精度(0.6948)を持ちました。オープンウェイトモデルよりもプロプライエタリモデルの方が平均精度が高い傾向がありました。LLMsは、登録看護師や非医療参加者よりも高い平均精度を達成しました(0.5978 vs 0.4914および0.4573)。 結 論: LLMsは希少疾患における初回訪問専門医トリアージの補助ツールとしての可能性を示しました。モデルの選択、推論モード、表現型情報の密度がパフォーマンスに影響を与えましたが、サブグループの結果は慎重に解釈する必要があります。今後の研究では、LLMを用いた専門医トリアージを前向き臨床設定で評価し、臨床医が監督するワークフローの開発を進めるべきです。