小児救急科における大規模言語モデルの診断効果:パイロット研究
カテゴリ:公衆衛生・予防医療
公開日:2026年2月19日
タイトル:Diagnostic efficacy of large language models in the pediatric emergency department: a pilot study.
雑誌名:Front Digit Health. 2025; 7: 1624786.
概 要:
小児救急科(PED)は、高い患者数、時間に敏感な意思決定、複雑な診断といった課題に直面しています。本研究では、大規模言語モデル(LLM)が小児救急における診断支援にどのように寄与できるかを評価しました。具体的には、5つのLLM(ChatGPT-4o、Gemini 1.5 Pro、Gemini 1.5 Flash、Llama-3-8B、ChatGPT-4o mini)の診断効果を、23人の医師(小児救急医10人、研修医6人、救急医学研修医7人)と比較しました。80の実際の小児臨床ケースに基づき、診断の正確性を評価しました。
方 法:
本研究では、80の小児臨床ケースに対して、5つのLLMと23人の医師が1つの主診断と2つの鑑別診断を提供しました。診断の複雑さは3つのレベルに分かれており、最終的な診断と比較して、各回答の正確性を5段階で評価しました。各医師またはLLMは、80点満点で評価されました。
結 果:
最も良い成績を収めたのはChatGPT-4o(スコア72.5)とGemini 1.5 Pro(スコア62.75)であり、ChatGPT-4oは小児救急医(スコア61.88)よりも優れていました(p < 0.05)。救急医学研修医は、他の医師やチャットボットよりも低いスコア(43.75)を示しました(p < 0.01)。チャットボットのパフォーマンスはケースの難易度に反比例しましたが、ChatGPT-4oは難易度の高いケースでも多くの正解を示しました。
結 論:
ChatGPT-4oとGemini 1.5 Proは、ED医師の臨床意思決定を支援する有効なツールとなる可能性がありますが、医師の判断を置き換えるものではありません。AIチャットボットと医療専門家との効果的な協力のための共有プロトコルが必要です。