MEDICINE & AI

川崎病における医療相談支援ツールとしての大規模言語モデルの評価

カテゴリ:医学教育

公開日:2026年2月19日

タイトル:Assessing large language models as assistive tools in medical consultations for Kawasaki disease 雑誌名:Front Artif Intell. 2025; 8: 1571503. 概 要: 川崎病(KD)は、診断、治療、長期管理において複雑な臨床的課題を呈し、親と医療提供者の双方に包括的な理解が求められます。本研究は、異なる大規模言語モデル(LLM)がKDに関する臨床的に関連する質問に対してどの程度適切かつ理解しやすい回答を提供できるかを評価し、異なるプロンプト戦略の影響を検討することを目的としています。 方 法: 25の質問を作成し、プロンプト戦略として「プロンプトなし(NO)」、「親向け(PF)」、「医師向け(DL)」の3つを用いました。これらの質問をChatGPT-4o、Claude 3.5 Sonnet、Gemini 1.5 Proの3つのLLMに入力し、回答の適切性、教育的質、理解しやすさ、注意喚起文、参考文献、誤情報の可能性を評価しました。評価には情報品質グレード、グローバル品質スケール(GQS)、フレッシュ読解容易度(FRE)スコア、単語数を使用しました。 結 果: LLM間で回答の教育的質、正確性、理解しやすさに有意な差が見られました(p < 0.001)。Claude 3.5は完全に正しい回答の割合が最も高く(51.1%)、最高の中央値GQSスコア(5.0)を達成しました。Gemini 1.5は最高のFREスコア(31.5)を示し、理解しやすいと評価された回答の割合が最も高かった(80.4%)。プロンプト戦略はLLMの回答に有意な影響を与えました。Claude 3.5 SonnetはDLプロンプトで最も高い完全正解率(81.3%)を示し、PFプロンプトは最も受け入れられる回答(97.3%)をもたらしました。Gemini 1.5 Proはプロンプト間での変動が少なかったが、理解しやすさにおいて優れていました(PFプロンプト下で98.7%)。 結 論: この研究は、LLMがKDに関する情報提供において大きな可能性を持つことを示していますが、品質の不一致や誤情報のリスクに注意が必要です。LLMとプロンプト戦略間で有意な差が存在しました。Claude 3.5 Sonnetは最も良い回答品質と正確性を提供し、Gemini 1.5 Proは理解しやすさに優れています。親がKD情報を求める際には、Claude 3.5 SonnetのPFプロンプトが最も推奨されます。AIの進化に伴い、信頼性の高い情報を確保するために研究の拡充とモデルの洗練が重要です。