MEDICINE & AI

緊急医療に関する患者の質問に対する4つの大規模言語モデルチャットボットの応答の正確性:実験的比較研究

カテゴリ:災害・救急医療

公開日:2026年2月19日

タイトル:Accuracy of Prospective Assessments of 4 Large Language Model Chatbot Responses to Patient Questions About Emergency Care: Experimental Comparative Study 雑誌名:J Med Internet Res. 2024 Nov 04; 26: e60291. doi: 10.2196/60291. Epub 2024 Nov 04. 概 要: 本研究は、緊急医療に関する一般的な質問に対するAIチャットボットの応答の質を評価することを目的としています。具体的には、ChatGPT 3.5、Google Bard、Bing AI Chat、Claude AIの4つの無料アクセスAIチャットボットの応答を比較し、10の異なる緊急状態に関する応答の質的な違いを明らかにしました。調査の結果、チャットボットの応答は明瞭さや理解しやすさにおいては良好でしたが、情報の正確性や信頼性においては大きな欠陥が見られました。 方 法: 2023年11月26日に、緊急医療に関する10の質問を4つのAIチャットボットに入力しました。各応答は、5人の認定緊急医療専門医によって8つの評価基準(正確性、危険な情報の有無、明瞭さ、完全性、理解しやすさ、情報源の信頼性、関連性)で評価されました。正確な応答は、信頼できる緊急医療の文献から得られました。応答の読みやすさはFlesch-Kincaidグレードレベルを用いて評価しました。 結 果: 4つのチャットボットは、明瞭さと理解しやすさで85%のスコアを得ましたが、正確性と完全性は50%、情報源の関連性と信頼性は10%と低い結果でした。危険な情報は5%から35%の応答に含まれており、チャットボット間に統計的な差は見られませんでした。Bing AIは、他のチャットボットよりも関連する情報源を40%提供しました。全体的に、応答の読みやすさは平均的に高すぎる結果でした。 結 論: AIチャットボットは、緊急医療に関する患者へのアドバイスにおいて重大な欠陥があり、情報が不完全かつ不正確であることが多いと示されました。患者は誤情報に気づかずにリスクを負う可能性があるため、AIチャットボットの健康関連情報はさらなる研究、改良、規制が必要です。適切な医療相談を強く推奨します。