MEDICINE & AI

臨床ガイドラインに基づく腰仙神経根痛に関するアドバイスにおけるChatGPT-3.5、ChatGPT-4o、Copilot、Gemini、Claude、Perplexityの精度:横断研究

カテゴリ:公衆衛生・予防医療

公開日:2026年2月19日

タイトル:Accuracy of ChatGPT-3.5, ChatGPT-4o, Copilot, Gemini, Claude, and Perplexity in advising on lumbosacral radicular pain against clinical practice guidelines: cross-sectional study. 雑誌名:Front Digit Health. 2025; 7: 1574287. 概 要: 本研究は、腰仙神経根痛に関する臨床ガイドライン(CPG)に対するAIチャットボットのパフォーマンスを評価することを目的としています。AIチャットボットは、健康状態や治療法に関する情報を提供する重要なツールとして注目されていますが、複雑な臨床質問に対する回答の整合性は不明です。最新のAIチャットボット6種に対してCPGに基づく臨床質問を行い、その応答の一致率を評価しました。 方 法: 横断研究を実施し、2024年に更新されたChatGPT-3.5、ChatGPT-4o、Microsoft Copilot、Google Gemini、Claude、Perplexityの6つのAIチャットボットに対して、腰仙神経根痛の診断と治療に関するCPGの推奨に基づく臨床質問を行いました。応答の整合性はPlagiarism Checker Xを用いて評価し、評価者間および評価者内の信頼性はFleiss' Kappaを用いて測定しました。統計解析はSTATA/MP 16.1で実施しました。 結 果: AIチャットボットの応答のテキスト整合性には高い変動が見られ(中央値範囲26%-68%)、評価者内信頼性は「ほぼ完璧」から「相当」まで、評価者間信頼性は「ほぼ完璧」から「中程度」までの範囲でした。Perplexityが67%で最も高い一致率を示し、次いでGoogle Geminiが63%、Microsoft Copilotが44%でした。ChatGPT-3.5、ChatGPT-4o、Claudeはそれぞれ33%の一致率で最も低いパフォーマンスを示しました。 結 論: AIチャットボットの推奨は、腰仙神経根痛の診断および治療に関するCPGの推奨と一致しないことが多く、内部整合性には変動があるものの、良好な評価者内および評価者間信頼性があることが示されました。臨床医や患者は、これらのAIモデルに依存する際には注意が必要であり、提供される推奨の1/3から2/3が不適切または誤解を招く可能性があることを認識すべきです。