チャットボットと専門家による猫の苦痛スケールスコアの一致
カテゴリ:診断支援・画像解析
公開日:2026年2月19日
タイトル:Agreement of Feline Grimace Scale scores between chatbots and an expert rater.
雑誌名:Sci Rep. 2025 Dec 09; 15(1): 43461.
概 要:
この研究は、猫の急性疼痛評価における大規模言語モデル(LLMs)の性能を評価しました。具体的には、4つのチャットボット(ChatGPT、Gemini、Claude AI、Perplexity)と専門獣医師との間で、猫の苦痛スケール(FGS)のスコアの一致を調査しました。50枚の猫の顔画像を用いて、FGSの各項目(耳の位置、眼の緊張、口の緊張、ひげの変化、頭の位置)を2ヶ月間隔でスコアリングしました。Bland-Altman法を用いてバイアスと一致の限界を分析しました。結果、チャットボットはFGSスコアを過小評価する傾向があり、特にClaude AIは再テスト後に良好な一致を示しましたが、他のチャットボットは不適切なバイアスを示しました。
方 法:
この研究は、50枚の猫の顔画像を用いた観察研究で、4つのチャットボットがFGSを用いてスコアリングを行いました。各チャットボットは、2ヶ月間隔で同じ画像を2回評価しました。主要評価指標は、バイアスと一致の限界(LoA)であり、Bland-Altman法を用いて分析しました。
結 果:
Claude AIは再テスト後に良好な一致を示しましたが、LoAはFGSの鎮痛閾値を超えました。ChatGPTは閾値を超えないものの不適切なバイアスを示し、GeminiとPerplexityは不適切なバイアスを示し、LoAは閾値を超えました。多くのチャットボットは一致が悪く、疼痛評価が過大または過小評価される可能性があり、疼痛の過剰治療または不足治療を引き起こす恐れがあります。
結 論:
チャットボットによる猫のFGSスコアリングは、一部のモデルで良好な一致を示すものの、全体的には不適切なバイアスが観察され、疼痛管理において問題を引き起こす可能性があることが示されました。これにより、疼痛評価の信頼性が損なわれる可能性があります。