MEDICINE & AI

扁桃摘出術に関連するYouTube動画の評価:専門家レビューとChatGPT-4による多方法品質分析

カテゴリ:医学教育

公開日:2026年2月19日

タイトル:Evaluating tonsillectomy-related YouTube videos via a human expert review and the ChatGPT-4: a multi-method quality analysis. 雑誌名:BMC Med Educ. 2025 Aug 11; 25(1): 1157. doi: 10.1186/s12909-025-07739-x. Epub 2025 Aug 11. 概 要: 本研究は、YouTubeにおける扁桃摘出術関連の健康情報の質と信頼性を評価することを目的としています。専門家によるレビュー、AI(ChatGPT-4)分析、トランスクリプトの可読性評価を組み合わせた多方法フレームワークを用いて、76本の英語のYouTube動画を評価しました。結果として、専門的な動画は患者生成コンテンツよりも一貫して高い品質を示しました。視覚的に豊かな動画は、トランスクリプト重視の動画よりもAIの正確性が高いことが示され、可読性の問題も指摘されました。 方 法: 76本の英語のYouTube動画を対象に、2人の耳鼻咽喉科医がDISCERNツールとJAMA基準を用いて動画の質を独立して評価しました。修正されたトランスクリプトは、ChatGPT-4(2024年5月版)によって正確性と完全性が評価されました。スピアマンの相関係数と回帰分析を用いて、人間とAIの評価の関連を探りました。また、動画はトランスクリプト重視または視覚的に豊かに分類され、視覚的プレゼンテーションの影響を調査しました。 結 果: 専門的な動画は、品質指標において患者生成コンテンツを一貫して上回りました。ChatGPT-4の正確性スコアはJAMA評価と強い相関(ρ=0.56)を示し、完全性はDISCERNスコアと強く関連(ρ=0.72)しました。視覚的に豊かな動画は、トランスクリプト重視の動画よりもAIの正確性が有意に高く(Cohen's d=0.600, p=0.030)、平均トランスクリプト可読性(FKGL=8.38)は患者教育に推奨されるレベルを超えていました。 結 論: 扁桃摘出術に関連するYouTubeコンテンツは質において大きなばらつきがあり、AIとの整合性が大規模言語モデルを用いた初期コンテンツスクリーニングの有用性を支持しています。視覚的に豊かなコンテンツはAIの解釈可能性を向上させる可能性があり、可読性の問題はよりアクセスしやすい教育資源の必要性を浮き彫りにしています。今後のデジタルヘルスコンテンツでは、多モーダルな評価とデザインが優先されるべきです。