MEDICINE & AI

気胸に関する患者教育における大規模言語モデルの性能と時間的変動の評価:7日間の分析

カテゴリ:手術支援

公開日:2026年7月18日

タイトル:Evaluation of the performance and temporal variability of large language models in patient education regarding pneumothorax: a seven-day analysis. 雑誌名:Sci Rep. 2026 Jul 17; doi: 10.1038/s41598-026-62194-y. 概 要: 本研究は、気胸に関する情報提供におけるAIチャットボットの可読性、臨床的信頼性、および時間的一貫性を調査しました。40の患者中心の質問を用いて、3つの大規模言語モデル(ChatGPT、Gemini、Copilot)を2つのアクセス層と2つのプロンプト戦略(ゼロショットと最適化されたPROMPORT戦略)で評価しました。質問は、厳格なセッション管理の下で1日目、3日目、7日目にわたり繰り返されました。可読性は5つの自動可読性指標を用いて定量化し、2人の独立した胸部外科医が臨床品質を評価しました。可読性指標は追跡期間中に構造的安定性を示しましたが、未提示の構成は複雑な出力を生成しました。一方、PROMPORT戦略は言語の変動を圧縮し、時間的なアルゴリズムの変動を中和しました。 方 法: この研究は、40の患者中心の質問を用いたコホート研究で、3つの大規模言語モデル(ChatGPT、Gemini、Copilot)を対象としました。質問は、ゼロショットとPROMPORT戦略の2つのプロンプト戦略で評価され、1日目、3日目、7日目にわたって繰り返されました。可読性は5つの自動指標で測定され、臨床品質は2人の胸部外科医によって評価されました。 結 果: 未提示のモデルは、時間的に不安定なmDISCERNおよびJAMAプロファイルを示しましたが、PROMPORT戦略により安定化されました。可読性指標は追跡期間中に安定しており、インターレイター信頼性はすべての評価で高いことが確認されました。 結 論: 未提示モデルは基準となる言語および品質の変動を示しましたが、強力なプロンプトエンジニアリングの統合により、デジタル公衆衛生コミュニケーションに必要な時間的安定性と明瞭さが確保されることが示されました。