MEDICINE & AI

大規模言語モデルはガイドラインに従えるか?AAOSの推奨に基づく鎖骨骨折管理におけるChatGPT-4oとDeepSeek AIの比較研究

カテゴリ:医学教育

公開日:2026年2月19日

タイトル:Can large language models follow guidelines? A comparative study of ChatGPT-4o and DeepSeek AI in clavicle fracture management based on AAOS recommendations. 雑誌名:BMC Med Inform Decis Mak. 2025 Sep 29; 25(1): 350. doi: 10.1186/s12911-025-03202-5. Epub 2025 Sep 29. 概 要: 本研究は、鎖骨骨折の診断と治療に関するChatGPT-4oとDeepSeek AIの応答の質を比較し、2022年のAAOS臨床実践ガイドラインに基づいています。14の臨床質問を作成し、各AIモデルに独立して提出しました。応答は、DISCERN、PEMAT-P、CLEARなどの標準化された評価ツールを用いて評価されました。結果として、両モデルは臨床的に関連性のある応答を生成しましたが、PEMATの行動可能性スコアは有意な結果を示しませんでした。 方 法: 本研究は、AAOSの鎖骨骨折ガイドラインに基づく14の臨床質問を作成し、ChatGPT-4oとDeepSeek AIに独立して提出しました。応答は、DISCERN、PEMAT-P、CLEAR、Flesch-Kincaidグレードレベル、Flesch読みやすさ、Gunning-Fog指数を用いて評価され、2人の整形外科医が独立して評価しました。統計的比較はMann-Whitney U検定を用いて行いました。 結 果: DeepSeek AIは、ChatGPT-4oに比べて有意に高い単語数(中央値:572対438.5、p=0.016)とCLEARスコア(中央値:18対16、p<0.001)を生成しましたが、PEMATの理解可能性や行動可能性、DISCERNスコア、読みやすさ指数、正確性において有意差は見られませんでした。両モデルともに高い正確性を示しました。 結 論: ChatGPT-4oとDeepSeek AIは、鎖骨骨折管理に関するガイドラインに基づく質問に対して一貫した臨床的に関連する応答を生成しましたが、PEMATの行動可能性スコアは有意ではなく、時折不正確さや幻覚が観察されました。DeepSeekは長い応答を生成しましたが、冗長性は必ずしも質の向上に繋がりませんでした。これらの結果は、LLMが医療教育や参考の補助ツールとして機能する可能性を示唆していますが、証拠に基づく臨床判断を置き換えることはできず、監視された統合と継続的な検証の必要性を強調しています。分析したプロンプトの数(14)は限られており、統計的な力と一般化可能性に制約があります。今後の研究では、より大規模な多ガイドラインデータセットが必要です。