MEDICINE & AI

大規模言語モデルは多モーダルな集中治療医学のボードレビュー質問に対して正確だが潜在的に危険な回答を提供する

カテゴリ:災害・救急医療

公開日:2026年6月18日

タイトル:Large Language Models Provide Accurate but Potentially Unsafe Answers to Multimodal Critical Care Medicine Board Review Questions 雑誌名:Crit Care Med. 2026 Jun 18; doi: 10.1097/CCM.0000000000007228. 概 要: 本研究は、Chat Generative Pre-Trained Transformer-4 Omni(ChatGPT-4o)が多モーダルな集中治療のボードレビュー質問に対する回答の精度、画像解釈、推論の質、潜在的な危険性を評価することを目的としています。183のボードスタイルの質問を用い、経験豊富な集中治療医による評価を受けました。ChatGPT-4oは、正確性において臨床医の回答を上回る結果を示しましたが、画像解釈や推論においては限界があり、臨床的な危険を伴う可能性があることが明らかになりました。 方 法: 観察研究として、臨床画像を伴う多肢選択式質問の検証済みアイテムバンクを使用しました。シミュレーション環境で集中治療ボード試験の条件を模倣し、14人の臨床レビュアーがChatGPT-4oの回答を評価しました。 結 果: ChatGPT-4oは74.9%の質問に正しく回答し、臨床医の回答(71.1%)を上回りました。質問理解においては87.4%の正答率を示しましたが、画像解釈(61.7%)、推論(68.3%)、支持情報(66.1%)では低いパフォーマンスを示しました。特に、33.3%の回答が臨床的危険を伴う可能性があり、これは主に画像解釈や治療推奨の誤りによるものでした。 結 論: ChatGPT-4oは集中治療のボードスタイルの質問において臨床医の基準をわずかに上回るパフォーマンスを示しましたが、多モーダルな質問解釈には重大な限界があります。高い理解力にもかかわらず、推論や画像分析の欠陥が、高リスクの臨床意思決定や教育において有害な結論を導く可能性があることが示されました。