MEDICINE & AI

診断推論に対する大規模言語モデルの影響:無作為化臨床試験

カテゴリ:医学教育

公開日:2026年2月19日

タイトル:Large Language Model Influence on Diagnostic Reasoning: A Randomized Clinical Trial 雑誌名:JAMA Netw Open. 2024 Oct 01; 7(10): e2440969. doi: 10.1001/jamanetworkopen.2024.40969. Epub 2024 Oct 01. 概 要: 本研究は、大規模言語モデル(LLM)が医師の診断推論に与える影響を評価することを目的としています。無作為化臨床試験を通じて、LLMを使用したグループと従来のリソースのみを使用したグループの診断パフォーマンスを比較しました。参加者は、家族医学、内科、救急医学の訓練を受けた医師であり、合計50名が参加しました。結果として、LLMを使用したグループの診断スコアは従来のリソースグループと有意な差は見られませんでしたが、LLM単独では従来のリソースグループよりも高いパフォーマンスを示しました。 方 法: 本研究は、2023年11月29日から12月29日までの間に実施された単盲検無作為化臨床試験です。参加者は、LLMと従来の診断リソースのいずれかを使用するように無作為に割り当てられ、最大6つの臨床事例を60分間レビューしました。主要評価指標は、診断の正確性、支持および反対要因の適切性、次の診断評価ステップに基づく標準化されたルーブリックによる診断パフォーマンスでした。 結 果: 50名の医師が参加し、LLMグループの診断推論スコアは76%(IQR, 66%-87%)、従来リソースグループは74%(IQR, 63%-84%)でした。LLMグループのケースごとの平均所要時間は519秒、従来リソースグループは565秒でした。LLM単独のスコアは従来リソースグループよりも16ポイント高い結果を示しました。 結 論: この試験では、診断支援としてのLLMの利用は従来のリソースと比較して臨床推論を有意に改善しませんでしたが、LLM単独ではより高いパフォーマンスを示しました。医師と人工知能の協力の可能性を実現するためには、技術と人材の開発が必要です。