MEDICINE & AI

AIを臨床教育に統合する:一般診療研修医のAI生成の幻覚を識別する能力とその影響要因の評価

カテゴリ:医学教育

公開日:2026年2月19日

タイトル:Integrating AI into clinical education: evaluating general practice trainees' proficiency in distinguishing AI-generated hallucinations and impacting factors. 雑誌名:BMC Med Educ. 2025 Mar 19; 25(1): 406. doi: 10.1186/s12909-025-06916-2. Epub 2025 Mar 19. 概 要: 本研究は、一般診療研修医がシミュレーション臨床実践においてAI生成の幻覚を検出する能力を評価することを目的としています。ChatGPT-4oを使用し、幻覚は回答の正確性に基づいて3つのタイプに分類されました。142人の研修医が参加し、AIの理解度や使用頻度が誤り検出能力に与える影響を調査しました。結果は、AIリテラシーと批判的思考スキルの向上が必要であることを示唆しています。 方 法: この多施設横断調査研究には、一般診療専門研修を受けている142人の研修医が参加しました。ChatGPT-4oの正確性と一貫性、研修医の反応時間、正確性、感度(d')、反応傾向(β)を評価しました。バイナリ回帰分析を用いて、研修医の誤り識別能力に影響を与える要因を探りました。 結 果: 137人の参加者が含まれ、平均年齢は25.93歳でした。参加者の半数はAIに不慣れで、35.0%は未使用でした。ChatGPT-4oの全体的な正確性は80.8%でしたが、専門的な実践における正確性は57.0%に低下し、人間による検証後は44.2%に減少しました。87件のAI生成の幻覚が特定され、検出の平均正確性は55.0%、感度は0.39でした。回帰分析により、短い反応時間(OR=0.92, P=0.02)、自己評価のAI理解度の高さ(OR=0.16, P=0.04)、AIの使用頻度の多さ(OR=10.43, P=0.01)が厳格な誤り検出基準と関連していることが示されました。 結 論: 研修医は、特に臨床シナリオにおいてChatGPT-4oの誤りを特定するのに苦労していることが明らかになりました。これは、医療教育におけるAIの効果的な統合を確保するために、AIリテラシーと批判的思考スキルの向上が重要であることを示しています。