高齢者精神科評価における大規模言語モデルのシステム的失敗モード:スコーピングレビュー
カテゴリ:高齢者医療・介護
公開日:2026年9月25日
タイトル:Systemic Failure Modes of Large Language Models in Geriatric Psychiatric Assessment: A Scoping Review
雑誌名:The American journal of geriatric psychiatry : official journal of the American Association for Geriatric Psychiatry. 2026 Aug 22; doi: 10.1016/j.jagp.2026.08.016.
概 要:
大規模言語モデル(LLM)は医療試験での強力なパフォーマンスを示していますが、高齢者精神科評価における信頼性は不確かです。特に、せん妄、認知症、晩年のうつ病が虚弱、ポリファーマシー、長い臨床歴の中で共存する場合において、LLMの失敗モードを実証的に評価し、リスク管理に関連するものを特定することを目的としました。
方 法:
2023年1月1日から2025年12月31日までに発表された実証評価の体系的スコーピングレビューを実施しました。生物医学および技術的な情報源を検索し、診断推論、経時的歴史の統合、安全性および薬物推論、バイアス関連の結果を含む臨床的に関連するタスクでLLMをテストした研究を含めました。証拠はチャート化され、再発する失敗パターンの実用的な分類法を導出するために質的に統合されました。
結 果:
47件の研究が選定基準を満たしました。4つの収束した失敗モードが浮かび上がりました:(1) 長期的推論における診断の不安定性、(2) 誤解を招く入力に対する脆弱性、(3) 動画ベースのモデルにおける時間的スパース性、(4) システム的年齢主義と価値の不整合が臨床的な物語やリスク評価、ケア推奨を歪める可能性。
結 論:
現在のLLMアーキテクチャは、自律的な高齢者精神科評価には不十分です。短期的な使用は、人間の監視、構造化された認知強制の安全策、経時的複雑性、敵対的条件、安全イベント、バイアスをストレステストする評価プロトコルを強調する低リスクの支援機能に制限すべきです。