MEDICINE & AI

医療トリアージをAI倫理のベンチマークとして

カテゴリ:災害・救急医療

公開日:2026年2月19日

タイトル:Medical triage as an AI ethics benchmark 雑誌名:Sci Rep. 2025 Aug 22; 15(1): 30974. 概 要: 本研究では、TRIAGEベンチマークという新しい機械倫理の基準を提案し、大規模言語モデル(LLM)の倫理的意思決定能力を大量傷害シナリオで評価します。医療専門家が作成した医療ジレンマを使用して、AIシステムの倫理的意思決定を現実の高リスクシナリオで評価しました。6つの主要なLLMをTRIAGEで評価し、異なる倫理的および対立的なプロンプトがモデルの行動に与える影響を調査しました。結果として、ほとんどのモデルはランダムな推測を一貫して上回りましたが、オープンソースモデルはプロプライエタリモデルよりも深刻な倫理的誤りを犯しました。LLMに指導的な倫理原則を提供すると、TRIAGEでのパフォーマンスが低下し、他の機械倫理ベンチマークでの結果とは対照的でした。対立的なプロンプトは精度を大幅に低下させました。この研究は、文脈と倫理的枠組みがLLMのパフォーマンスに与える影響を示し、医療における高リスク倫理的意思決定におけるAIの現在の能力と限界についての重要な洞察を提供します。 方 法: 本研究は、医療専門家が作成した医療ジレンマを用いて、6つの主要な大規模言語モデル(LLM)の倫理的意思決定能力を評価するコホート研究です。TRIAGEベンチマークを使用し、異なる倫理的および対立的なプロンプトがモデルの行動に与える影響を調査しました。 結 果: ほとんどのモデルはランダムな推測を一貫して上回りましたが、オープンソースモデルはプロプライエタリモデルよりも深刻な倫理的誤りを犯しました。LLMに指導的な倫理原則を提供すると、TRIAGEでのパフォーマンスが低下しました。また、対立的なプロンプトは精度を大幅に低下させました。 結 論: TRIAGEベンチマークは、文脈と倫理的枠組みがLLMのパフォーマンスに与える影響を示し、医療における高リスク倫理的意思決定におけるAIの能力と限界についての重要な洞察を提供します。