医療におけるChatGPTのレッドチーミングによるモデル行動の実世界の洞察
カテゴリ:公衆衛生・予防医療
公開日:2026年2月19日
タイトル:Red teaming ChatGPT in medicine to yield real-world insights on model behavior
雑誌名:NPJ Digit Med. 2025 Mar 07; 8(1): 149. doi: 10.1038/s41746-025-01542-0. Epub 2025 Mar 07.
概 要:
本研究は、医療における大規模言語モデルの公平性と精度を向上させるために、レッドチーミングの重要性を強調しています。医療従事者、医学生、エンジニアリング学生、技術専門家からなる80人のチームを編成し、実際の臨床ケースを用いてモデルをストレステストし、安全性、プライバシー、幻覚/精度、バイアスの観点から不適切な応答を分類しました。376のユニークなプロンプトに対して1504の応答を分析した結果、20.1%が不適切であり、GPT-3.5では25.8%、GPT-4.0では16%、インターネットを使用したGPT-4.0では17.8%でした。さらに、イベント後にリリースされたGPT-4oをテストしたところ、20.4%が不適切でした。GPT-3.5で適切だった応答の21.5%が更新されたモデルでは不適切となりました。レッドチーミングプロンプトの構築に関する洞察を共有し、モデル評価のためのベンチマークを提示します。
方 法:
本研究は、80人の参加者からなるチームを編成し、376のユニークなプロンプトに対して1504の応答を収集しました。医療に関連する実際のケースを用いてモデルをストレステストし、医療訓練を受けた6人のレビュアーがプロンプトと応答のペアを再分析し、質的な注釈を追加しました。主要評価指標は、不適切な応答の割合です。
結 果:
376のプロンプトに対する応答のうち、20.1%が不適切であり、GPT-3.5では25.8%、GPT-4.0では16%、インターネットを使用したGPT-4.0では17.8%が不適切でした。イベント後にリリースされたGPT-4oでは20.4%が不適切であり、GPT-3.5で適切だった応答の21.5%が更新されたモデルでは不適切となりました。
結 論:
レッドチーミングは、医療における大規模言語モデルの不適切な応答を特定し、モデルの公平性と精度を向上させるための有用な手法であることが示されました。今後のモデル評価のためのベンチマークを提供し、レッドチーミングプロンプトの構築に関する洞察を共有します。