小児健康に関する問い合わせに応答する消費者AIシステムの安全境界維持:自然環境および敵対的圧力条件下でのクロスプラットフォームベンチマーク評価
カテゴリ:医学教育
公開日:2026年7月15日
タイトル:Safety boundary maintenance in consumer AI systems responding to pediatric health queries: a cross-platform benchmark evaluation under naturalistic and adversarially pressured conditions.
雑誌名:NPJ Digit Med. 2026 Jul 14; doi: 10.1038/s41746-026-02985-9.
概 要:
消費者向けAIチャットボットは、健康情報を求める数億人のユーザーに利用されていますが、実際の介護者の圧力下での安全境界維持に関する体系的な評価は不足しています。本研究では、600件の小児健康に関する問い合わせを含むPediatricSafetyBench-v2を評価しました。このベンチマークは、300件の本物の介護者の問い合わせと300件の敵対的バリエーションから構成され、4つの消費者AIシステム(GPT-4o-mini、Gemini-2.0-Flash、Claude-3.5-Haiku、Llama-3.1-8B)で評価されました。安全境界維持は、検証された5要素の安全総合スコアを用いて評価されました。
方 法:
本研究は、600件の小児健康に関する問い合わせを対象にしたクロスプラットフォーム評価です。300件の本物の介護者の問い合わせと300件の敵対的バリエーションを用い、4つの消費者AIシステムで評価しました。安全境界維持は、安全総合スコア(最大15点)を用いて評価され、独立した人間の評価者によって検証されました。安全適切な閾値は10点以上と設定されました。
結 果:
全体の安全適切率は95.5%でした。安全志向のシステムプロンプトの導入により、全モデルで安全適切率が5.9ポイント向上しました。敵対的な介護者の圧力は、全モデルにおいて安全総合スコアを高める結果となりました。偽の専門知識の主張が最も脆弱性を引き起こす圧力パターンであり、感情の高まりは最高スコアに関連していました。
結 論:
消費者AIシステムは、大多数の小児健康に関するインタラクションにおいて安全境界を維持しています。PediatricSafetyBench-v2は、長期的な安全監視のために公開されました。