敵対的攻撃とAIの説明可能性手法による胸部X線畳み込みニューラルネットワークの段階的な毒化
カテゴリ:診断支援・画像解析
公開日:2026年2月19日
タイトル:Gradual poisoning of a chest x-ray convolutional neural network with an adversarial attack and AI explainability methods
雑誌名:Sci Rep. 2025 Jul 01; 15(1): 21779.
概 要:
本研究は、人工知能の安全性を確保するために、敵対的攻撃による胸部X線畳み込みニューラルネットワークの毒化の影響を調査しました。一般的なResNet肺炎分類モデルを作成し、BadNets攻撃を用いて毒化データを適用しました。異なる毒化データの比率(2%、16.7%、100%)を持つデータセットと、通常のテストデータと毒化画像を含むテストセットを使用し、モデルの性能を評価しました。SHAPを用いた可視化により、モデルの腐敗が進むにつれて性能が低下し、毒化テストセットでの予測精度が向上する様子が示されました。16.7%の毒化モデルでは、正常テストセットでトリガーに焦点を当てないことが観察され、腐敗の最小閾値が存在する可能性が示唆されました。
方 法:
本研究は、一般的なResNet肺炎分類モデルを用いた実験で、BadNets攻撃による毒化データを適用しました。毒化データの比率は2%、16.7%、100%で、通常のテストデータと毒化画像を含むテストセットの2種類を使用しました。主要評価指標は、モデルの性能の変化であり、SHAPを用いて可視化しました。
結 果:
毒化データの比率が増加するにつれて、正常テストセットでの性能が低下し、毒化テストセットでの予測精度が向上しました。16.7%の毒化モデルでは、SHAP可視化によりトリガーへの焦点が見られましたが、正常テストセットでは焦点が当たらないことが確認されました。2%モデルでは最小限の影響が観察されました。
結 論:
本研究は、敵対的攻撃によるモデルの腐敗の進行を示し、今後の研究やモデルにおける介入の可能性を特定しました。腐敗の最小閾値が存在する可能性があり、モデルを敵対的攻撃から保護するための対策が必要であることが示唆されました。