人間がラベル付けしたデータで訓練された人工知能ツールは人間のバイアスを反映する:大規模な膝関節症の連続臨床コホートにおけるケーススタディ
カテゴリ:手術支援
公開日:2026年2月19日
タイトル:Artificial intelligence tools trained on human-labeled data reflect human biases: a case study in a large clinical consecutive knee osteoarthritis cohort
雑誌名:Sci Rep. 2024 Nov 05; 14(1): 26782.
概 要:
本研究は、医療画像を読む際の人間のバイアスが、人工知能(AI)ツールにどのように影響を与えるかを検討しました。膝関節症の外部検証データセット(50人)と、6年間の連続臨床コホート(8,273人)を用いて、FDA承認およびCEマーク取得済みのAIツールの非均一性を評価しました。画像を左右反転させ、AIツールのKellgren-Lawrenceグレードの非均一性を調査した結果、外部検証データセットで20-22%、コホートで13.6%の不一致が見られました。しかし、外部検証データセットにおいては、シニア放射線科医との精度に有意差はなく、年齢や性別に関するバイアスも確認されませんでした。AIの非均一性は、人間に対する評価性能を向上させる可能性がありますが、性能が劣る画像領域の調査が必要です。
方 法:
本研究は、膝関節症の外部検証データセット50人と、6年間の連続臨床コホート8,273人を対象とした観察研究です。AIツールのKellgren-Lawrenceグレードの非均一性を評価するために、画像を左右反転させて分析しました。主要評価指標は、AIツールとシニア放射線科医の診断結果の不一致率です。
結 果:
AIツールは、外部検証データセットで20-22%、コホートで13.6%の不一致を示しました。外部検証データセットにおいて、シニア放射線科医との精度に有意差は見られず、年齢や性別に関するバイアスも確認されませんでした。AIの非均一性は、評価性能を向上させる可能性がありますが、性能が劣る画像領域の調査が求められます。
結 論:
AIツールは人間のバイアスを反映する可能性があり、膝関節症の診断においては、AIの非均一性が評価性能を向上させる一方で、特定の画像領域における性能の低下を調査する必要があることが示されました。