MEDICINE & AI

ハンガリーの電子健康記録からの個人識別情報のNLPによる除去

カテゴリ:診断支援・画像解析

公開日:2026年2月19日

タイトル:NLP-based removal of personally identifiable information from Hungarian electronic health records 雑誌名:Front Artif Intell. 2025; 8: 1585260. 概 要: 本研究は、ハンガリー語の電子健康記録(EHR)から個人識別情報(PII)を自動的に除去するための自然言語処理(NLP)モデルを提案しています。GDPRに基づく患者のプライバシー保護のため、個人データの匿名化や擬似匿名化が求められます。研究では、デブレツェン大学から収集した臨床文書のコーパスを用いて、90,000件以上のPIIを含む15,000件以上の文書を注釈付けし、モデルを訓練しました。モデルは、研究データの質を損なうことなく、機密情報を効果的に保護できることが示されました。 方 法: 本研究は、ハンガリー語の医療記録からPIIを認識するためにspaCyモデルを使用したコホート研究です。デブレツェン大学からの電子健康記録を基に、ルールベースの方法で事前に注釈を付けた臨床文書のコーパスを作成しました。モデルの訓練には、15,000件以上の文書と90,000件以上のPIIが含まれています。モデルの性能評価には別の検証コーパスも使用しました。 結 果: モデルの性能評価では、F1スコアが0.9697から0.9926の範囲であり、検証コーパスでは0.9772から0.9867の範囲でした。リスク分析の結果、検証データセットから99.67%の機密情報が成功裏に除去されました。これにより、モデルが未見の例にも効果的に対応できることが示されました。 結 論: 本研究のモデルは、臨床テキストにおけるPIIの特定において非常に効果的であり、研究データの質を損なうことなく機密情報を保護できる可能性があります。今後は、異なる医療機関からの多様なデータセットでの追加テストが必要ですが、モデルの改善により、データの匿名化プロセスの効率を大幅に向上させることが期待されます。