関係分類アプローチを用いたSemRepのカバレッジ向上
カテゴリ:手術支援
公開日:2026年2月19日
タイトル:Enhancing the coverage of SemRep using a relation classification approach
雑誌名:J Biomed Inform. 2024 Jul; 155: 104658.
概 要:
本研究は、バイオメディカル文献マイニングにおける関係抽出の重要性を背景に、広範な自然言語処理ツールSemRepの性能向上を目指しました。SemRepは、バイオメディカルテキストから主語-述語-目的語の三重項を抽出する基盤を提供していますが、再現率が低いため、SemMedDBのサイズと有用性を向上させるために関係分類アプローチを採用しました。具体的には、既存の評価データセットを組み合わせて訓練データを生成し、PubMedBERTモデルを用いて性能を向上させました。
方 法:
本研究では、既存のSemRep評価データセットを組み合わせて訓練データを生成し、PubMedBERTモデルを用いて追加の対照的事前学習とファインチューニングを行いました。エンティティの表現として、メンション、セマンティックタイプ、セマンティックグループの3つを評価し、SemRep Gold Standardデータセットの一部でモデル性能を評価しました。また、12,000件のPubMed抄録に対するモデルの効果も評価しました。
結 果:
最良のモデルは、精度0.62、再現率0.81、F1スコア0.70を達成しました。12,000件の抄録に対する評価では、モデルをPubMed全体に適用することでSemMedDBのサイズを倍増できる可能性が示されました。さらに、モデルが予測した506件の三重項の質を手動で評価したところ、67%が正確であることが確認されました。
結 論:
本研究の結果は、バイオメディカル文献における関係の包括的なカバレッジを実現するモデルの可能性を示しており、バイオメディカル文献マイニングのさまざまな応用を強化する潜在能力を持つことが示されました。データとコードは、https://github.com/Michelle-Mings/SemRep_RelationClassification で入手可能です。