MEDICINE & AI

深層学習とファインチューニングされた大規模言語モデルのアンサンブルによるエンティティ認識の改善:VAERSおよびソーシャルメディアからの有害事象抽出のケーススタディ

カテゴリ:公衆衛生・予防医療

公開日:2026年2月19日

タイトル:Improving entity recognition using ensembles of deep learning and fine-tuned large language models: A case study on adverse event extraction from VAERS and social media. 雑誌名:J Biomed Inform. 2025 Mar; 163: 104789. 概 要: この研究は、COVID-19ワクチンに関連する有害事象(AE)の抽出を目的として、従来の深層学習モデルと大規模言語モデル(LLM)の効果を評価し、これらのモデルのアンサンブルがパフォーマンスに与える影響を検討しました。従来のモデルは特徴表現を学習するのに優れていますが、大量のラベル付きデータを必要とします。一方、LLMは文脈情報の理解に優れていますが、エンティティ認識タスクでのパフォーマンスが不安定です。研究では、VAERS、Twitter、Redditからのデータを使用し、ワクチン、接種、AEの3種類のエンティティを抽出しました。 方 法: 本研究では、VAERSから230件、Twitterから3,383件、Redditから49件の報告と投稿を使用しました。GPT-2、GPT-3.5、GPT-4、Llama-2 7b、Llama-2 13bなどの複数のLLMと、従来の深層学習モデル(RNN、BioBERT)をファインチューニングしました。パフォーマンスを向上させるため、最も良好な3つのモデルのアンサンブルを作成しました。評価には、厳密および緩和されたF1スコアを使用し、全体のパフォーマンスを評価するためにマイクロ平均F1を用いました。 結 果: アンサンブルモデルは、「ワクチン」、「接種」、「AE」のエンティティを特定する上で最良のパフォーマンスを示し、厳密F1スコアはそれぞれ0.878、0.930、0.925、マイクロ平均スコアは0.903を達成しました。これらの結果は、特定のタスクに対するモデルのファインチューニングの重要性と、アンサンブル手法の効果を示しています。 結 論: この研究は、COVID-19ワクチン接種後のAE関連情報を抽出するために、ファインチューニングされた従来の深層学習モデルとLLMのアンサンブルが効果的であることを示しました。これは、バイオメディカル分野における自然言語処理の進展に寄与し、薬剤監視および公衆衛生監視のためのテキストデータからのAE抽出の改善に関する貴重な洞察を提供します。