MEDICINE & AI

大規模言語モデルの文献レビューにおけるツールとしての出現:大規模言語モデル支援による系統的レビュー

カテゴリ:公衆衛生・予防医療

公開日:2026年2月19日

タイトル:The emergence of large language models as tools in literature reviews: a large language model-assisted systematic review. 雑誌名:J Am Med Inform Assoc. 2025 Jun 01; 32(6): 1071-1086. 概 要: 本研究は、大規模言語モデル(LLMs)が科学的レビューの作成プロセスにおいてどのように使用されているかを要約することを目的としています。具体的には、LLMsをレビュー自動化に使用する方法論的論文と、LLMsの支援を受けたことを明記したレビュー論文を調査しました。3788件の文献から172件の研究が最終レビューに選ばれ、ChatGPTおよびGPTベースのLLMsがレビュー自動化において最も支配的なアーキテクチャであることが示されました。 方 法: 2024年6月にPubMed、Scopus、Dimensions、Google Scholarで人間のレビュアーによって検索が行われました。スクリーニングと抽出プロセスは、OpenAIのGPT-4oモデルに基づくLLMアドオンを使用してCovidenceで実施されました。データのクリーニング、図の生成、原稿の草稿作成にはChatGPTとScite.aiが使用されました。 結 果: 最終的に172件の研究が選ばれ、ChatGPTおよびGPTベースのLLMsがレビュー自動化において73.2%の割合で使用されていました。多くのレビュー自動化プロジェクトが見つかりましたが、LLMの使用を認めた実際のレビュー論文は26件(15.1%)にとどまりました。レビューの特定の段階の自動化に関する引用が多く、特に文献検索(34.9%)やデータ抽出(31.4%)が目立ちました。GPTベースとBERTベースのモデルの性能を比較したところ、データ抽出においてGPTベースのモデルが平均精度83.0%(SD=10.4)、再現率86.0%(SD=9.8)で優れていました。 結 論: LLM支援による系統的レビューは、LLMsを使用したレビュー自動化に関連する研究プロジェクトが多数存在することを示しました。数値データの抽出精度が低いなどの限界はあるものの、LLMsが科学的レビューの実施方法を変えることが期待されます。