MEDICINE & AI

高度なプロンプト技術を用いた医療学習者と臨床医のための診断ツールとしての大規模言語モデルの評価

カテゴリ:手術支援

公開日:2026年2月19日

タイトル:Evaluation of large language models as a diagnostic tool for medical learners and clinicians using advanced prompting techniques. 雑誌名:PLoS One. 2025; 20(8): e0325803. doi: 10.1371/journal.pone.0325803. Epub 2025 Aug 01. 概 要: 本研究は、大規模言語モデル(LLMs)の診断精度を評価し、臨床シナリオにおける高度なプロンプトエンジニアリング技術の役割を探ることを目的としています。これまでの研究は主にChatGPTなどのプロプライエタリモデルに依存しており、オープンソースのLLMsの応用は十分に検討されていませんでした。研究では、llama-3.1-70b-versatile、llama-3.1-8b-instant、mixtral-8x7b-32768の3つのオープンソースLLMsの性能を分析し、診断精度を評価しました。 方 法: 本研究では、3つのオープンソースLLMsを用いて、Medscape Clinical Challengeの質問に対する応答を高度なプロンプトエンジニアリングを用いて評価しました。応答は正確性、精度、特異度、感度に基づいて記録され、評価されました。また、基本的なプロンプト課題を用いた感度分析を行い、視覚資産を含むケースを除外しました。結果は、GPT-3.5の以前のパフォーマンスデータと比較されました。 結 果: llama-3.1-70b-versatile、llama-3.1-8b-instant、mixtral-8x7b-32768は、それぞれ79%、65%、62%の正答率を達成し、GPT-3.5(74%)を上回りました。診断精度、精度、感度、特異度の応答はすべてGPT-3.5の以前の報告を上回りました。高度なプロンプト戦略を用いた結果は、基本的なプロンプトに基づく結果よりも優れていました。感度分析でも、視覚資産を除外した場合に類似の傾向が見られました。 結 論: 高度なプロンプト技術を用いることで、LLMsは臨床的に正確な応答を生成できることが示されました。本研究は、特にバージョンの廃止によりアクセス性と再現性の面で制限があるプロプライエタリモデルの限界を強調しています。今後の研究では、プロンプトエンジニアリング技術を用い、オープンソースモデルの使用を優先することが、研究の再現性を確保するために重要です。