標準化された質問票に基づく子宮頸がん管理における大規模言語モデルの性能評価:比較研究
カテゴリ:医療現場の業務効率化
公開日:2026年2月19日
タイトル:Performance Evaluation of Large Language Models in Cervical Cancer Management Based on a Standardized Questionnaire: Comparative Study
雑誌名:J Med Internet Res. 2025 Feb 05; 27: e63626. doi: 10.2196/63626. Epub 2025 Feb 05.
概 要:
この研究は、子宮頸がん管理における大規模言語モデル(LLMs)の性能と解釈可能性を体系的に評価することを目的としています。子宮頸がんは、特に資源の乏しい地域で女性の死因の第4位を占めており、効果的な予防と管理には包括的なアプローチが必要です。研究では、国際的および国内のガイドラインに基づいた100の標準化された質問を設計し、9つのモデルを評価しました。
方 法:
AlpacaEvalリーダーボードバージョン2.0からモデルを選択し、一般知識、スクリーニング、診断、治療に関する質問を入力しました。CO-STARフレームワークを用いてプロンプトを開発し、回答の正確性、ガイドライン遵守、明瞭さ、実用性を評価しました。評価はA(3点)、B(2点)、C(1点)、D(0点)で行い、効果率はAおよびBの回答数を総質問数で割ったものとしました。
結 果:
9つのモデルが研究に含まれ、ChatGPT-4.0 Turboが平均スコア2.67(効果率94.00%)で最も高い評価を得ました。QiZhenGPTは一貫して低いパフォーマンスを示しました。プロンプトの使用により、特許モデルの人間の注釈との整合性が改善されましたが、医療専門モデルの改善は限られていました。
結 論:
ChatGPT-4.0 TurboやClaude 2などの特許LLMsは、論理的分析を伴う臨床意思決定において有望であり、プロンプトの使用が一部のモデルの精度を向上させる可能性があります。しかし、医療専門モデルは期待されたほどの性能を示さず、今後の研究がLLMsの実際の医療への応用を探る必要があることが強調されました。