MEDICINE & AI

医療文書における大規模言語モデルの評価フレームワーク:開発と実用性の研究

カテゴリ:手術支援

公開日:2026年2月19日

タイトル:Evaluation Framework of Large Language Models in Medical Documentation: Development and Usability Study 雑誌名:J Med Internet Res. 2024 Nov 20; 26: e58329. doi: 10.2196/58329. Epub 2024 Nov 20. 概 要: 本研究は、大規模言語モデル(LLM)が生成する医療文書の正確性と臨床適用性を評価するためのフレームワークを開発・検証することを目的としています。LLMの進展は医療分野において大きな機会を提供しますが、出力の正確性や信頼性の確保、品質基準の欠如が臨床応用に対する懸念を引き起こしています。特に、救急部門の記録に焦点を当て、AIの医療文書への統合を促進することを目指しました。 方 法: Healthcare Prompt-a-thonという競技イベントを開催し、52名の参加者が韓国特化型LLMであるHyperCLOVA Xを用いて33件の初期ED記録を生成しました。評価は二重アプローチで行い、まず4名の医療専門家が5つの基準(適切性、正確性、構造/フォーマット、簡潔さ、臨床的妥当性)に基づいて5段階評価を行いました。次に、出力のエラーを分類・カウントするフレームワークを開発し、7つの主要エラータイプを特定しました。評価者間の一致度を評価するために、ピアソン相関係数やクラス内相関係数(ICC)を用いました。 結 果: 臨床評価は高い評価者間信頼性を示し、ICC値は0.653から0.887(P<.001)でした。定量的分析では、無効生成エラーが最も多く、全エラーの35.38%を占め、構造的欠陥エラーが臨床評価スコアに最も大きな負の影響を与えました(Pearson r=-0.654; P<.001)。定量的エラー数と臨床評価スコアの間には強い負の相関が見られ(Pearson r=-0.633; P<.001)、エラー率が高いほど臨床的受容性が低下することが示されました。 結 論: 本研究は、提案した評価フレームワークの信頼性と臨床的受容性を強く支持します。このフレームワークは、臨床の負担を軽減し、医療におけるAI技術の責任ある統合を促進する可能性があり、今後の研究や実用的応用に向けた有望な方向性を示唆しています。