MEDICINE & AI

口腔病理における意思決定支援ツールとしての大規模言語モデルの比較分析

カテゴリ:手術支援

公開日:2026年2月28日

タイトル:Comparative analysis of large language models as decision support tools in oral pathology 雑誌名:Sci Rep. 2026 Feb 27; doi: 10.1038/s41598-026-41533-z. Epub 2026 Feb 27. 概 要: 本研究では、口腔病変の組織病理学的記述を解釈するための意思決定支援システムとして、4つの大規模言語モデル(LLMs)チャットボット(ChatGPT-4.0、ChatGPT o1-preview、Gemini、Meta AI)の性能を評価しました。各モデルが生成した主な解釈と3つの鑑別診断との一致を評価し、2人の認定病理医によって確立されたコンセンサス診断と比較しました。出力は、異なる、類似、正しいの3つに分類されました。統計解析には、モデル性能を比較するためのFriedman検定、ペアワイズ比較のためのWilcoxon符号付き順位検定、合意を評価するためのCohenのκ、年齢と性別の影響を評価するための回帰分析が含まれました。 方 法: 本研究は、4つの大規模言語モデルを用いた比較研究であり、各モデルの出力を2人の認定病理医の診断と比較しました。出力は、異なる、類似、正しいの3つに分類され、Friedman検定やWilcoxon符号付き順位検定を用いてモデル間の性能を評価しました。年齢と性別の影響も回帰分析で評価しました。 結 果: ChatGPT o1-previewは、68.6%の出力が参照診断と一致し、最も高い一致率を示しました。次いでMeta AI(65.7%)、ChatGPT-4.0(59.8%)、Gemini(27.5%)の順でした。ChatGPT o1-previewとMeta AIは、病理医との合意がそれぞれκ=0.66、κ=0.63であり、実質的な合意を示しました。年齢が上がるにつれて、ChatGPT-4.0、Meta AI、Geminiの性能はわずかに有意に低下しましたが、ChatGPT o1-previewには有意な影響は見られませんでした。 結 論: ChatGPT o1-previewは、口腔病理医の参照診断との一致が最も高く、LLMsが口腔組織病理の解釈における補完的な意思決定支援ツールとしての可能性を示しました。しかし、モデル間の大きな変動が見られ、慎重な実装と人間の監視が引き続き必要であることが強調されました。