遺体の腕神経叢解剖におけるLLM生成の段階的指示の構造的評価
カテゴリ:医療現場の業務効率化
公開日:2026年2月19日
タイトル:A structured evaluation of LLM-generated step-by-step instructions in cadaveric brachial plexus dissection
雑誌名:BMC Med Educ. 2025 Jul 01; 25(1): 903. doi: 10.1186/s12909-025-07493-0. Epub 2025 Jul 01.
概 要:
本研究は、ChatGPT-4o、Grok 3.0、Gemini Advanced 2.0 Pro、DeepSeekといった大規模言語モデル(LLM)が、感覚運動の相互作用を必要とする環境、特に遺体の腕神経叢解剖において、段階的な指示としてどのように機能するかを比較分析することを目的としています。解剖学的に複雑でエラー許容度が低い領域におけるLLMの性能を評価するため、28項目の構造化質問を作成し、4人の経験豊富な解剖学者がモデルの応答を評価しました。
方 法:
28項目の構造化質問セットを作成し、4人の経験豊富な解剖学者が、修正DISCERNスケール(mDISCERN)とグローバル品質スコア(GQS)を用いてモデルの応答を盲目的に評価しました。可読性は、Flesch Reading Ease Score(FRES)、Flesch-Kincaid Grade Level(FKGL)、Simple Measure of Gobbledygook(SMOG)、Gunning Fog Index(GFI)、Coleman-Liau Index(CLI)を用いて評価されました。内容の妥当性は内容妥当性指数(CVI)でテストされ、評価者間の信頼性は、クラス内相関係数(ICC)とコーエンのカッパを用いて計算されました。
結 果:
ChatGPT-4oとGrok 3.0は、科学的正確性と指導構造において最高のスコアを得ました(p < 0.01)。DeepSeekは高い可読性を示しましたが、内容の深さは限られていました。一方、Geminiはすべてのパラメータで中程度のパフォーマンスを示しました。可読性の指標は、品質スコアと有意に相関していました。
結 論:
本研究は、感覚的な課題を伴うトレーニングコンテキストにおけるLLMベースのシステムの性能を体系的に調査した初めての研究の一つです。LLMは実際の人間のドナーが提供する倫理的および教育的価値を置き換えることはできませんが、限られたメンターシップや遺体の入手可能性のある環境で、スケーラブルで個別化されたサポートを提供する可能性があります。本研究は、資源が限られた環境における解剖学教育を支援することを目的としており、将来のAI支援の遺体研究や外科解剖における意思決定支援モデルの基礎的な参考資料となることを目指しています。