臨床データのパターンを明らかにする:大規模言語モデルとクラスタリングアルゴリズムの役割を探る
カテゴリ:医療現場の業務効率化
公開日:2026年3月25日
タイトル:Unveiling patterns in clinical data: exploring the role of large language models and clustering algorithms
DOI:10.3389/frai.2026.1737530
概 要:本研究は、大規模言語モデル(LLM)が構造化された臨床データ分析においてどのように役立つかを探ることを目的としています。特に、LLMが生成する埋め込みが臨床データセットの構造を保持し、予測モデルの向上に寄与するかを検討しました。リソースが制約された環境においても有用性が期待されます。
方 法:主成分分析(PCA)、t-SNE、k-meansクラスタリングなどの次元削減技術を用いて、LLM埋め込みから得られたデータ構造と元のデータ構造を比較しました。評価指標にはコサイン類似度、曲線下面積(AUC)、R²を用い、100の合成データセットとUCI医療データベース、心内膜炎患者の記録という2つの実データセットで評価しました。BERT、RoBERTa、Llama 2、E5-smallなど複数のLLMアーキテクチャを対象に、予測精度と計算効率を重視しました。
結 果:LLM埋め込みは元のデータ構造と密接に一致し、BERTは線形データセットでコサイン類似度0.95を達成し、Llama 2(30B)は二次データセットで0.85を達成しましたが、計算コストは高くなりました。主変数比率(SVR)の増加に伴い、予測性能が大幅に向上し、合成データ生成に使用された方程式に基づいて異なる3つのグループが特定されました。
結 論:LLMは、既存の臨床データセットを個別化された臨床質問に再利用するために効果的に活用できることが示されました。例えば、感染性心内膜炎や塞栓性脳卒中の患者における手術時期の最適化などが挙げられます。このアプローチは、精密医療の進展とデータ駆動型の臨床意思決定を支援します。