整形外科のウォルチグレノイド分類の解釈における広く訓練されたLLMの限界
カテゴリ:手術支援
公開日:2026年2月19日
タイトル:Limitations of broadly trained LLMs in interpreting orthopedic Walch glenoid classifications
雑誌名:Front Artif Intell. 2025; 8: 1644093.
概 要:
本研究は、整形外科におけるウォルチグレノイド分類の解釈における2つの人気のある大規模言語モデル(LLM)、Claude 3.5 SonnetとDeepSeek R1の精度を評価しました。医療画像の解釈におけるAIの統合が進む中、これらのモデルは、特に医療画像の解釈において限界があることが示されました。テストには、Radiopediaからの7つの白黒ウォルチグレノイド図が使用され、モデルは専門的な医療訓練なしで評価されました。結果、DeepSeekは44%の精度を達成しましたが、Claudeは0%でした。両モデルの共通の誤りには、A2をA1(32%)またはB2(20%)として誤分類することが含まれました。これらの結果は、医療画像の解釈における広く訓練されたLLMの限界を強調しています。
方 法:
この研究は、医療画像の解釈におけるLLMの精度を評価するために、7つの白黒ウォルチグレノイド図を用いた実験を行いました。モデルは、Perplexity.aiを通じてアクセスされ、専門的な医療訓練なしで評価されました。DeepSeekは44%の精度を示し、Claudeは0%でした。指示の長さと応答精度の間には軽度の正の相関が見られました。
結 果:
DeepSeekは44%の精度を達成し、Claudeは0%でした。両モデルは、A2をA1またはB2として誤分類する共通の誤りを示しました。これらの結果は、広く訓練されたLLMが医療画像を解釈する能力に限界があることを示しています。
結 論:
この研究は、2025年2月時点で、一般に利用可能な広く訓練されたLLMが医療画像の解釈に必要な一貫性と精度を欠いていることを結論付けています。臨床応用の前に専門的な訓練が必要であることが強調されました。