MEDICINE & AI

ChatGPT-4oと4つのオープンソース大規模言語モデルの中国の希少疾患カタログに基づく診断生成性能:比較研究

カテゴリ:医療現場の業務効率化

公開日:2026年2月19日

タイトル:Performance of ChatGPT-4o and Four Open-Source Large Language Models in Generating Diagnoses Based on China's Rare Disease Catalog: Comparative Study 雑誌名:J Med Internet Res. 2025 Jun 18; 27: e69929. doi: 10.2196/69929. Epub 2025 Jun 18. 概 要: 本研究は、希少疾患の診断精度を評価するために、ChatGPT-4oと4つのオープンソース大規模言語モデル(LLM)を比較しました。希少疾患の診断は複雑であり、医師の知識が限られているため困難です。121の希少疾患の臨床症状を中国の希少疾患カタログから抽出し、各モデルの診断精度を比較しました。ChatGPT-4oは90.1%の診断精度を示し、他のモデルとの言語効果やRAG、CoT推論の影響を探りました。 方 法: 121の希少疾患の臨床症状を中国の希少疾患カタログから抽出し、ChatGPT-4oが主要診断と5つの鑑別診断を生成しました。4つのLLMは英語と中国語の両方で評価され、最も低い性能のモデルはRAGとCoTで再評価されました。診断精度はMcNemar検定を用いて比較され、11人の臨床医の希少疾患に対する知識も調査されました。 結 果: ChatGPT-4oは90.1%の診断精度を示し、qwen2.5:7bは中国語で51.2%、英語で47.9%の性能を示しました。Llama3.1:8bは英語で67.8%、中国語で31.4%の精度を示し、言語による差が明らかでした。qwen2.5:72bは両言語で一貫した性能を維持し、RAGの実装によりqwen2.5:7bの精度は79.3%に向上しました。臨床医の調査では、希少疾患管理における知識のギャップが明らかになりました。 結 論: ChatGPT-4oは希少疾患に対する優れた診断性能を示しました。Llama3.1:8bはリソースが限られた英語の診断ワークフローにおいて有用ですが、中国語のアプリケーションにはより大きなモデルが必要です。RAGの統合はオープンソースLLMの精度を向上させることが示されましたが、低パラメータモデルには注意が必要です。病院のIT部門や政策立案者は、モデル選択において言語の関連性を優先し、知識ベースとの統合を検討することを推奨します。