MEDICINE & AI

非典型的な症状を持つ一般的な疾患に対するChatGPT生成の鑑別診断の評価:記述研究

カテゴリ:災害・救急医療

公開日:2026年2月19日

タイトル:Evaluation of ChatGPT-Generated Differential Diagnosis for Common Diseases With Atypical Presentation: Descriptive Research 雑誌名:JMIR Med Educ. 2024 Jun 21; 10: e58758. doi: 10.2196/58758. Epub 2024 Jun 21. 概 要: 本研究は、非典型的な症状を持つ一般的な疾患に対するChatGPTの鑑別診断の精度を評価することを目的としています。診断エラーの持続は、医療知識や診断技術の進展にもかかわらず、非典型的な病気の症状の理解が重要であることを示しています。AI、特にGPT-4のような生成的事前学習トランスフォーマーは、診断精度の向上に寄与する可能性がありますが、非典型的な症状への対応についてはさらなる探求が必要です。 方 法: 本研究では、一般医学ジャーナルからの25の臨床事例を使用し、非典型的な症状を持つ一般的な疾患を特徴づけました。2人の一般内科医が症例を非典型性に基づいて分類し、ChatGPTを用いて臨床情報に基づく鑑別診断を生成しました。AI生成の診断と最終診断の一致率を測定し、特にトップ1およびトップ5の鑑別診断に焦点を当てました。 結 果: ChatGPTの診断精度は、非典型的な症状の増加に伴い低下しました。カテゴリー1(C1)のケースでは、トップ1の一致率は17%(n=1)、トップ5では67%(n=4)でした。カテゴリー3(C3)および4(C4)では、トップ1の一致率は0%であり、トップ5でも著しく低い一致率を示しました。カイ二乗検定では、非典型性の少ない(C1+C2)群とより非典型的な(C3+C4)群のトップ1の診断精度に有意差は見られませんでしたが、トップ5の分析では非典型性の少ないケースが高い精度を示しました(P=.048)。 結 論: ChatGPT-4は、一般的な疾患の典型的および軽度非典型的な症状の診断において補助ツールとしての可能性を示しましたが、非典型性が高まるにつれてその性能は低下しました。この研究の結果は、AIシステムが診断の実用性を向上させるために、より広範な言語能力、文化的理解、および多様な臨床シナリオを包含する必要があることを強調しています。