MEDICINE & AI

ポルトガル語の医療試験問題に対するChatGPTのパフォーマンス:ChatGPT-3.5 TurboとChatGPT-4o Miniの比較分析

カテゴリ:医学教育

公開日:2026年2月19日

タイトル:ChatGPT's Performance on Portuguese Medical Examination Questions: Comparative Analysis of ChatGPT-3.5 Turbo and ChatGPT-4o Mini 雑誌名:JMIR Med Educ. 2025 Mar 05; 11: e65108. doi: 10.2196/65108. Epub 2025 Mar 05. 概 要: 本研究は、ChatGPT-3.5 TurboとChatGPT-4o Miniが2023年のポルトガルの医療試験問題に対するパフォーマンスと一貫性を評価し、両モデルの人間の受験者との比較を行いました。医療教育におけるChatGPTの進展が評価や学習を向上させる可能性を示唆しています。ChatGPT-4o Miniは、医療候補者を上回る成績を収めました。 方 法: ChatGPT-3.5 Turboは2024年7月18日に試験の第1部(74問)を、ChatGPT-4o Miniは2024年7月19日に第2部(74問)を受験しました。各モデルは自然言語処理能力を用いて回答を生成し、一貫性をテストするために「確信していますか?」と尋ねました。モデルのパフォーマンスは人間の候補者と比較され、McNemar検定とt検定を用いて分析されました。 結 果: ChatGPT-4o Miniは2023年のPNA試験で65%(48/74)の正答率を達成し、ChatGPT-3.5 Turboを上回りました。また、ChatGPT-4o Miniは医療候補者を上回る成績を示しましたが、ChatGPT-3.5 Turboはより控えめなパフォーマンスでした。 結 論: 本研究は、医療教育におけるChatGPTモデルの進展と可能性を強調し、教師の監視の下での慎重な実施とさらなる研究の必要性を示しています。