イランの学生におけるChatGPT-3.5-Turbo、ChatGPT-4、およびGoogle Bardのパフォーマンス比較
カテゴリ:医学教育
公開日:2026年2月19日
タイトル:Comparing the performance of ChatGPT-3.5-Turbo, ChatGPT-4, and Google Bard with Iranian students in pre-internship comprehensive exams.
雑誌名:Sci Rep. 2024 Nov 18; 14(1): 28456.
概 要:
本研究は、異なるAI言語モデルのパフォーマンスを、イランの医学生のプレインターンシップ医療試験と比較することを目的としています。ペルシャ語のプレインターンシップ試験3セットとその英語翻訳を使用し、2023年9月末にChatGPT-3.5-Turbo、GPT-4、Google Bardに対してリクエストを送信し、その応答を評価しました。GPTモデルは、応答のランダム性において異なるレベルを示しました。ペルシャ語および英語の試験において、GPT-4が最も高いスコアを獲得し、全試験で1位となりました。Google Bardはペルシャ語試験で平均以下のスコアを記録し、ChatGPT-3.5は全試験で不合格でした。ペルシャ語試験における大規模言語モデル間には有意な差がありましたが、英語試験では全モデルと学生間の統計的な有意差はありませんでした。GPT-4は医療試験において学生や他のモデルを上回るパフォーマンスを示し、医療分野での応用の可能性を示唆していますが、これらのモデルの使用に関する限界を理解するためにはさらなる研究が必要です。
方 法:
本研究は、イランの医学生を対象にしたコホート研究で、ペルシャ語のプレインターンシップ医療試験3セットとその英語翻訳を使用しました。ChatGPT-3.5-Turbo、GPT-4、Google Bardに対して、ペルシャ語と英語でリクエストを送信し、各モデルの応答を評価しました。主要評価指標は、試験のスコアとモデル間のパフォーマンスの比較です。
結 果:
GPT-4は全試験で最高スコアを獲得し、ペルシャ語試験では他のモデルと有意な差がありました。Google Bardはペルシャ語試験で平均以下のスコアを記録し、ChatGPT-3.5は全試験で不合格でした。英語試験では、全モデルと学生間に統計的な有意差は見られませんでした。
結 論:
GPT-4は医療試験において学生や他のモデルを上回るパフォーマンスを示し、医療分野での応用の可能性があることが示されました。しかし、これらのモデルの限界を理解するためにはさらなる研究が必要です。