プロンプトエンジニアリングが医学生試験におけるChatGPTのパフォーマンスに与える影響:横断研究
カテゴリ:医学教育
公開日:2026年2月19日
タイトル:Impact of Prompt Engineering on the Performance of ChatGPT Variants Across Different Question Types in Medical Student Examinations: Cross-Sectional Study
雑誌名:JMIR Med Educ. 2025 Oct 01; 11: e78320. doi: 10.2196/78320. Epub 2025 Oct 01.
概 要:
本研究は、ChatGPTの5つのバリアント(GPT-3.5、GPT-4.0、GPT-4o、GPT-4o1-mini、GPT-4o1)におけるプロンプトエンジニアリングの影響を体系的に評価し、4年生医学生の中間試験および期末試験と比較することを目的としています。100項目の試験データセットを使用し、各モデルに対してプロンプトなしおよびプロンプトエンジニアリング条件下でのパフォーマンスを評価しました。結果は標準化されたルーブリックを用いて採点され、SPSS Statisticsで分析されました。
方 法:
この研究では、100項目の試験データセットを用いて、選択問題、短答問題、臨床ケース分析、画像ベースの質問を含む試験を実施しました。143人の学生のスコアを収集し、プロンプトなしおよびプロンプトエンジニアリング条件下で各モデルのパフォーマンスを5回独立して評価しました。得られたスコアは標準化されたルーブリックで採点され、パーセンテージに変換され、SPSS Statistics (v29.0)を用いて分析されました。
結 果:
中間試験のスコアはGPT-3.5が59.2%、GPT-4o1が94.1%で、期末試験では55%から92.4%の範囲でした。4年生医学生は中間試験で平均89.4%、期末試験で80.2%のスコアを記録しました。プロンプトエンジニアリングはGPT-3.5のパフォーマンスを10.6%(P<.001)、GPT-4.0を3.2%(P=.002)向上させましたが、最適化されたバリアントにはわずかな改善(P=.07-.94)しか見られませんでした。最適化されたモデルは、両試験で学生のパフォーマンスに匹敵またはそれを上回りました。
結 論:
プロンプトエンジニアリングは初期世代モデルのパフォーマンスを向上させる一方で、進化したバリアントは医学生を上回る精度を達成しています。大規模言語モデルが成熟するにつれて、プロンプト設計からモデル選択、マルチモーダル統合、人工知能の批判的な活用へと焦点を移すべきです。