欧州一般外科専門医試験における大規模言語モデルのパフォーマンスの低さ:専門家および外科レジデントとの比較研究
カテゴリ:医学教育
公開日:2026年2月19日
タイトル:Large language models underperform in European general surgery board examinations: a comparative study with experts and surgical residents.
雑誌名:BMC Med Educ. 2025 Aug 23; 25(1): 1193. doi: 10.1186/s12909-025-07856-7. Epub 2025 Aug 23.
概 要:
本研究は、人工知能(AI)が医療教育と評価において変革的なツールとなる中、欧州一般外科専門医試験の問題に対する大規模言語モデル(LLM)のパフォーマンスを専門医および外科レジデントと比較しました。120の選択問題を用いて、各モデルの正確性を評価し、問題の形式、長さ、難易度によるパフォーマンスの変動を分析しました。結果として、専門医が最も高い正確性を示し、LLMは全体的に専門家に劣る結果となりました。
方 法:
120の選択問題を一般外科試験およびボードレビューの問題バンクから体系的に抽出し、4つの大規模言語モデル(Llama-3、GPT-4o、Gemini、Copilot)と30人の外科医(専門医15人、レジデント15人)に対して、タイムド・シングルセッション条件下でGoogleフォームを使用して実施しました。参加者の人口統計(年齢、性別、経験年数)を記録し、問題は単語数(短、中、長)および難易度(易、中、難)で分類しました。グループの正確性率をANOVAで比較しました。
結 果:
専門医は81.6%の正確性を達成し、外科レジデントは69.9%でした。LLMの中ではLlama-3が65.8%で最も良好な結果を示し、Copilotは51.7%で最も低い結果でした。LLMのパフォーマンスは、問題の難易度と長さが増すにつれて著しく低下しました。Llama-3は30人中26位にランクインし、他のLLMは60%の正確性を超えられませんでした。
結 論:
現在のLLMは、高度な医療知識を必要とする問題に対して専門医に比べてパフォーマンスが劣ることが示され、外科教育においては専門的な臨床判断の代替ではなく、補助的なツールとしての役割が強調されました。