DeepSeekとChatGPTの中国健康専門技術試験における性能:比較研究
カテゴリ:医学教育
公開日:2026年2月19日
タイトル:Performance of DeepSeek and ChatGPT on the Chinese Health Professional and Technical Examination: A comparative study.
雑誌名:PloS One. 2026; 21(1): e0338328. doi: 10.1371/journal.pone.0338328. Epub 2026 Jan 22.
概 要:
本研究は、中国健康専門技術試験におけるDeepSeek-R1とGPT-4o APIの性能を比較し、特に正確性、応答の一貫性、そして一貫した正確性に焦点を当てています。大規模言語モデル(LLM)の医療教育への応用が進む中、専門的な高リスク評価における信頼性は不明瞭です。DeepSeek-R1は最近リリースされた推論強化型LLMであり、看護試験における実証的証拠は限られています。
方 法:
400の公式練習試験の選択問題を4つの能力ユニットと2つの問題タイプ(A/B)に分類しました。両モデルは、全体の正確性、一貫性(繰り返し応答の一致)、および一貫した正確性(一致かつ正確な応答の割合)を評価されました。ユニット、問題タイプ、分野ごとに層別分析を行い、カイ二乗検定を用いて統計的比較を行い、Holm-Bonferroni補正を適用しました。
結 果:
DeepSeek-R1は、GPT-4o APIに比べて全体の正確性が有意に高く(88.5%対67.9%、P < 0.001)、GPT-4o APIは応答の一貫性が高かった(96.5%対88.5%)が、一貫した正確性は低かった(66.7%対84.0%)。複数比較補正後も、基本知識、専門知識、専門的実践能力、タイプAの問題、外科および婦人科看護分野において一貫した正確性に有意差が残りました。
結 論:
DeepSeek-R1は、看護能力評価の複数の次元においてGPT-4o APIを上回り、特に全体の正確性と一貫した正確性において優れた性能を示しました。GPT-4o APIは高い応答の安定性を示しましたが、系統的な誤りの傾向があり、モデル出力の慎重な解釈が必要です。今後の研究では、オープンエンドの臨床推論タスクや実際の評価データを用いたLLMの性能評価が求められます。