一般診療における大規模言語モデル(ChatGPT)の試験:適用知識テストを用いた観察研究
カテゴリ:手術支援
公開日:2026年2月19日
タイトル:Trialling a Large Language Model (ChatGPT) in General Practice With the Applied Knowledge Test: Observational Study Demonstrating Opportunities and Limitations in Primary Care
雑誌名:JMIR Med Educ. 2023 Apr 21; 9: e46599. doi: 10.2196/46599. Epub 2023 Apr 21.
概 要:
本研究は、一般診療におけるChatGPTの強みと弱みを評価することを目的とし、英国の一般医療従事者向けの適用知識テスト(AKT)を使用しました。674のユニークなAKT問題をChatGPTに入力し、その回答を正解と比較しました。結果として、ChatGPTの平均的なパフォーマンスは60.17%であり、過去2年間の合格基準(70.42%)を下回りました。問題の出所や科目によってパフォーマンスに差が見られましたが、難易度との相関はありませんでした。
方 法:
本研究は観察研究で、674のユニークなAKT問題をウェブベースの問題バンクおよび2つのAKT練習問題から収集しました。各問題は2回に分けてChatGPTに入力され、回答の一貫性を評価しました。パフォーマンスは科目、難易度、問題の出所、ChatGPTによる新しい説明の有無に基づいて分析されました。
結 果:
ChatGPTの平均的なパフォーマンスは60.17%で、過去2年間の合格基準を下回りました。出所によって精度に差があり、科目によってもパフォーマンスが異なりましたが、難易度との相関は見られませんでした。また、ChatGPTが提供する新しい説明は精度に影響を与えませんでした。
結 論:
大規模言語モデルは人間の専門家レベルのパフォーマンスに近づいていますが、AKTにおいて資格を持つプライマリケア医師のパフォーマンスにはまだ達していません。高性能なモデルは、一般診療のワークフォース危機を改善するためのアシスタントや自律的な臨床ツールとして役立つ可能性があります。