MEDICINE & AI

一般診療における大規模言語モデル(ChatGPT)の試験:適用知識テストを用いた観察研究

カテゴリ:手術支援

公開日:2026年2月19日

タイトル:Trialling a Large Language Model (ChatGPT) in General Practice With the Applied Knowledge Test: Observational Study Demonstrating Opportunities and Limitations in Primary Care 雑誌名:JMIR Med Educ. 2023 Apr 21; 9: e46599. doi: 10.2196/46599. Epub 2023 Apr 21. 概 要: 本研究は、一般診療におけるChatGPTの強みと弱みを評価することを目的とし、英国の一般医療従事者向けの適用知識テスト(AKT)を使用しました。674のユニークなAKT問題をChatGPTに入力し、その回答を正解と比較しました。結果として、ChatGPTの平均的なパフォーマンスは60.17%であり、過去2年間の合格基準(70.42%)を下回りました。問題の出所や科目によってパフォーマンスに差が見られましたが、難易度との相関はありませんでした。 方 法: 本研究は観察研究で、674のユニークなAKT問題をウェブベースの問題バンクおよび2つのAKT練習問題から収集しました。各問題は2回に分けてChatGPTに入力され、回答の一貫性を評価しました。パフォーマンスは科目、難易度、問題の出所、ChatGPTによる新しい説明の有無に基づいて分析されました。 結 果: ChatGPTの平均的なパフォーマンスは60.17%で、過去2年間の合格基準を下回りました。出所によって精度に差があり、科目によってもパフォーマンスが異なりましたが、難易度との相関は見られませんでした。また、ChatGPTが提供する新しい説明は精度に影響を与えませんでした。 結 論: 大規模言語モデルは人間の専門家レベルのパフォーマンスに近づいていますが、AKTにおいて資格を持つプライマリケア医師のパフォーマンスにはまだ達していません。高性能なモデルは、一般診療のワークフォース危機を改善するためのアシスタントや自律的な臨床ツールとして役立つ可能性があります。