MEDICINE & AI

デジタルヘルスおよび健康情報管理教育におけるAI生成コンテンツへの評価タイプの感受性:準実験的パイロット研究

カテゴリ:公衆衛生・予防医療

公開日:2026年3月31日

タイトル:Susceptibility of Assessment Types to AI-Generated Content in Digital Health and Health Information Management Education: Quasi-Experimental Pilot Study 雑誌名:JMIR Med Educ. 2026 Mar 30; 12: e82988. doi: 10.2196/82988. 概 要: 本研究は、デジタルヘルスおよび健康情報管理(DIGHIM)教育における異なる評価タイプに対するChatGPTのパフォーマンスを評価し、タスクの複雑さがAI生成出力の質に与える影響を調査することを目的としています。評価は、技術的スキル、文脈的推論、専門的判断を評価するために設計されており、AIが生成したコンテンツの感受性を特定し、教育的に意義のある評価を維持するための再設計の提案を行います。 方 法: 準実験デザインを用いて、ChatGPTが生成した回答と匿名化された学生の提出物を5つの評価タイプ(デジタルヘルスソリューション設計、ビジネスケース分析、反射的評価、SQL健康データベースプログラミング、健康分類クイズ)で比較しました。各タスクに対して、異なるプロンプト戦略を用いて複数のAI提出物を生成し、盲目的な評価者がAI生成物と学生の提出物を標準的なルーブリックに基づいて評価しました。 結 果: ChatGPTのパフォーマンスは評価タイプによって大きく異なり、健康分類の選択肢問題では平均88%の正確性を達成しましたが、SQLプログラミングタスクでは平均42%と限界がありました。反射的評価では69%のスコアを得ましたが、個別化や業界の文脈が不足していました。構造化されたプロンプトとルーブリックの統合により、特に記述的および反射的タスクで結果が改善されました。 結 論: ChatGPTは構造化されたルールベースおよび反射的タスクでは良好なパフォーマンスを示しましたが、技術的正確性や文脈的推論においては限界があります。評価設計は、批判的思考や倫理的推論、シナリオベースの問題解決を優先すべきです。AIを学生の作業の代替ではなく、批評と洗練のツールとして活用することで、教育者は医療および健康専門教育における責任あるAIの使用に備えた学習者を育成できる可能性があります。