将生成式人工智能整合到医学教育中:保护临床推理的框架Integrating Generative Artificial Intelligence (AI) in Medical Education: A Framework for Preserving Clinical Reasoning

环球医讯 / AI与医疗健康来源:www.mdpi.com西班牙 - 英语2026-07-25 21:31:05 - 阅读时长15分钟 - 7427字
本文提出了M3RGE-AI框架(负责任、可靠和反思性使用生成式人工智能的医学教育),旨在解决将生成式AI整合到医学教育中的关键挑战。该框架基于教学支架和最近发展区、刻意练习理论以及同伴辅助学习三大教育理论,通过分阶段实施、限制性AI输出、同行监督和AI-off评估检查点等机制,防止学生在临床推理、假设生成和患者中心沟通等核心能力方面出现"从未掌握技能"、"错误掌握技能"和"技能退化"问题。框架强调AI应作为认知支架而非替代品,在缩短反馈周期和扩大临床接触的同时,确保医学生能够发展出独立临床判断能力,为未来整合AI技术的医疗实践做好准备,同时维护安全临床实践所必需的人类核心能力。
医学教育生成式人工智能临床推理M3RGE-AI框架AI素养刻意练习AI-off评估检查点首席GPT模型3T-RAG原则自动化偏差
将生成式人工智能整合到医学教育中:保护临床推理的框架

1. 引言

人工智能(AI)包括使机器能够执行传统上需要人类智能的任务的计算方法。生成式AI,特别是通过大型语言模型(LLMs),有可能以不同于早期AI应用的方式改变医疗实践。像ChatGPT、Gemini和Claude这样的工具可以即时生成鉴别诊断、总结患者病史并综合医学文献。然而,这些通用AI工具尚未获得临床使用的监管批准,其医学输出未经验证,需要专家验证。早期证据表明,对于某些任务,这些系统在明确定义的研究场景中可能匹配或超过初级临床医生的诊断推理速度。

尽管生成式AI前景广阔,但它可能会破坏医疗实践中的基本反思过程。教育工作者正在探索AI如何增强模拟和个性化学习,但越来越多的人担心学生可能会绕过关键的诊断推理步骤,依赖算法输出而不进行批判性质疑。要求AI生成鉴别诊断的学生可能会使用这些列表而不进行独立推理,从而减少对批判性思维技能的参与。与以前的教育工具不同,AI自主生成看似合理的临床叙述。这种"黑箱"特性意味着学习者可能会不加质疑地接受输出,而这些质疑技能对安全的临床实践至关重要。一项研究发现,73%的医学生在面对AI生成的鉴别诊断时表现出显著的锚定偏差。

"GPS效应"说明了自动化如何削弱技能:就像依赖导航系统会削弱空间定向能力一样。持续依赖AI生成临床推理可能会阻碍内部框架的发展,而这些框架对于灵活实践至关重要。最新文献确定了四种轨迹:"从未掌握技能"(AI取代了基本推理)、"错误掌握技能"(对输出的不加批判的依赖)、"技能退化"(通过认知卸载导致能力削弱)和"掌握技能"(有效整合AI以增强批判性思维)。这些风险中的每一种都直接映射到M3RGE-AI的具体保障措施。限制AI使用和AI-off检查点解决从未掌握技能和技能退化问题,而"首席GPT"模型和3T-RAG原则则针对错误掌握技能和自动化偏差。

完全拒绝AI既不切实际也不可取。医疗数据的复杂性和人员限制要求未来的医生能够熟练地将AI工具作为合作者。监管机构现在要求具备数字健康和AI素养能力。然而,文献中仍存在显著差距。尽管有许多报告详细介绍了AI的早期使用,但缺乏解释如何在保持核心临床技能的同时整合AI的结构化框架。大多数举措是零散的本地项目,而非统一的课程策略,现有指南很少解决平衡AI效率与防止技能丧失的问题。

医学院需要能够:(1)描述AI整合的渐进步骤;(2)概述防止从未掌握技能、错误掌握技能和技能退化的策略;(3)整合确保无AI情况下技能保留的评估方法;以及(4)建立负责任实施的治理结构的框架。

我们提出了M3RGE-AI框架(负责任、可靠和反思性使用生成式人工智能的医学教育),该框架基于包括最近发展区和刻意练习在内的既定学习原则。关键组成部分包括促进主动推理的苏格拉底式AI互动、验证独立掌握能力的强制性AI-off评估检查点,以及包含同行监督和透明溯源的治理机制。这将AI定位为技能获取的支架而非临床能力的替代品,使教育工作者能够利用AI的优势,同时保持独立临床推理的发展。

2. 材料与方法

M3RGE-AI框架是作为一个概念性提案,通过一个结构化推理过程开发的,该过程受到三个互补来源的启发:既定的学习理论、AI整合到医学教育中的新兴文献,以及在临床培训环境中观察到的无结构AI使用的风险。

框架基础。选择了三种教育理论作为基石,因为它们与健康专业教育中的技能获取具有既定的相关性,并且适用于AI介导的学习环境:教学支架和最近发展区(ZPD)、刻意练习理论,以及结合近同伴教学(NPT)的同伴辅助学习(PAL)。选择这些理论是因为它们共同解决了文献中确定的三个核心挑战:AI暴露的发展适当性、努力认知参与的维持,以及AI使用中的社会问责。

框架推导。框架组件通过三个顺序步骤推导出来:(1)识别最容易受到无结构AI使用影响的基础临床能力,特别是假设生成、临床优先排序和以患者为中心的沟通;(2)将每种已识别的风险(从未掌握技能、错误掌握技能和技能退化)映射到基于选定学习理论的特定设计响应;以及(3)提出实施机制,包括分阶段进展、限制AI输出、同行监督和AI-off评估检查点,与医学院课程中的机构可行性保持一致。

范围和局限性。该框架尚未经过系统文献综述、正式专家共识或实证验证。它被提出作为一个理论上合理的提案,旨在指导初步实施工作,而非随时可直接采用的已验证协议。明确的期望是,任何机构采用都应伴随严格的试点评估和基于证据的改进。因此,该框架应被视为实证调查的结构化起点,而非规范性实施指南。

3. 结果

3.1 M3RGE-AI框架

没有单一理论能够全面解决将AI整合到医学教育中的挑战。因此,我们借鉴三种教育理论作为框架的基石。首先,教学支架和最近发展区支持发展适当的进展:诊断学习者能力,在最近发展区内引入渐进式提示,并随着能力增长逐渐减少支持。这意味着早期限制AI,提供苏格拉底式问题而非答案,从而保持有益的难度并防止从未掌握技能或错误掌握技能。与原始表述一致,M3RGE-AI中的支架作为淡出机制运作。随着学习者能力的提高,AI支持被故意并逐步减少,从基础阶段的高度受限互动到高级临床年份中越来越自主的AI使用,确保在依赖形成之前撤回支架。其次,埃里克森的刻意练习理论为具有即时反馈的目标导向活动、具有变异性重复和逐步挑战的转移性专业知识提供了理由。AI可以通过快速案例生成和及时反馈支持刻意练习,同时要求学习者证明其回应,防止表面性能改进。第三,PAL/NPT原则通过认知同质性和低风险提问环境提供可扩展的协作。我们通过"首席GPT"角色将PAL/NPT操作化,该角色挑战AI建议,规范解释优先接受,并作为AI生成临床案例的第一线验证层,在将这些案例呈现给小组进行推理练习之前,识别并标记临床上不合理或内部不一致的案例。该角色不仅仅是调节,而且具有认识论上的主动性。首席GPT将批判性评价建模为社会规范而非个人习惯。为了有效发挥此功能,促进者培训应明确解决权威偏差和群体思维的风险,确保同行领导者促进真正的批判性辩论,而非无意中将小组锚定于自己的推理。

这些理论塑造了我们的设计选择——早期AI限制、可验证输出、同行监督和AI-off评估——旨在加强真实技能获取而非替代它。表1详细说明了框架组件如何基于这些理论。

3.2 核心组件

M3RGE-AI框架提出了将AI整合到医学课程中的分阶段、发展一致的方法。M3RGE-AI不是将AI视为附加组件或独立工具,而是提供了一个结构化进展,调整AI辅助学习的范围和复杂性以匹配学生不断发展的认知和临床能力。

这种方法确保AI作为临床推理发展的支架,而不是替代安全患者护理所必需的刻意练习。

3.2.1 概述:原则和纵向设计

M3RGE-AI基于三个原则运作:责任(保护基本人类技能)、可靠性(验证AI准确性)和反思性(促进学生的批判性参与)。与刚性检查表不同,这个灵活框架适应学习者进展,随着能力提高,通过AI、同行评审和辅导提供支持逐渐减少。培训从早期阶段的指导性AI使用转变为临床年份中更独立和批判性的应用。

3T-RAG原则要求AI输出可追溯、可信赖和启发思考,在个体学生-AI互动层面实现负责任的AI使用。具体而言,学生应接受培训以应用结构化验证提示,例如要求明确的源归因、要求AI量化其不确定性,并将输出与已验证的临床资源进行交叉核对,然后将其纳入推理。这些习惯在框架的所有阶段有意识地练习,将3T-RAG原则从抽象标准转变为具体的临床技能。实证模型在医学教育环境中提供苏格拉底式AI辅导的具体实施指导。

图1展示了随着学生进步,AI使用如何从基本模拟发展到复杂、逼真的临床场景。

这种方法帮助学生建立核心技能,然后在越来越逼真的环境中改进这些技能(见表2)。

AI助手可以动态创建无数临床案例,从而超越预编程场景,实现真正的刻意练习,这对专业知识至关重要。当学生反复遇到相同案例时,练习会演变为特定答案的记忆,而非推理过程的掌握。通过每次互动提供新变化,AI确保学生参与专注的认知工作,特别是假设生成和综合,防止依赖简单回忆并培养稳健、可转移的临床技能。

3.2.2 跨阶段保障:监控、同行评审和适应性治理

在M3RGE-AI框架的所有阶段,都需要保障措施以确保AI整合支持技能发展,而不是无意中促进被动依赖。虽然限制AI输出和透明反馈循环至关重要,但同样重要的是保持学生积极参与和批判性反思的社会和教学机制。

3.2.3 持续个体评估

结果和指标。我们建议(i)通过诊断思维量表(DTI)进行无辅助诊断推理;(ii)通过脚本一致性测试(SCT)进行不确定性容忍推理;(iii)AI错误客观结构化临床考试(OSCE)站点,其中AI输出故意包含学生必须识别和纠正的临床错误或不一致;以及(iv)根据DEFT-AI提案对最后课程中的真实临床场景进行监督观察。AI-off检查点在培训阶段中逐步实施。在基础阶段,无辅助病史采集练习和基本鉴别诊断任务验证学生在扩大AI暴露之前能够独立生成假设。在中级阶段,在无AI访问的情况下进行的SCT评估学生是否能够独立容忍和推理临床不确定性。在高级阶段,AI错误OSCE站点验证高年级学生是否已发展出检测AI故障并在高风险临床环境中安全覆盖不可靠输出的批判性评估能力。预/后对比和分阶段进展检查点允许早期检测对AI的过度依赖。

在实证阈值定义之前,机构应在实施开始时建立本地基线性能,并将AI辅助与独立表现之间的显著学生差距视为需要针对性干预的过度依赖早期预警信号。此外,应在汇报和自我评估练习中纳入对学生态度的结构化反思。应鼓励学生认识并阐明何时对AI的信任可能会覆盖其独立临床判断。

3.2.4 大规模群体中的监督挑战:PAL/NPT的作用

AI最有价值的能力之一是它可以训练为在正式教学时间之外为学生提供即时、个性化的反馈。引入基于AI的助手可能为支持大规模学生群体提供实用解决方案,但非结构化访问本身并不能保证正确使用或有意义的反馈,因为与AI互动的个别学生面临认知错误(如自动化偏差或锚定)的高风险。

M3RGE-AI框架提出了一种社会化的、同行监督的结构来减轻这种风险,通过纳入"首席GPT"角色,该角色受到传统"首席表格"的启发,在解剖教学中,高级学生领导和协调小组在解剖台上的学习活动。在首席GPT模型中,指定的学生(通常是高级学习者或展示出强大临床推理技能的学生)在小组学习会议中促进同伴使用AI,确保批判性参与而非被动接受AI输出。

PAL/NPT是健康专业教育中建立良好且有效的教学法。研究表明,PAL在理论知识方面实现了与教师主导教学相当的学习成果,并对提高程序技能有显著的积极影响。

首席GPT领导学生评估AI驱动临床案例的小型小组会议。通过指导讨论、模拟对AI结果的批判性分析,并提出"AI正确吗?"或"缺少什么信息?"等问题,首席GPT促进元认知思维。这种方法帮助学生将AI输出视为需要验证的假设,而非接受为事实。

首席GPT角色可以在合格学生之间轮换,以分配领导机会并加强教学技能,将掌握包括指导他人批判性应用AI的原则嵌入其中。教师监督仍然至关重要:教育工作者监督同伴主导的会议,培训学生促进者,监控过度依赖或不加批判的接受,并将见解整合到课程改进中。这种同伴促进与教师监督相结合,创造了可持续的可扩展性,同时保持学术严谨性。

首席GPT模型从根本上将学习动态从传统的人-机一对一对话转变为更强大的人-人-机一对一互动。同伴导师指导小组集体参与并批判性评估AI输出。这种人-人互动充当了对人-机互动认知陷阱的内置实时检查。

4. 讨论

AI整合到医学教育中的核心挑战不是技术性的,而是教学法的。我们需要解决如何利用AI加速学习的能力,同时保护构建真正临床能力的有益难度。M3RGE-AI提出了这个问题的结构化答案,将AI概念化为不是威胁或解决方案,而是协作学习伙伴,其有效性完全取决于如何、何时以及在何种约束下引入。

实现这一承诺需要保护诊断专业知识基础的认知工作。M3RGE-AI的分阶段进展和保障措施与零散实验形成对比,使AI复杂性与学习者发展阶段保持一致(图1),并解决数字医学教育倾向于统一而非发展性技术采用的倾向。

有人认为限制AI限制了真实世界准备,认为学生通过经验自然发展批判性技能。这忽略了专业知识需要刻意的、支架式练习的证据,而不是被动暴露。航空提供了引人注目的类比:飞行员在使用自动驾驶仪之前展示手动能力。同样,医学生应在依赖AI之前掌握独立推理(AI-off检查点)。这些AI-off检查点不应被理解为永久性评估模型或对未来临床实践的反映。相反,它们作为发展保障,确保学生在常规依赖AI之前建立独立推理。航空类比仍然具有启发性:飞行员必须展示手动能力,不是因为自动驾驶仪将不可用,而是因为识别系统故障并安全覆盖自动化是一项基本专业技能。随着学习者通过框架,评估也应发展。在高级临床培训中,混合格式变得更加合适,评估独立推理和人-AI协作的质量,包括批判性评估AI输出、识别其局限性并将其适当地纳入临床判断的能力。从这个意义上说,AI-off和AI辅助评估在培训连续体上提供互补功能,而不是代表竞争的教育哲学。

该框架的独特贡献是通过首席GPT模型将同伴促进的反思性操作化。虽然同伴辅助学习在健康专业教育中已经确立,但其在AI背景中的应用是新颖的。高级学生监督AI增强推理会议增加了关键问责,促进领导力和辩论,防止被动接受AI,从而将近同伴教学与自适应AI结合以发展促进技能。

仍然存在重大实际障碍。许多教育工作者缺乏适当监督AI增强学习或创建符合严格3T-RAG指南工具的经验。全面的专业发展至关重要,不仅针对技术技能,还要培训教育工作者鼓励批判性思维、识别自动化偏差以及管理AI增强课堂。构建具有可调限制和响应反馈的支架式AI场景远比部署商业聊天机器人复杂,需要跨学科合作和持续监督。

治理问题仍然存在,需要机构定义允许的AI使用,特别是关于患者数据。虽然RAG方法增强了可追溯性,但当学生绕过限制时,它们引入了关于数据完整性和许可的担忧。公平性是核心:如果不刻意努力,该框架可能会扩大资源丰富和资源有限机构之间的差距。未来的适应应探索可在不同环境中共享的开源或低带宽版本。

M3RGE-AI中的另一个实际挑战是工具选择。工具选择应由机构治理标准指导,而非仅由性能基准指导。考虑到可用模型的快速演变,特定LLM之间的准确性比较可能在实施前过时。更持久的选择原则包括溯源的透明度和输出的可解释性、与数据保护法规的一致性,以及机构对学生和患者数据的控制。在这方面,本地托管的小型语言模型代表了教育环境中新兴的隐私保护替代方案;这表明数据安全可能是比原始诊断性能更稳定和教育上适当的选拔标准。

M3RGE-AI中值得明确承认的另一个理论维度是AI素养,定义为批判性评估、负责任使用和有意义地与AI系统协作的能力。AI素养不是AI暴露的副产品,而是必须有意培养的可教授能力。在M3RGE-AI中,3T-RAG原则和首席GPT模型在所有培训阶段操作化核心AI素养技能,即源评估、不确定性识别和对输出的批判性质疑。M3RGE-AI的实证验证应包括将AI素养作为结果变量的明确测量,评估框架暴露是否在临床决策环境中产生学生批判性评估、选择性信任和适当覆盖AI输出能力的可衡量改进。

我们的框架有几个局限性。M3RGE-AI是一个从教学推理开发的概念模型,而非系统综述或实证验证。诸如分阶段限制、苏格拉底式提示和首席GPT监督等组件尚未经过测试。意想不到的后果可能包括学生绕过限制、高估AI可靠性或发展心理依赖,尽管有AI-off检查点。该框架在医学生临床推理以外的适用性尚不确定。这些局限性突显了M3RGE-AI应被视为需要通过试点研究、比较研究和在不同机构环境中持续改进进行系统实证验证的概念指南这一事实。

除了教学问题外,生成式AI的技术局限性也需要明确承认。当前的LLM仍然容易产生幻觉,即生成看似合理但不正确的临床信息,以及认识论不确定性,通常表达不合理的信心,可能会误导缺乏经验检测错误的学习者。在刻意练习环境中,这创造了一个特殊危险:AI生成的案例变化可能包含临床上不一致或生理上不合理的细节,如果被不加批判地接受,可能会强化错误的推理。这些风险进一步支持将3T-RAG原则和教师监督视为基本实施要求,而非可选保障。

5. 结论

M3RGE-AI框架认识到,生成式AI在医学教育中的主要风险源于无结构应用,而非技术本身的使用。通过将AI定位为临床推理的认知支架而非替代品,该框架旨在培养出从AI效率和反馈能力中受益,同时保留安全医疗实践所需的独立判断、情境理解和以患者为中心沟通的毕业生。

然而,概念框架只是一个起点。下一个关键步骤是实证验证。优先研究问题包括:分阶段AI限制是否与非结构化访问相比有意义地减少自动化偏差;首席GPT模型是否在批判性评估技能上产生可测量的差异;以及AI-off评估检查点是否在过度依赖变得临床相关之前可靠地检测到过度依赖。

下一个必要步骤是实证测试M3RGE-AI。一个合适的试点研究将涉及临床轮转期间的三、四年级医学生,比较使用结构化M3RGE-AI的队列与无结构指导使用AI的队列。主要结果可能包括在干预前后进行的AI-off OSCE站点和脚本一致性测试的表现,以评估独立临床推理的保留。次要结果可能通过诊断思维量表评估自动化偏差,并通过结构化反思工具在多个时间点评估学生对AI的态度。这种设计将允许研究人员检查框架的核心假设(即分阶段限制、同行监督和AI-off检查点有助于保留临床推理),并生成证据以在不同机构环境中完善或重新评估其组件。

生成式AI在医学教育中的价值将不是由技术本身决定,而是由其教学整合的严谨性和目的性决定。M3RGE-AI为这项工作提供了结构化基础。

【全文结束】