调和人工智能时代临床推理的学习方式Reconciling how clinical reasoning is learned in the age of artificial intelligence | npj Digital Medicine

环球医讯 / AI与医疗健康来源:www.nature.com英国 - 英语2026-10-09 09:21:04 - 阅读时长7分钟 - 3206字
本文深入探讨了两项关于人工智能在医学教育中作用的研究,一项纵向研究显示在临床医生监督下使用AI工具可促进医学生的批判性思维发展,另一项模拟实验则揭示AI生成的可信错误信息会显著降低诊断准确性并破坏学生的自我校准能力。文章分析了AI作为"认知支架"的潜在益处与"可信性陷阱"的风险,探讨了AI素养、监督条件和互动方式对学习效果的影响,指出AI可能加剧教育不平等,并强调在AI快速发展的背景下,医学教育需重新设计学习条件和安全参数,以确保医学生既能有效利用AI技术,又能发展和保持必要的临床推理能力,这对未来医疗质量和患者安全至关重要。(223字)
健康临床推理医学教育人工智能医疗安全诊断决策患者安全临床实践
调和人工智能时代临床推理的学习方式

人工智能(AI)在日常生活和医疗环境中正变得越来越普遍。窄域AI健康技术正逐渐在多个专科的临床实践中得到应用。自2022年11月ChatGPT公开发布以来,大型语言模型(LLMs)也激发了人们的集体想象力,催生了环境记录员、专门面向临床医生且基于同行评审文献的LLM响应平台(如OpenEvidence),以及日益增长的创新应用生态系统。便捷的访问也意味着其中一些工具正越来越多地被用作个性化"口袋导师",缺乏监督或机构支持。

近期报告强调了AI引入后对经验丰富的临床医生可能造成的"技能退化"风险,同时警告下一代可能面临的"从未掌握技能"和"错误技能"的双重威胁。这表面上类似于过去对新技术的道德恐慌,例如1960年代学校引入计算器时,人们担心会破坏学生的基础数学技能并导致智力懒惰。实际上,这些担忧被证明是多余的,教育系统适应了变化,既保留了学生的核心能力,又将重点转向更高层次的推理。然而,有观点认为这种类比并不令人安心而是存在缺陷,因为当代AI系统正日益侵入临床专业知识的核心领域——判断、解释和沟通。随着AI发展和临床整合步伐不断加快,调和这些相互矛盾的观点将变得越来越重要。在医疗环境中,受损的临床推理后果远不止于学习者本身。

在本篇社论中,我们讨论了两项为这一辩论增添新内容的截然不同但互补的研究。一项将AI介绍为有用的"认知支架",另一项则警告了由令人信服的错误信息引发的"可信性陷阱"。尽管它们的目标不同,但都围绕同一个核心问题:与AI互动是改善还是损害医学生学习临床推理的方式?

Xin等人进行了一项基于调查的纵向研究,对372名高年级医学生在12个月临床轮转期间的情况进行了观察,他们在资深临床医生的监督下,利用整合到临床工作流程中的AI工具支持诊断决策。这些工具包括用于放射学图像解读的计算机辅助工具,以及基于电子健康记录的临床决策支持系统。作者使用交叉滞后面板模型研究了参与AI辅助诊断、AI素养和医学环境中批判性思维(通过自我报告的调查衡量)之间的时间关联,这是一种用于推断变量随时间相互因果效应的统计方法。

Teng等人则进行了一项111名临床前学生的随机对照试验,旨在模拟接触可信错误信息的情况,以评估学生对LLM生成错误信息的易感性。通过对25道USMLE临床案例选择题的测试,研究分为三个组别——对照组(无LLM辅助)、可靠LLM辅助组和权威但有缺陷的LLM辅助组。同时测量了信心校准(学生对自己表现的信心与其实际表现的一致性)。

Xin等人发现,更高程度的AI辅助参与与更高的AI素养相关,而AI素养又与更高的批判性思维分数相关。相比之下,Teng等人报告称,尽管经过严格验证且医学准确的正确AI解释并未带来改善,而具有误导性但看似合理的解释则显著降低了相对于对照组的诊断准确性。此外,虽然学生的信心随着LLM辅助而提高,但接受误导性解释的组别无论对错都表现出较高的自信。

单独来看,这些研究可能显得有些矛盾。一项发现AI参与有助于随时间发展批判性评估AI输出的认知技能。另一项则显示准确的AI输出并未改善诊断准确性,而错误信息则同时损害了诊断推理和促使学生寻求建议的内部不确定性信号。

差异可能在于参与条件。监督是最明显的调和点——也许AI在第一项研究中有益是因为有经验丰富的临床医生的监督,而在第二项研究中没有监督?在AI使用的背景下,监督被认为支持核心推理技能的发展,而非黑白思维。然而,在这项研究中,监督仅解释了AI参与、AI素养和批判性思维之间总纵向关联的38%,并且对于AI经验有限或缺乏表现导向目标的学生来说效果减弱,这表明虽然监督提供了可以主动质疑AI输出的安全框架,但这本身并不足够。

参与模式可能提供更细致的解释。第一项研究提供了一个安全框架,学生可以在真实世界诊断工作流程中作为一部分,在监督下积极处理病例并获得AI支持。相比之下,第二项研究反映的是更人工化的测试场景。他们发现即使是专家验证的LLM输出也未提供任何益处,这与最近的实验证据一致——当呈现流畅的预先消化答案而无需寻求评估或验证结果时,学习者可能发展出更浅薄的知识。

更广泛的文献强调了AI对发展中的临床医生构成的两个关键风险——"从未掌握技能",即学习者在发展基础能力之前完全依赖AI;以及"错误技能",即他们采用限制其能力的AI错误或偏见。Teng等人的研究清楚地说明了后者。无AI组的基线表现较低(21.9%),而接受可信LLM生成错误信息的组别表现更低(9.2%),这表明学生在基线时缺乏巩固的临床知识,而在这一知识缺口引入AI可能会使其成为推理的替代品。

这一点在他们的错误分析中进一步凸显。对于接受误导性解释的组别,70.3%的错误与选择被权威但有误导性的LLM响应支持的干扰项相关,而对照组这一比例为24.7%。虽然两篇论文均未研究潜在的认知机制,但非医学背景的实验证据揭示了"认知投降"(称为"系统3思维")的风险,即学习者学会不加批判地接受AI输出,取代依赖启发式驱动的直觉("系统1思维")或仔细思考("系统2思维")。这一风险由信心校准差距突显出来,接受可信LLM生成错误信息的学生对其正确和错误回答都表现出同样的信心,失去了促使他们寻求指导的内部不确定性信号。

"AI素养",广义上定义为对AI原理的基础理解以及批判性评估其输出的能力,旨在使个人能够识别何时信任、何时质疑以及何时覆盖AI输出。在许多方面,这正是临床医生应该已经接受的培训——批判性评估证据、权衡不确定性并行使临床判断。挑战在于,这些是通过临床接触和刻意练习获得的来之不易的技能,而两项研究的证据表明,如果没有合适的条件,AI参与可能会阻碍这一进展。

Xin等人的调节分析直接解决了这些担忧。具有先前技术经验和掌握导向学习目标的学生似乎更能发展AI素养并质疑算法输出,这符合"马太效应"——早期有优势的人随着时间积累更多好处的现象。然而,AI素养是通过自我报告量表测量的,这些量表评估学生理解AI输出的感知能力,作者承认这是一个局限性。这不能完全捕捉对可信AI生成错误信息的抵抗能力,那些在这些AI素养工具上得分较高的学生在Teng等人研究中面对误导性解释时表现如何仍是个开放性问题。

即便如此,这些信号对超越个体差异的教育公平性具有影响。在监督有限和缺乏AI素养培训的环境中,AI辅助学习可能会扩大教育不平等,因为使AI工具普及化并不等同于使这些工具增强学习的条件普及化。这对LLM辅助学习尤其重要,因为人机交互的质量可能直接影响其输出,这意味着教学生有效与LLM互动可能与教他们评估其输出同样重要。

虽然这两项研究是在中国进行的,可能需要在其他医疗和教育环境中复制,但实证研究表明,AI工具已逐渐融入全球医学教育(例如聊天机器人、AI驱动的问题库),并被广泛接受,对其实用性的看法普遍积极,通常缺乏机构支持。这与技术接受模型(TAM)一致,该模型将感知有用性和感知易用性视为技术采用的关键驱动因素,而AI在这两方面都表现出色。

这是对传统医学教育的控诉、对其日益复杂性的反映,还是仅仅源于无限耐心的24/7导师的吸引力,是一个值得提出的问题,尽管它并不直接解决手头的问题。相反,一个更有成效的问题可能是:我们应如何仔细设计AI在医学教育中的角色条件并设定安全学习的参数。与其简单地主张回避或避免,也许现在是时候考虑如何使伤害最小化变得足够系统化以产生实际影响,并支持下一代临床医生学习得既好又安全。

【全文结束】