本文最初由麦克研究所发布。
人工智能已经证明自己能够完成特定的医疗任务,例如解读X光片或标记患者数据中的风险。但照护患者并非一系列孤立的决策。它是一个随时间展开的动态过程,要求临床医生解读来自多个来源的信号,并在患者病情变化时进行干预。稳定患者可能需要医生综合实验室数值和医学影像、听诊肺部或心脏声音、观察身体反应,并决定何时升级护理——通常面临严重的时间压力。
鉴于这种复杂性,现代AI系统究竟能走多远?更具体地说,大型语言模型能否管理整个临床决策工作流,而不仅仅是其中的单个任务?
这个问题正是一份新白皮书关注的重点,作者为麦克研究所联合主任克里斯蒂安·特维施、麦克研究所博士前研究员伦纳特·迈因克以及WHU奥托贝森管理学院的阿恩德·胡赫迈尔。该白皮书是特维施及其同事在麦克研究所支持下开展的一系列生成式AI实验的最新成果。
为了探索这个问题,研究人员将一个多模态大型语言模型放置在一个逼真的医疗训练模拟系统中——与评估医学生和执业医生的系统相同。屏幕上,虚拟患者的状况实时演变:生命体征变化、检测结果延迟到达、不采取行动会产生后果。
AI不是对书面提示(例如“一名50岁男性因胸痛就诊”)做出回应,而是必须在每一步决定下一步做什么。它可以询问患者、打开监护仪、安排实验室检测或影像学检查、实施治疗以及升级护理——同时时钟在滴答作响,患者的病情可能好转或恶化。实际上,对该系统的评估不是基于单个答案,而是基于它能否从头到尾管理整个临床接诊过程。
AI始终如一地稳定患者,并以与医学生相当甚至更高的比率完成病例。
AI的表现如何?
研究人员将一个现成的多模态大型语言模型(Gemini Pro 2.5)放入BodyInteract——一个广泛应用于教育和认证的医疗训练模拟系统。他们评估了AI在四种急性护理场景中的表现,从简单的居家低血糖病例到涉及肺炎、中风和充血性心力衰竭的复杂急诊情况。
AI的表现与超过14,000次医学生模拟运行以及一位完成相同病例的经验丰富的急诊医生进行了对比。
在各类场景中,AI始终如一地稳定患者,并以与医学生相当甚至在某些情况下更高的比率完成病例。它还以更快的速度完成病例。总体诊断准确率相似,在许多情况下,AI的行动顺序与专家临床实践高度吻合。
值得注意的是,该系统并未经过训练来解决这些特定病例或模仿专家临床医生。相反,研究人员评估的是一个通用模型——而非定制医疗系统——并观察了它在被置于现实、有时间压力的临床环境中时如何应对诊断和治疗决策。
理解AI的推理与置信度
除了AI是否得出正确结果之外,研究人员还考察了它在过程中如何推理。随着每个病例的展开,他们追踪了系统对不同可能诊断的置信度如何随新信息变化,就像临床医生在收到检测结果时更新其想法一样。
一个清晰的模式出现了。在病例早期,AI倾向于安排能提供大量新信息的检测,从而迅速缩小可能诊断的范围。随着接诊过程推进,额外检测产生的收益减少,不确定性下降。实际上,该系统的行为就像它优先采取了信息量最大的行动,而不是不加区分地安排检测。
同样重要的是,AI的置信度被证明是有意义的。当系统对某个诊断表示高度置信时,它很可能是正确的;当它仍不确定时,错误更可能发生。这种置信度与准确性之间的对齐表明,AI并非简单地过度自信,而是能够区分已经有效解决的病例和那些仍然模糊不清的病例。
这一发现引人注目,因为人们越来越担心大型语言模型往往表现出超过其实际可靠性的自信。在这种动态、多模态的环境中,AI的置信度与表现之间的匹配出乎意料地好。
他们的结果不应被解读为支持在医疗保健中无人监督地使用AI。相反,这些发现指向AI作为工作流级别支持系统或作为医生“第二双眼睛”的更针对性角色。
人类仍然重要的地方
该研究也凸显了明显的局限性。虽然AI在稳定患者方面快速有效,但它与患者沟通的参与度始终低于人类临床医生。它还倾向于比经验丰富的医生安排更多诊断检测,这表明在具有成本意识的诊断决策方面,专家判断仍然更胜一筹。
基于这些原因,作者强调,他们的结果不应被解读为支持在医疗保健中无人监督地使用AI。相反,这些发现指向AI作为工作流级别支持系统或作为医生“第二双眼睛”的更针对性角色。在时间紧迫或资源受限的环境中,例如急诊科,AI可以充当快速稳定器或分诊助手——管理信息、监测患者状态并标记高风险病例——而临床医生则专注于判断、沟通和监督。
从运营和管理的角度来看,更广泛的教训是,仅凭静态基准来评估AI低估了其潜在影响。重要的不仅是AI是否得出正确答案,还有它如何管理不确定性、时间压力以及整个流程中的权衡。随着AI系统不断改进,核心挑战可能不再是它们能否推理,而是它们应如何被整合到以人为中心的工作流中。
注:作者感谢Body Interact团队在本研究中的合作与支持,尤其感谢Raquel Bidarra和Rita Santos提供平台访问权限、协助模拟设置、分享性能数据并提供技术指导。他们的合作对于在真实临床训练环境中对AI系统进行严格评估至关重要。除作者外,没有任何一方参与本研究的设计、执行、分析或解释,作者也未从本研究中的任何公司(包括Body Interact)获得经济补偿。
【全文结束】

