自主型AI进军医疗领域Agentic AI Comes to Medicine - by Eric Topol

环球医讯 / AI与医疗健康来源:erictopol.substack.com美国 - 英语2026-10-08 12:08:31 - 阅读时长8分钟 - 3817字
本文详细介绍了两项发表在《自然》杂志上的突破性研究,分别展示了MIRA和AMIE两种新型自主型AI医疗系统在急诊和门诊场景中的应用。MIRA系统在德国开发,能提供端到端的急诊诊疗计划,诊断准确率达87.8%,优于认证医师的78.1%;AMIE系统由谷歌研发,专注于门诊患者的纵向管理,在治疗计划精确度和指南遵循度方面表现优异。文章深入分析了这些AI系统的优劣势,指出虽然它们在模拟环境中表现出色,但距离真实医疗实践仍有差距,特别是缺乏对非语言沟通、医学影像等实际医疗元素的处理能力,同时过度遵循指南可能忽视患者个体差异和医患关系的人文维度。
健康医疗自主型AI诊断治疗管理患者电子健康记录临床指南药物管理智能体急诊门诊护理端到端护理纵向评估医疗实践准确性
自主型AI进军医疗领域

它只是时间问题。自主型AI已经应用于生命科学和其他众多领域,而今天有两篇发表在《自然》杂志上的重要论文将这一概念推进到医疗保健领域。一篇来自德国的雅各布·卡瑟(Jacob Kather)及其同事,名为MIRA;另一篇来自谷歌的迈克·谢克曼(Mike Schaekermann)及其同事,名为AMIE(缩写定义见下文)。这项工作已远远超越了AI对狭窄应用的支持,如协助诊断,而是发展到全面管理、端到端的护理计划。这两篇论文都非常复杂,包含大量需要剖析的内容,包括数十页的补充信息来全面描述他们的评估结果。在本期《真相基础》(Ground Truths)中,我将聚焦核心结果和意义。首先,是一个比较这两个系统的汇总表格。

请注意这两篇论文标题中的"迈向"(Towards)一词:

MIRA系统概述

该系统设计用于嵌入医疗系统的电子健康记录(EHR)中,提供推理和行动步骤。系统包含两个智能体:患者和AI医生(MIRA)。MIRA查询患者的病史、体格检查结果,并能下达实验室检查、血培养、扫描、药物、手术程序及决定是否需要住院治疗。这项测试在500个急诊科真实病例中进行,将MIRA的结果与4位经认证的医师直接比较,同时也与由2位认证医师和2位住院医师组成的混合小组进行比较(由于混合小组在所有任务中的表现都低于4位认证医师,我将不再进一步回顾他们的结果)。它模拟了患者数据被逐步查询和处理的顺序方式。MIRA配备了11种不同的工具,可从85,000多个行动选项中进行选择,在符合标准的多步骤推理框架中运行(使用FHIR、ICD-10、RxNORM、ATC、LOINC和SNOMED-CT)。该系统基于OpenAI的GPT-4o构建。

MIRA的整体诊断准确率为87.8%,而认证医师为78.1%。这一提升在特定诊断中尤为显著,例如胰腺炎(95.2%对78.6%),以及阑尾炎(MIRA为100%,认证医师为88%)。虽然MIRA开出了更多的血液检查(51%对28%),但它通过大幅减少扫描检查来平衡资源消耗。在治疗方面,MIRA在正确开具手术程序(如腹腔镜阑尾切除术或胆囊切除术)方面优于认证医师,比例为53.5%对38.3%(见下图)。MIRA在治疗方面的其他优势包括更好的静脉输液管理和止痛药物使用符合指南,与认证医师相比,临床指南的整体符合率提高了35%。MIRA开出的468种药物中,99.8%在适应症和安全性方面(如过敏、药物相互作用和肾功能剂量调整)都是正确的。MIRA比医师更倾向于将病例分诊为需要住院,这反映了其不受经济因素驱动的特点。

由于系统设计可能会导致病例数据泄露给AI,研究人员付出了相当大的努力来避免信息过早流动。这一措施效果良好,933个病例中没有一例出现任何数据泄露。系统经受住了880个对抗性提示的测试,对黑客攻击、医疗法律威胁和其他患者智能体欺骗的尝试性压力测试也表现良好。MIRA还评估了多种患者扰动情况,包括高度焦虑、非英语使用者、妄想和诊断否认,这些都没有影响其性能。

AMIE系统概述

该系统设计非常不同,专注于门诊患者的纵向评估,主要目标是制定一流的管理计划。与MIRA类似,系统也使用了两个智能体。对话智能体(Dialogue Agent)是对话式的,与患者互动,代表快速的系统1思维(借鉴丹尼尔·卡尼曼的理论,使用Gemini 1.5 Flash),并与管理智能体(Mx)异步工作,后者是慢思考系统2,使用长时间上下文处理(尽管速度很快)。AMIE评估了100名患者,每位患者进行了3次就诊(每次间隔约2天),涵盖5个不同专业。结果与21位认证初级保健医师(PCP)进行比较。一个值得注意的特点是集成优化(Ensemble Refinement),它整合了4种不同的治疗计划并达成共识,模拟了真实的医疗治疗委员会,这在癌症管理中很常见。庞大的600多个临床指南被完全标记化(不仅仅是部分内容),为管理提供基础和引用。这种集成仅需约80秒即可生成。与MIRA一样,这完全是基于文本的,这在AMIE中被辩护为保持盲法所必需的。30位医师对AMIE输出与21位认证初级保健医师的表现进行了评分。与MIRA不同,AMIE使用了患者演员。下图的性能轮显示了AMIE与初级保健医师在6个指标上的差异,所有指标都倾向于AMIE表现略优或明显更优。

总体而言,在管理推理方面,AMIE不劣于21位初级保健医师。到第三次门诊就诊时,AMIE管理计划的评分为98%,而初级保健医师为81%。治疗精确度为95%对67%。专家指南符合率为100%对86%。因此,虽然整体管理不劣于医师,但在几个评分项目上AMIE的管理更受青睐。

研究人员开发了一种新的药物管理基准,称为RxQA,基于向认证药剂师提出的600个问题以及英美处方集的内容。AMIE的药物管理在正确药物、剂量、持续时间、副作用和随访评估方面都优于初级保健医师。即使在初级保健医师进行开卷测试的更困难病例中,这一优势依然存在(AI为58%,医师为48%)。

意义与启示

这两项新研究将医疗AI的能力水平提升到了先前研究之上,此前的研究相对狭窄,主要支持诊断或回答医学考试或患者提出的问题。MIRA承担了自主智能体对急诊患者进行端到端评估和行动计划的任务。AMIE则致力于提供跨越3次门诊就诊的纵向评估。两者都只使用了2个智能体,一个与患者互动,另一个进行AI工作。

有许多理由认为这些是初步发现,不能反映真实的医疗实践。MIRA和AMIE都是纯文本AI,这意味着医疗的其他方面,从患者的非语言沟通和语气到实际医学影像的审查,都没有包括在内。两项研究中使用的病例都是"干净"的,来自已建立数据集的完整数据。MIRA的互动限制在20次对话轮次内。AMIE使用了患者演员。没有任何内容真正代表医疗实践,而医疗实践通常以不完整和相互矛盾的数据为特征。AMIE中3次门诊就诊设置为间隔2天,远不能模拟现实中预约医生的困难!同样,仅涉及5个医学专业。

但有一些发现可以被视为填补了当前医疗护理的空白。MIRA中诊断准确率的提高是明显的,尽管比较组非常小,只有4位认证医师。在阑尾炎诊断中达到100%的准确率并开具腹腔镜手术是令人印象深刻的,所选药物的准确性也是如此。MIRA涵盖的病情范围有限(n=8),尽管管理选项组合中包含各种诊断测试、程序和手术。MIRA管理实践中缺乏经济激励是可取的,甚至导致开出的扫描检查更少。

对AMIE而言,一个主要优势是跨越3次诊所就诊的纵向上下文。与当今真实的患者不同,患者对话智能体不需要填写表格。它具有记忆和效率(不像我们在美国医疗保健中看到的那样)。该智能体被设置为富有同理心和专注,这体现在患者偏好上,对AI的偏好程度有相当大的梯度。

这两个医疗AI模型在坚持指南或提供具体计划方面都表现出惊人的精确性。例如,在AMIE研究中,初级保健医师写道"给予抗生素",而AI则开具"口服阿莫西林500毫克,每日3片,持续7天,并检查是否有青霉素过敏"。

但问题就在这里。医学指南旨在适用于绝大多数患者,不考虑具体需求、恐惧、既往患者经历、成本和许多其他因素。当今的许多指南由"专家"提供,即它们代表的是基于权威的意见,而非循证医学。因此,AI与指南的这种非常紧密、卓越的符合性不一定是一件好事,所谓的"精准"可能预示着医学艺术的丧失,忽视每位患者的个体因素,以及构成医患关系基础的人与人之间的纽带。

未来将如何发展?大型语言模型(LLM)将继续改进。事实上,这两份报告中使用的模型已经过时。在自主AI时代,可能会有数百个专业智能体,如用于实验室、扫描、传感器、环境暴露、遗传学/基因组学等的智能体。今天,通过这些新论文,我们只看到智能体的初步应用。

你可以将MIRA和AMIE视为在模拟约束内的重大进步,而非真正的医学实践。但AI能力的提升正在快速到来,看到这里的一些优势扩展到实际医疗实践中并不令人意外。要证明这一点,理想情况下我们需要对3种策略进行随机试验以评估结果:(1)端到端医疗AI;(2)仅人类临床医生;(3)两者结合。这种情况不会很快发生,因为我们仍处于模型改进的陡峭曲线上,进行如此大规模的试验不仅难以获得资金,执行起来也不容易。与此同时,我们有了新的证据,表明生成式AI可能改善医疗沟通、诊断和管理的潜在方式。

注:本文由我本人撰写,未使用AI。我与本文内容不存在利益冲突。

非常感谢来自美国各州和212个国家的《真相基础》订阅者。您对这些免费文章和播客的订阅使我的工作变得有价值。如果您还不是订阅者,请加入!

如果您觉得这篇文章有趣,请分享!

付费订阅是自愿的,所有收益都用于支持斯克里普斯研究所(Scripps Research)。付费订阅允许发布评论和提问,我会尽力回复。请毫不犹豫地发表评论并给我反馈。告诉我您希望看到哪些主题。

非常感谢那些做出贡献的人——他们在过去两年中大力支持了我们的暑期实习项目!这使我们能够接纳并支持2026年创纪录的51名暑期实习生!这些是从数千名申请者中选出的高中生、大学生和医学生。没有通过《真相基础》获得的资金,我们无法扩展这一项目。

【全文结束】