MIRA:当AI代理接管急诊室MIRA: Wenn der KI-Agent die Notaufnahme übernimmt - Medizintechnik > E-Health - Elektroniknet

环球医讯 / AI与医疗健康来源:www.elektroniknet.de德国 - 德语2026-07-23 16:20:18 - 阅读时长5分钟 - 2138字
德国德累斯顿工业大学Else Kröner Fresenius数字健康中心的研究团队开发了一种名为MIRA(Medical Intelligence for Reasoning and Action)的自主AI代理系统,该系统能在电子病历环境中完整模拟从病史采集到治疗决策的整个诊断工作流程。在574个病例的回顾性研究中,MIRA实现了88.9%的平均诊断准确率,显著超越专科医生(78.1%)和混合医生队列(71.1%)。该系统通过11个临床工具和超过85,000个定义操作选项工作,采用HL7-FHIR请求与电子健康记录通信,并嵌入ICD、LOINC等六大医学编码标准。虽然测试中未出现严重错误,但研究者指出仍需患者端控制机制,并计划开展前瞻性真实世界研究进一步验证系统性能。
MIRA临床AI代理急诊室医疗智能诊断准确率电子病历治疗决策指南依从性医疗AI安全
MIRA:当AI代理接管急诊室

临床AI代理能够引导医生处理电子病历,并自主申请实验室检测、解读检查结果和准备治疗决策?德累斯顿研究人员已在500多个病例中测试了MIRA系统。该模型以88.9%的准确率超越了专科医生。

急诊室工作对医生来说常常像是高速运行的"脑力俄罗斯方块":同时面对三位患者,检查结果尚未出来,影像检查还需40分钟——在这段时间内,医生需要收集病史、检查药物相互作用并准备入院决定。同时,在时间压力下,数据资料不完整。那些期待在这一刻能有一个有用的AI助手的人,至今仍在徒劳等待:大多数临床AI工具只解决单一问题,未整合到整体工作流程中,并且在情况变得复杂时就停止工作。

MIRA(Medical Intelligence for Reasoning and Action,推理与行动医疗智能)正好填补了这一空白。德累斯顿工业大学Else Kröner Fresenius数字健康中心(EKFZ)的Jakob N. Kather教授研究团队开发了一种自主AI代理,能够在电子病历内完整呈现整个诊断工作流程:从病史采集到治疗决策,形成一个连贯的过程。该研究现已发表在《Nature》杂志上。

无自由推理——而是85,000个定义选项

MIRA与临床环境中通用LLM聊天机器人的区别在于其架构:该代理不以开放推理模式运行,而是通过功能调用访问明确定义的操作空间——11个临床工具,超过85,000个操作选项。与电子健康记录(EHR)的全部通信通过HL7-FHIR请求进行,嵌入在六个医学编码标准中:ICD(国际疾病分类)、LOINC(逻辑观察标识符名称和代码)、ATC(解剖学治疗学及化学分类系统)、NDC(国家药品代码)、RxNorm(处方规范命名)和SNOMED-CT(医学系统命名法-临床术语)。对于受监管环境中的AI开发者来说,这是一个实用优势:每个工具都可以单独验证和批准——无需将整个系统作为黑盒通过MDR合规性评估。

不作弊的虚拟患者

在回顾性研究中,德累斯顿研究人员使用了来自MIMIC-IV数据集的574多个真实病例,在模拟急诊室中重建了八种疾病情况——从阑尾炎到肺栓塞。MIRA并非处理静态病历,而是与一个单独的患者AI代理协同工作——这是一个仅基于记录的"现病史"(History of Present Illness)进行回答且不提前获取信息的LLM。

研究人员明确测量了其可靠性:在622个问答对中,该代理在99.4%的情况下对语义等效问题提供了一致的回答,在99.3%的情况下忠实于记录的HPI——即使在880次针对性的对抗性攻击提示下,也未出现提前诊断泄露。MIRA必须处理逐步到达且部分缺失的信息——而非经过完全整理的病历。

88.9%诊断准确率

在全部574个病例中,MIRA实现了平均88.9%的诊断准确率。其中有些可预期的向上偏离,如阑尾炎98.6%和胰腺炎92.3%;也有向下偏离,如肺炎72.4%和尿路感染77.6%。在相同病例的直接对比中(n=311),MIRA显著超越了两个对照组:87.8%对专科医生的78.1%(p<0.001),以及对住院医师和专科医生混合队列的71.1%(p<0.001)。在胰腺炎方面差距最为明显:95.2%对专科医生的78.6%。

Dyke Ferber医生(该研究的第一作者)总结道:

"MIRA识别缺失信息,申请检查,按指南解读结果并准备治疗决策。KI工具应支持医疗专业人员,为患者护理创造更多时间——同时必须满足对安全性、透明度和可靠性的最高要求。"

在干预决策方面,MIRA也领先:53.5%的正确程序匹配率,而专科医生为38.3%。在指南依从性方面,MIRA平均超过两个医生组35个百分点。

零严重错误,三个警示信号

在56名患者和468次处方中的安全表现良好:无严重药物相互作用,无肾功能受限时的剂量错误,无过敏不匹配,无QT风险处方。识别出三例治疗重复——昂丹司琼重复处方、华法林/依诺肝素重叠给药。没有灾难性错误,但足够精确地说明一点:一个能处理468次处方而无严重错误的系统,仍然需要患者端的控制机制。当系统真正运行时,三次重复就是三次太多。

自动驾驶仪类比

Kather教授将MIRA比作飞机上的自动驾驶仪:"此类系统可以通过承担常规任务来支持和减轻医疗专业人员的负担——但最终责任始终在医务人员身上。"这个类比很有说服力——但在一个方面不够精确。自动驾驶仪在物理定义的状态空间中运行,具有可测量的量。临床决策是上下文相关的,经常缺乏数据,法律框架更为严格。MIRA实际上从自动驾驶仪原理中借鉴的是:每个操作都绑定到一个可追溯的工具调用——新的不是自主性,而是可追溯性。

然而需要说明的是:所有测试都是在基于回顾性数据的封闭EHR沙箱中进行的——没有真正的患者,没有真正的时间压力,没有计划外的文档缺失。论文将前瞻性真实世界研究列为下一步。(uh)

D. Ferber等:《迈向自主医疗人工智能代理》,Nature 2026。

DOI: 10.1038/s41586-026-10675-5

【全文结束】