人工智能在哈佛急诊分诊诊断研究中表现超越医生Inteligența Artificială a depășit performanțele medicilor într-un studiu realizat la Harvard privind diagnosticarea în triajul de urgență

环球医讯 / AI与医疗健康来源:www.g4media.ro罗马尼亚 - 罗马尼亚语2026-08-19 00:56:29 - 阅读时长4分钟 - 1749字
哈佛大学进行的一项突破性研究表明,人工智能系统在急诊分诊诊断中的表现已超越人类医生,在76名患者案例中,AI的诊断准确率达到67%,而医生的准确率为50%-55%;在提供更多细节的情况下,AI诊断准确率可达82%,而人类专家为70-79%;专家称这代表AI临床推理的"真正突破",但AI不会取代医生,而是将形成"医生、患者和人工智能系统"的新型三元医疗模式,同时研究也指出需关注AI错误和责任框架等问题,以及AI在老年患者或非英语患者诊断中的潜在局限性。
急诊分诊AI诊断诊断准确率临床推理临床决策医疗辅助医疗安全医疗责任医生哈佛急诊研究大型语言模型
人工智能在哈佛急诊分诊诊断研究中表现超越医生

从乔治·克鲁尼在《急诊室的故事》到诺亚·怀利在《The Pitt》中的表演,急诊科医生长期以来一直是广受欢迎的英雄。但他们的时代是否即将结束?

哈佛大学进行的一项革命性研究发现,在最大压力条件下,人工智能系统在急诊医疗分诊中的表现超过了人类医生,能够在人们被紧急送往医院的关键生死时刻做出更准确的诊断。

独立专家将这些结果描述为AI临床推理的"真正突破",这些结果是在测试数百名医生与AI反应的实验中获得的。

作者称,发表在《科学》杂志上的研究结果表明,大型语言模型(LLM) "在临床推理方面已经超越了大多数基准标准"。

一项实验聚焦于76名到达波士顿一家医院急诊室的患者。一个AI系统和一对医生各自获得了相同的电子医疗记录进行阅读——通常包括生命体征数据、人口统计信息以及护士关于患者就诊原因的几句话。AI系统在67%的情况下识别出确切或非常接近的诊断,超过了仅在50%-55%情况下正确的医生。

结果显示,AI的优势在需要基于最少信息快速决策的分诊情况下尤为明显。当有更多细节可用时,AI的诊断准确率——OpenAI的推理模型o1——上升至82%,而人类专家的准确率为70-79%,尽管这一差异在统计上不显著。

AI还在被要求提供长期治疗计划(如开抗生素或规划临终过程)时,超过了更大一组人类医生。AI和46名医生被要求审查五个临床案例研究,而计算机制定的计划明显更好,得分为89%,而使用常规资源(如搜索引擎)的人类得分为34%。

但研究人员表示,急诊医生的时代尚未结束。该研究仅将人类与AI进行对比,分析了可通过文本传达的患者数据。AI解读信号(如患者痛苦程度和视觉外观)尚未经过测试。这意味着AI更像是一个基于文档提供第二意见的临床医生。

"我不认为我们的发现意味着AI取代医生,"该研究的主要作者之一、哈佛医学院AI实验室负责人Arjun Manrai表示,"我认为这意味着我们正在见证一项真正深刻的技术变革,它将重塑医学。"

波士顿贝斯以色列女执事医疗中心(该研究所在地)的另一位主要作者Adam Rodman博士表示,通用大型语言模型(LLM)是"近几十年来最具影响力的科技之一"。他表示,在未来十年,AI不会取代医生,而是会与他们一起加入一种新的"三元护理模式...医生、患者和人工智能系统"。

在哈佛研究的一个案例中,一名患者因肺部血栓和加重症状前来就诊。人类医生认为抗凝剂不起作用,但AI注意到了人类没有注意到的事情:患者的狼疮病史可能意味着这是肺部炎症的原因。事实证明AI是正确的。

根据上个月发布的一项研究,近五分之一的美国医生已经在使用AI来帮助诊断。在英国,16%的医生每天使用该技术,另有15%每周使用,"临床决策"是最常见的使用之一,根据英国皇家医师学院最近的一项调查。

英国医生最大的担忧是AI错误和相关责任风险。虽然数十亿美元正在投资于使用AI的医疗保健公司,但对于AI错误的后果仍存在疑问。

"目前没有正式的责任框架,"Rodman表示,他还强调,最终,"患者希望有人引导他们做出生命和死亡的决定[以及]引导他们做出困难的治疗决策。"

爱丁堡大学医学信息学中心联合主任Ewen Harrison教授表示,这项研究很重要,并表明"这些系统不再只是通过医学考试或解决人工测试案例。它们开始看起来是医生有用的第二意见工具,特别是当需要考虑更广泛的可能诊断并避免遗漏重要方面时。"

谢菲尔德大学数理科学学院助理教授Wei Xing博士表示,一些其他结论表明,医生可能会无意识地依赖AI提供的答案,而不是独立思考。

"随着AI在临床环境中越来越频繁地使用,这种趋势可能会变得更加显著,"他表示。他还强调了关于AI对哪些类型的患者诊断更困难以及在老年患者或非英语患者方面是否面临更多困难的信息缺乏。

他表示:"这并不证明AI可以安全用于常规临床使用,也不意味着公众应该求助于免费的AI工具作为医疗建议的替代品。"

【全文结束】