AI在急诊诊断中胜过医生,但请勿过度兴奋AI Just Beat Doctors at Diagnosing ER Patients. Don't Get All Excited

环球医讯 / AI与医疗健康来源:gizmodo.com美国 - 英语2026-08-17 17:44:03 - 阅读时长5分钟 - 2056字
哈佛大学与波士顿贝斯以色列女执事医疗中心的研究人员成功测试了OpenAI首款"推理"型大型语言模型o1-preview在急诊分诊阶段的诊断能力,结果显示该AI在76个真实急诊病例中准确率达67.1%,远超两位人类专家医生55.3%和50.0%的准确率,研究同时强调AI不会取代医生而是作为协作工具,但需关注AI幻觉和安全性问题,研究人员指出这项技术将"重塑医学",但仍需通过严格测试验证其实际改善患者治疗效果的能力,专家建议采取"信任但要验证"的原则对待AI诊断结果。
急诊诊断急诊分诊诊断准确率鉴别诊断临床决策支持患者诊疗效果AI急诊诊断医疗安全临床病例执业医师随机对照试验医学影像
AI在急诊诊断中胜过医生,但请勿过度兴奋

全球的急诊科和其他临床环境正逐渐变得像《星球大战》中千年隼号的驾驶舱——人类医生向他们各执己见的AI同事寻求建议、与之争论,且经常信任AI提供的指导。

哈佛大学与波士顿贝斯以色列女执事医疗中心(Beth Israel Deaconess Medical Center)的研究人员成功测试了一种先进的大型语言模型(LLM)AI在急诊分诊阶段诊断患者的表现,与两位执业医师(人类)进行了对比。

这款名为OpenAI首款所谓"推理"模型o1-preview的LLM在研究者提交的76个真实急诊科病例中,正确诊断率达到67.1%,研究者称其诊断准确度"完全或非常接近"正确结果。这项新研究今日发表在《科学》(Science)杂志上。然而,两位来自顶尖大学医学院的专家医生的准确率分别仅为55.3%和50.0%,而且经过盲测的医生评审无法区分o1模型和人类医生做出的诊断。

这项新研究还将o1以及OpenAI之前不具备推理能力的LLM(如ChatGPT-4)与医生过去在《新英格兰医学杂志》(The New England Journal of Medicine)上发表的143个复杂临床病例的诊断基准进行了对比。

"在这些病例中,o1-preview在其鉴别诊断中包含了正确诊断的比例为78.3%。"哈佛医学院生物医学信息学系的博士生、该研究的主要作者之一托马斯·巴克利(Thomas Buckley)在周二的新闻发布会上表示。

巴克利继续说道:"当扩大到可能有帮助的鉴别诊断范围时,我们发现o1-preview在97.9%的病例中提出了有帮助的诊断。"他指出,这些结果不仅优于ChatGPT-4,而且大幅超过了发表在《自然》(Nature)杂志上的人类医生基准测试——在该研究中,医生可以自由查阅搜索引擎和标准医疗资源,准确率为44.5%。(不过,该研究包含了更大且可能更棘手的302个临床病例。)

机器人,医学博士

"我认为我们的发现并不意味着AI会取代医生,"哈佛大学教授、生物医学信息学专家、该研究的合著者阿俊·曼莱(Arjun Manrai)在新闻发布会上特别强调,"尽管有些公司可能会这么说。"

然而,曼莱确实将团队的研究结果描述为"将重塑医学的真正深刻的技术变革"的证据,这种变革需要严格的测试来验证它们在实际改善患者治疗效果方面的效用。

两位独立的医学研究者在《科学》杂志同期发表的一篇评论文章中呼应了这一观点。他们指出:"医疗保健中AI的主流提议不是取代而是协作,临床医生提供监督、情境判断和责任承担。"

该研究的合著者、贝斯以色列医疗中心的内科医生亚当·罗德曼(Adam Rodman)将AI诊断可能的法律地位比作现有的临床决策支持(CDS)模式,这是医生已经使用的数字工具,但医生仍需对这些选择承担个人责任。

"作为执业医生,我要说的是,如果监管系统的口号是'只要相信我',那么这将限制所有这些技术的广泛采用,"罗德曼在简报会上表示,"我必须看到极其强有力的证据,比如随机对照试验,我才会在我的患者身上这样做。"

扮演医生

像o1-preview这样的推理模型与你可能熟悉的AI聊天机器人不同,这些LLM被设计成在回答提示前以结构化步骤解决问题,模仿更符合逻辑的推理过程。根据研究人员的说法,该系统仍有其局限性,包括在诊断涉及多模态输入的医疗案例时存在真正困难,这意味着图像和音频证据将很容易帮助人类医生诊断患者的病情。

巴克利说:"它们在大多数医学影像基准测试中表现不佳。我认为未来十年一个非常活跃的研究领域是如何提高这些模型的多模态整合能力。"

为Gizmodo评审这项新研究的加州大学伯克利分校AI研究科学家尤金·波特(Yujin Potter)指出,该团队的最终论文对目前已知困扰AI的更棘手问题保持沉默。波特并未参与这项新研究,他在3月份共同发表了一项研究,详细说明当AI团队被要求协同工作时,如何自发地发展并执行自己的目标,主动欺骗人类用户并将文件转移到不同服务器上隐藏。

波特告诉Gizmodo:"这篇论文很有信息量,很好。但也意味着我们需要更好地理解AI安全性。人们应该记住,AI也可能产生幻觉并提供错误信息——甚至恶意或目标不一致的AI也可能操纵他们。"

在周二的简报会上,巴克利承认他和他的同事"没有正式测量这些模型的幻觉率"。

巴克利补充道:"我们知道像o1这样的模型确实会产生幻觉,但在绝大多数情况下,我们发现该模型至少提出了有帮助的建议,而在大量病例中,它提出了与原始病例完全一致的诊断。"

巴克利的合著者曼莱补充道:"我的座右铭仍然是'信任但要验证。'"

【全文结束】