如果你在10年后走进急诊室(ER),你将会遇到一种新型的医护人员:一种旨在更快地为你提供诊断并帮助你的医疗团队做出更明智决策的人工智能(AI)系统。当你坐在候诊室时,你将连接到一个不断自主监测的血压袖带。同时,AI系统将在你和医生讨论症状时进行监听,随时准备标记出医生可能犯的错误或建议下一步行动。
这种AI辅助急诊医疗的愿景可能很快就会成为现实。在一项新研究中,研究人员今天在《科学》杂志上报告称,一种被称为大语言模型(LLM)的人工智能类型,在诊断复杂且可能危及生命的疾病(包括心脏血流减少)方面,甚至在信息有限的真实急诊护理快速进行阶段,其表现往往优于医生。在早期急诊病例中,该模型在约67%的病例中识别出正确或非常接近的诊断,而医生的这一比例仅为50%至55%。而且这项技术还在不断进步。
"评估医学中的AI需要在不同临床任务和环境中既有深度又有广度,"达纳-法伯癌症研究所的计算机科学家Shreya Johri说道,她没有参与这项新研究。她同时指出,这些AI系统在医疗保健中的广泛应用将取决于了解它们在哪些情况下最为可靠。
这项新研究背后的团队测试了先进大语言模型OpenAI的o1模型诊断各种疾病患者的准确程度。在五项任务中,该模型需要阅读经过精心挑选的医疗档案,并提出诊断建议、选择下一步行动,或估计未来健康特定变化的概率。在所有五项练习中,o1的表现与医生相当甚至优于医生。该模型与人类之间的差距在所有任务中都非常显著,以至于论文共同作者、贝斯以色列女执事医疗中心内科医生Adam Rodman表示,作者们曾担心没有人会相信这些结果。在一项任务中,o1在98%的检查病例中获得了完美的临床推理评分——基于其解释诊断思路和下一步行动的能力——而主治医生仅能在35%的情况下做到这一点。
哈佛大学计算机科学家、论文共同作者Thomas Buckley认为,大语言模型的最后测试是"最重要"的,该测试要求在患者护理的三个不同时间点对急诊患者进行诊断。当患者进入急诊室时,他们必须首先向接诊护士描述症状,然后由医生进行评估,最后医生必须决定适当的治疗方案。每一步都可能出错,因为患者往往难以准确描述症状,而医生本身可能同时处理多个高压力病例。早期分诊决定特别具有挑战性,因为临床医生必须快速行动,而错误可能带来即时后果。例如,医生若将血液感染误诊为普通感冒,可能会让患者在没有抗生素的情况下回家——这是一个潜在致命的决定。
研究人员使用了来自贝斯以色列医院急诊室真实患者的病例,并以模拟患者描述病情时的三个护理点的方式,逐步向o1提供信息。Buckley指出,与其他实验不同,这项实验直接探究了大语言模型如何与"现实世界、混乱"的数据(可能是不完整或有偏见的)进行交互。在急诊护理过程的早期,当患者进入急诊室并提供关于其疾病的有限信息时,o1在67%的情况下识别出准确或接近的诊断——比接受相同病例的两位医生高出10%以上。尽管在获得更多信息时,这一差距略有缩小,但在后续护理流程中,大语言模型仍然比医生高出2%至10%。
值得注意的是,OpenAI的o1模型于2024年底首次发布。Buckley说:"在机器学习领域,这现在有点像古代历史了。"因此,未参与该研究的斯坦福大学内科医生Eric Strong认为研究人员测试的模型年龄"无关紧要",因为更新的模型可能表现同样好,甚至更好。
研究AI在医疗保健中潜在用途的专家们对这些发现感到振奋。"看到[该模型]在真实环境中进行测试……令人兴奋,"未参与新工作的谷歌计算机科学家Daniel McDuff说道。Johri也表示赞同,称赞作者以"单一实验无法做到的方式"评估了o1的诊断和推理能力。
不过,Rodman表示,该研究并未分析大语言模型在面对需要数小时以上患者病史的情况下的表现,而许多病例都需要这样的信息。急诊停留时间相对较短,因此即使是真实世界实验也无法与其他环境中的诊断过程相提并论。"我认为当前模型不适用于拥有数天信息的住院患者,"他警告道,"我认为性能会下降。"此外,该研究仅向o1提供了书面病例信息,没有包括影像等非文本输入,而这些输入对于许多真实诊断(包括血栓和癌症)至关重要。
Rodman表示,他的团队已经在进行新的实验,要求模型使用更长期和更广泛的现实世界信息来评估患者。专家们表示,下一个挑战是确定这些系统能否在受控测试之外改善真正的患者护理。"我们需要了解这些模型如何在某人的护理随着时间推移而演变的过程中发挥作用,"McDuff说。
【全文结束】

