至少有一项临床试验正在进行,旨在测试"AI医生"获取患者信息并提出诊断的能力。来源:andrei_r/Getty
"'AI在急诊室任务中表现优于医生'"
"'谷歌AI比人类医生更具亲和力'"
诸如此类宣称人工智能工具能力超越医生技能的头条新闻正变得越来越普遍。
但一个先进的大型语言模型(LLM)在单一任务上胜过医生,并不一定意味着AI已准备好在现实世界中接管医学。《自然》杂志采访了研究人工智能在医疗保健中应用的研究人员,以了解哪些"AI医生"迄今表现最为突出——以及这些工具何时可能主导医疗诊断。一些科学家指出,各种AI系统已经能够处理简单的医疗任务,如做记录甚至续开处方,但他们表示,医生永远无法被机器完全取代。
"医学是混乱的,患者并不总是有教科书式的病史可讲,"波士顿马萨诸塞州哈佛医学院研究AI的住院医师David Wu说道,"我认为我们尚未证明这些系统能够处理这种混乱。"
测试中的表现
尽管如此,一些演示已经让研究人员对医学领域正在酝酿的AI革命感到兴奋。今年4月发表在《科学》杂志上的一项研究得出结论,当评估波士顿一家医院急诊科就诊者的情况时,一种先进的LLM表现优于医生。当这个AI模型——名为o1,由加利福尼亚州旧金山的OpenAI开发——审查医院工作人员在就诊期间记录的信息时,在67%的病例中,它得出了正确或几乎正确的诊断,相比之下,参与实验的两位人类医生的正确率约为50-55%。
研究人员向《自然》杂志表示,由于该研究使用了真实世界的数据,它标志着AI工具的进步,因为过去AI工具是在模拟患者场景或精心整理的医疗案例上进行测试的。但他们表示,这距离模拟真实急诊科的情况还有很长的路要走。例如,研究中的AI模型和医生都没有机会与患者互动。
另一项研究于3月发布在预印本服务器arXiv上(尚未经同行评审),该研究通过调查AI系统在与患者对话进行诊断时的表现也引起了轰动。由加利福尼亚州山景城谷歌研究的科学家领导的一个团队监测了他们开发的名为"清晰医学智能探索者"(Articulate Medical Intelligence Explorer,简称AMIE)的AI系统,该系统使用短信与波士顿一家诊所预约了紧急护理的真正患者进行聊天。在这些互动中,AMIE收集了患者的病史并讨论了可能的诊断,这些互动发生在他们与人类医生预约前的最多五天内。
随后,AMIE根据这些对话生成了可能的诊断列表。在75%的病例中,正确诊断位于聊天机器人的前三建议中,在56%的病例中是首选建议。该系统的性能与患者最终见到的实际医生相似——尽管人类临床医生提出的治疗计划比AMIE提出的更实用、更具成本效益。
准备好登场了吗?
加州大学旧金山分校的医生Robert Wachter表示,这两项研究展示了医疗AI在过去三年中的巨大发展。Robert Wachter著有一本关于AI如何改变医疗保健的书。他解释说,在此期间,LLMs已经从成功完成简单任务(如通过多项选择医学考试)发展到在获得必要信息时能够匹配医生在复杂病例中的诊断。"这相当令人兴奋,"他说道。
【全文结束】

