根据一项新研究,人工智能模型在急诊医疗决策方面表现优于医生。
美国哈佛医学院(Harvard Medical School)和贝斯以色列女执事医疗中心(Beth Israel Deaconess Medical Center)的研究人员在广泛的临床推理任务中比较了人工智能和医生的表现。
他们发现,大型语言模型(LLMs)在多项任务中表现优于医生,包括基于可用信息做出急诊室决策、识别可能的诊断以及选择管理的下一步措施。
哈佛医学院教授、该研究共同资深作者阿尔琼·曼赖(Arjun Manrai)表示:"我们让AI模型接受了几乎所有基准测试,它的表现不仅超过了先前的模型,也超过了我们的医生基准。"
"然而,这并不意味着AI一定会改善医疗服务——如何以及在哪里部署AI仍研究不足,我们迫切需要严格的前瞻性试验来评估AI对临床实践的影响。"
AI模型是如何测试的?
研究人员首先评估了OpenAI于2024年发布的推理模型o1-preview,他们向该模型提供了一系列临床案例,包括已发表的病例讨论和真实的急诊科记录。
在大多数实验中,AI的表现优于人类医生,尤其是在管理推理、临床推理、文档处理以及信息有限的真实急诊环境中。
贝斯以色列女执事医疗中心哈佛医学院医学临床研究员、该研究共同第一作者彼得·布罗多(Peter Brodeur)表示:"模型的能力越来越强。过去我们用多项选择题来评估模型;现在它们的得分持续接近100%,我们无法再追踪进展,因为我们已经达到了天花板。"
在一项测试中,研究人员要求LLM——o1和GPT-4o——在标准急诊科环境中评估患者的各个阶段,从早期分诊到后续入院决策。
在每个阶段,模型仅获得该阶段可用的信息,并被要求生成可能的诊断并推荐下一步该做什么。
AI与人类医生之间差距最大的是在分诊阶段,此时患者的资料更为有限。
与人类医生一样,随着更多信息的获取,AI模型的诊断能力也得到了提高。
作者写道:"尽管将AI应用于临床决策支持有时被视为高风险行为,但更多地使用这些工具可能有助于减轻诊断错误、延误和缺乏获取途径带来的人力和财务成本。"
仍需更多研究
研究人员呼吁进行前瞻性试验,以在真实环境中评估这些技术,并希望医疗保健系统投资计算基础设施并开发支持AI工具安全整合到临床工作流程中的框架。
布罗多表示:"一个模型可能做出了正确的首要诊断,但也可能建议不必要的检查,使患者面临风险。在评估性能和安全性时,人类应该是最终的基准。"
该研究存在一些局限性。作者指出,该研究仅反映模型性能,主要关注o1模型的预览版,而该版本已被OpenAI的o3等更新模型所取代。
作者写道:"尽管我们预期性能会随着新模型的出现而保持或提高,但仍需要进行更多研究来阐明性能如何在不同模型间变化,并研究人类和大型语言模型如何协作。"
【全文结束】

