您是否曾经思考过,在急诊诊断环境中,人工智能与人类医生相比表现如何?本周四发表的一项新研究可能会让您重新思考这个问题。
这项发表在《科学》杂志上的研究发现,最先进的大型语言模型在一系列常见临床任务中表现优于人类医生。研究使用真实的急诊科数据和数百名医生的比较,结果显示该模型在诊断选择、急诊分诊和确定后续管理步骤方面匹配甚至超过了人类临床医生的表现。
研究作者表示,这些结果并不意味着AI模型已经准备好取代人类医生。相反,这些结果表明行业专业人士需要更快、更严格的标准来评估和规范在医学中使用AI的规则。
研究人员测试了OpenAI于2024年发布的o1系列大型语言模型,进行了六项实验,将标准化临床案例与马萨诸塞州一家医疗中心随机选择的急诊室患者真实样本相结合。
该模型的优势在早期分诊阶段最为明显,即必须在信息有限的情况下做出决策的阶段。随着可用数据的增加,人类临床医生和AI模型的表现都有所提高,但研究发现,该大型语言模型在处理不确定性方面表现得更好,能够更有效地利用零散或非结构化的健康数据和记录。
这些发现建立在数十年来使用困难诊断案例评估医疗计算系统的经验基础之上。早期的大型语言模型已经优于传统的算法方法,但这项研究的独特之处在于其规模以及在真实临床场景中人类医生与AI之间的直接对比。
作者强调,我们应该对这些结果保持谨慎。医院和急诊室的实际临床工作通常依赖于视觉和听觉线索——而非基于文本的推理——而这些是AI无法完全准确解读的。"未来的工作需要评估人类和机器如何在使用非文本信号方面有效协作,"研究报告指出。
在考虑AI辅助医疗时,同样关键的是要评估它是否安全、公平且具有成本效益,而这些方面在本研究中并未进行测试。
"简而言之,该模型的表现超过了我们庞大的医生基线。您将在细节中看到这一点,但其中包括经过委员会认证、正在执业的医生和真实复杂的病例,"哈佛医学院生物医学信息学助理教授Arjun Manrai在一次虚拟新闻发布会上表示。
"尽管有些公司可能会如何解读和使用这些结果,但我不认为我们的研究结果意味着AI可以取代医生,"Manrai表示。"我认为这确实意味着我们正在见证一项将重塑医学的深刻技术变革,我们需要现在就评估这项技术,并在前瞻性临床试验中严格进行验证。"
监管机构、医院和医疗保健提供者应在部署这些工具前共同努力进行彻底测试,以确保所有患者的安全和公平。
本周四同时发表在《科学》杂志的一篇评论中,澳大利亚弗林德斯大学的研究人员Ashley M. Hopkins和Eric Cornelisse写道,这项研究是更好地评估医疗保健中AI系统的一个步骤,但医学是一个复杂的领域,需要严格的监督,以确保患者获得最佳可能的护理。
Cornelisse在一份声明中表示:"我们不允许医生在没有监督和评估的情况下执业,AI也应被要求达到可比的标准。"
【全文结束】

