哈佛研究揭示:人工智能在急诊诊断中表现已超越人类医生AI is now outperforming human doctors in the emergency room diagnoses, new Harvard study reveals | Mint

环球医讯 / AI与医疗健康来源:www.livemint.com美国 - 英语2026-08-19 22:21:10 - 阅读时长2分钟 - 842字
哈佛大学最新研究显示,OpenAI开发的o1大语言模型在急诊室诊断场景中显著超越人类医生,其在初始分诊、急诊评估及住院诊断三个关键环节的准确率分别达到67.1%、72.4%和81.6%,在治疗方案规划方面中位数得分89%,远超医生的34%-41%,该突破性发现发表于《科学》期刊,表明AI已突破临床推理能力基准,但研究同时强调需加强人机协作研究以应对非文本医疗数据的挑战,为降低误诊率和优化医疗资源分配提供新路径。
急诊诊断临床诊断准确率急诊室临床决策治疗方案患者预后诊断错误临床管理人类医生人工智能大语言模型哈佛研究
哈佛研究揭示:人工智能在急诊诊断中表现已超越人类医生

哈佛大学最新研究发现,先进人工智能模型在诊断患者时已能超越医生,特别是在高压的急诊室(ER)场景中。研究人员将OpenAI的先进o1语言模型与数百名医生在多个诊断环节进行直接较量,发现该AI在诊断病情和规划临床管理方面 consistently 超越人类医生。

这项发表于《科学》期刊的新研究,将贝斯以色列女执事医疗中心急诊室的76个临床案例提供给OpenAI的o1模型和两位专家主治医师。研究发现,o1在多项任务中表现达到或显著优于人类专家:

初始分诊:当信息量最少时,o1在67.1%的案例中识别出精确或高度接近的诊断,而两位医生的准确率分别为55.3%和50%。

急诊评估:随着医生初始评估中患者信息的增加,该模型的准确率提升至72.4%,而两位医生分别为61.8%和52.6%。

住院诊断:在最终阶段(患者转入医疗病房或重症监护室时),o1准确率达81.6%,再次超越两位医生的78.9%和69.7%。

研究还发现,当要求提供治疗方案(如开具抗生素或规划临终决策)时,AI具有明确优势。在五项案例研究中,AI的中位数得分达89%,大幅超越使用常规资源(约34%)和GPT-4(41%)的医生。

研究人员表示:"尽管将AI应用于临床决策支持有时被视为高风险行为,但更广泛使用这些工具可能有助于减轻诊断错误、延误及资源获取不足带来的人力与经济成本。"

"我们的发现表明,大语言模型(LLMs)现已超越多数临床推理基准,迫切需要开展人机交互研究和前瞻性临床试验,以严格评估AI系统改善临床实践和患者预后的潜力。"他们补充道。

不过研究人员也警告,临床医学涉及大量非文本输入,如患者身体痛苦程度或医学影像解读。这意味着未来研究需重点评估人类与机器如何有效协作。

研究首席作者之一阿琼·马奈在《卫报》声明中指出:"我认为研究结果并不意味着AI将取代医生,但它确实意味着我们正见证一项将重塑医学的深刻技术变革。"

【全文结束】