在医学最棘手的病例中,最难的环节往往不是选择正确诊断,而是根本想不到这种可能性。一项新研究表明,人工智能在这方面可能已优于医生。
"我们正见证一项将重塑医学的深刻技术变革,"哈佛大学生物医学数据科学家阿俊·曼雷在4月28日的新闻发布会上表示。
这一变革源于大语言模型的进步,即与OpenAI的ChatGPT相同的技术基础。新型"推理模型"能够逐步解决复杂问题。根据对2000多名临床医生的调查,截至2025年,全球五分之一的医生和护士已在复杂病例中使用AI作为第二意见,超过半数希望采用此技术,但其在医疗环境中的实际效果仍存争议。
曼雷及其同事测试了OpenAI的o1预览版模型,涵盖医学培训中的经典症状案例及波士顿急诊室76名真实患者的病历数据。研究人员4月30日在《科学》杂志报告称,在这些临床推理测试中,该AI模型比医生更可能将正确诊断或高度近似诊断纳入可能答案范围。
并非所有研究者都认为这足以证明应信任AI进行诊断。美国急诊医师学会指出,在真实急诊场景中,AI仅优于两名内科医生,而接受过特殊训练的急诊医生表现可能更佳。此外,AI推理能力仍远逊于人类医生。
"当我们说临床推理时,其含义与模型推理截然不同,"未参与该研究的哈佛医学院研究员阿莉娅·饶表示,"这些模型虽经优化可执行序列化思考,但与我们教授医学生的推理方式完全不同。"
曼雷认同这种批评,强调AI技术应辅助而非取代医疗工作者。"最终,人们希望由人类引导他们做出艰难的治疗决策,"他说。
AI在医疗诊断中更具优势?
AI模型在识别正确诊断方面表现优于医生
研究人员考察了三种诊断方法:基于大语言模型的AI系统(深蓝色)、专业诊断软件(浅蓝色)及人类临床医生(棕色)。o1预览版AI推理模型表现最佳,近80%的情况下能将正确诊断纳入回应。部分数据来自先前研究,因此各系统并非完全基于相同病例,但均分析了《新英格兰医学杂志》长期发布的高难度真实病例。
尽管如此,共同作者、波士顿贝斯以色列女执事医疗中心医生亚当·罗德曼在新闻发布会上表示,这些结果证明此类AI"在真实世界诊断中有效"。他描述了一位急诊患者案例:该患者出现常规呼吸道症状,且近期接受过器官移植处于免疫抑制状态,最终确诊为需手术干预的危险性坏死性筋膜炎。"AI模型从最初就怀疑此感染,比人类医生提前约12至24小时产生警觉。"
饶肯定研究团队将AI定位为"医生的延伸而非替代者",称其"严谨周密",但她认为现有证据尚不足以证明AI已掌握临床推理能力。其团队4月13日发布的研究测试了21种AI模型在诊断各环节的表现,推理模型总体得分最高。但深入分析发现,从早期到最新模型均存在共同弱点:在考虑多种不确定诊断时表现欠佳。
基于大语言模型的AI容易草率下结论。"当不确定性与细微差别至关重要时,其推理恰显脆弱,"饶团队在论文中指出,结论是大语言模型尚未准备好参与医疗决策。
两项研究评估了不同AI模型且方法各异,但双方均认为结果并不矛盾,下一步应开展更多研究。曼雷团队正计划临床试验,以解答"如何安全审慎地将AI整合到诊疗中"这一问题。饶对此表示支持,她指出"许多人医疗资源不足",并展望未来"AI或将成为伟大的平衡器"。
【全文结束】

