一项新研究考察了大型语言模型在各种医疗环境中的表现,包括真实的急诊室病例——在这些情况下,至少有一个模型的诊断准确率似乎超过了人类医生。
该研究本周发表在《科学》杂志上,由哈佛医学院(Harvard Medical School)和贝斯以色列女执事医疗中心(Beth Israel Deaconess Medical Center)的医生和计算机科学家团队领导。研究人员表示,他们进行了各种实验来衡量OpenAI的模型与人类医生的比较结果。
在一个实验中,研究人员重点关注了76名来到贝斯以色列急诊室的患者,比较了两名内科主治医师(attending physicians)提供的诊断与OpenAI的o1和4o模型生成的诊断。这些诊断由另外两名主治医师进行评估,他们不知道哪些来自人类,哪些来自AI。
研究称:"在每个诊断环节(diagnostic touchpoint),o1模型的表现要么略优于两名主治医师和4o模型,要么与之持平,"并补充说这些差异"在第一个诊断环节(初始急诊分诊)尤为明显,此时关于患者的信息最少,做出正确决策的紧迫性最高。"
哈佛医学院关于该研究的新闻稿中,研究人员强调他们"完全没有预处理数据"——AI模型获得的信息与每次诊断时电子病历(electronic medical records)中可用的信息相同。
凭借这些信息,o1模型在67%的分诊(triage)案例中提供了"准确或非常接近的诊断",而一名医生在55%的案例中提供了准确或接近的诊断,另一名医生的准确率为50%。
哈佛医学院AI实验室负责人、该研究的主要作者之一Arjun Manrai在新闻稿中表示:"我们针对几乎所有基准测试了AI模型,它超越了先前的模型和我们的医生基准。"
需要明确的是,该研究并未声称AI已准备好在急诊室做出真正的生死攸关的决策。相反,研究表示这些发现表明"迫切需要前瞻性试验(prospective trials),以在真实患者护理环境中评估这些技术。"
研究人员还指出,他们仅研究了模型在提供基于文本的信息时的表现,而"现有研究表明,当前的基础模型(foundation models)在处理非文本输入方面的推理能力更为有限。"
同样作为该研究主要作者之一的贝斯以色列医生Adam Rodman向《卫报》警告称,目前"没有正式的问责框架"来管理AI诊断,患者仍然"希望人类指导他们做出生死攸关的决策[以及]指导他们做出具有挑战性的治疗决策。"
在一篇关于该研究的帖子中,急诊医生Kristen Panthagani表示,这是一项"有趣的AI研究,但导致了一些过度炒作的标题",特别是因为它比较的是AI诊断与内科医生而非急诊医生的诊断。
Panthagani说:"如果我们打算将AI工具与医生的临床能力进行比较,我们应该首先与实际从事该专业的医生进行比较。我不会惊讶于大型语言模型(LLM)能在神经外科委员会考试中击败皮肤科医生,[但这并不是一个特别有用的知识。]"
她还辩称:"作为一名初次接诊患者的急诊医生,我的主要目标不是猜测你的最终诊断。我的主要目标是确定你是否患有可能致命的疾病。"
这篇报道和标题已更新,以反映研究中的诊断来自内科主治医师,以及包含Kristen Panthagani的评论。
【全文结束】

