近几个月来,《贝克尔医院评论》(Becker's)报道的多项研究表明,人工智能在急诊诊断方面已超越医生,能够提前三年发现胰腺癌,并在医学基准测试中击败了专业临床软件。
但这些研究在解答问题的同时也带来了诸多疑问。大多数最佳结果来自回顾性、模拟或单站点研究,这使得医疗系统领导者难以确定这些工具在常规临床实践中的表现——这一验证缺口甚至已被部分研究作者所承认。
同时,AI目前仍主要被定位为生成线索的工具,需要临床医生进行审核,当模型遗漏或错误识别发现时,责任归属不明确。此外,由于一些性能声明来自供应商而非独立的同行评审研究,领导者在做出投资决策前必须仔细区分经过验证的证据和公司报告的结果。
以下是《贝克尔医院评论》在过去两个月中报道的八项关于AI在诊断和临床推理方面的研究:
- 在6月18日发表于《新英格兰医学杂志AI》(NEJM AI)的一项研究中,波士顿儿童医院、马萨诸塞州剑桥市的哈佛大学和OpenAI的研究人员使用AI辅助工作流程重新分析了376例先前未解决的罕见疾病病例,确认了18项诊断。
- OpenAI于6月18日表示,在3,500个评审回复中,由医生组成的评审小组给其新的GPT-5.5 Instant模型的评分高于由医生撰写的答案——这些医生拥有无限的时间和互联网访问权限——该模型在准确性、沟通能力、完整性和健康决策帮助方面得分更高。
- 6月12日发表在《自然医学》(Nature Medicine)上的一项研究表明,来自OpenAI、Google和Anthropic的通用大型语言模型在每一项医学基准测试中都优于专业临床AI工具,尽管临床AI开发者对这些发现提出了质疑。
- 根据5月21日的公告和发表在《自然通讯》(Nature Communications)上的一项研究,克利夫兰诊所和匹兹堡卡内基梅隆大学的研究人员开发了一种无需手动标记训练数据即可解读心脏MRI扫描的AI系统。
- 据4月30日发表在《科学》(Science)杂志上的一项研究,OpenAI的o1模型在急诊科诊断方面表现优于两名人类医生,在贝斯以色列女执事医疗中心的76个病例中,该模型更频繁地识别出确切或非常接近的诊断。
- 根据4月9日发表在《临床胃肠病学与肝病学》(Clinical Gastroenterology and Hepatology)上的一项研究,伍斯特市UMass Chan医学院的研究人员在同类首个人体试验中,测试了一种在实时手术过程中诊断胆管癌的AI工具。
- 根据4月28日发表在《肠道》(Gut)杂志上的一项研究,明尼苏达州罗切斯特市梅奥诊所(Mayo Clinic)研究人员开发的AI模型能够在临床诊断前长达三年的腹部CT扫描中检测到胰腺癌。
- 根据4月23日发表在《自然健康》(Nature Health)上的一项研究,加州大学圣地亚哥分校研究人员开发的对话式AI工具使用既定医疗协议指导患者进行自我分诊,在超过30,000次模拟患者互动中,约84%的时间选择了正确的医疗流程图,并以超过99%的准确率遵循决策步骤。
【全文结束】

