人工智能正在迅速改变医疗保健领域。AI系统如今能从视网膜照片中检测糖尿病眼病,并分析CT图像以发现早期肺癌和中风的迹象。目前,在美国乃至全球各地的医院中,专门化的算法正悄然协助医生,优先处理紧急扫描,并标记出可能被忽略的细微异常。这些专门的AI工具——通常经过数百万张精确分类的医学图像训练——正越来越多地融入真实的临床实践。
与此同时,另一种形式的AI也吸引了公众的注意:大语言模型。这些广泛可用的系统,如ChatGPT和Claude,既能分析文本也能分析图像。理论上,这些能力应使它们非常适合医学任务,但通用型AI平台在医学诊断方面是否可靠呢?
一项由纽约理工学院骨科医学院副教授Milan Toma博士领导的新研究给出了否定答案。该研究发表在《Algorithms》期刊上,Toma及其合著者(包括NYITCOM高级开发安全运维工程师Mihir Matalia和医学生Sungjoon Hong)测试了世界上一些最先进的多模态LLM的可靠性。研究人员为每个AI模型提供了同一张显示明显颅内病理的脑部CT扫描图像。然后,他们要求这些模型像放射科医生一样分析图像——识别所使用的成像技术、病理在脑中的位置、主要诊断、关键特征以及可能的鉴别诊断。总体而言,研究结果显示,AI模型的基本诊断错误率达到20%,并且在解释和评估方面存在令人担忧的变异性。
起初,这些模型产生了有希望的结果,所有五个模型都正确识别出该图像是脑部CT扫描。四个模型还发现了一个关键发现:左侧大脑中动脉附近的缺血性卒中。然而,有一个模型犯了一个根本性错误,将卒中错误地分类为对侧脑部出血。在真实的临床环境中,这一错误可能严重影响患者的健康,因为缺血性卒中和出血性卒中需要不同的治疗方法。
即使在得出正确诊断的四个AI模型中,它们的解释也存在很大差异。一些模型对卒中首次发生的时间给出了不同的解释;其他模型在鉴别诊断、受影响的额外脑区以及钙化方面存在分歧。随后,研究人员引入了一个新奇的惊喜:他们要求每个AI模型对其他模型的诊断解释进行评分。这种交叉评估暴露了更多的不一致性,一些模型评分比其他模型更严厉。一个模型甚至认为这些发现显示的是慢性脑部异常,而非急性卒中,因此系统地扣减了其他模型的分数。
近年来,Toma已在医学诊断和医疗保健领域的AI方面发表了30多篇同行评审研究,以及两本相关著作。
Toma说:“我们的研究突显了AI领域的一个关键区分。大多数成功的医学AI工具都是特定任务的算法,它们在大量标记的医学图像数据集上训练,并为非常具体的诊断任务进行验证。然而,大语言模型并非为诊断而优化——它们是为语言学和对话而构建的。因此,它们生成的解释听起来很权威,即使其底层解释是错误的或不一致的。”
Toma及其合著者得出结论,未来医疗保健AI可能会结合专门的诊断系统和语言模型。然而,尽管LLM可能对临床文档、总结报告或与患者沟通有用,但所有诊断解读都离不开医学专家的监督。
更多信息:Sungjoon Hong等人,《聊天不等于诊断:放射学中多模态LLM解释的诊断变异性和根本性错误》,《Algorithms》(2026年)。DOI: 10.3390/a19030170
【全文结束】

