研究警告:AI聊天机器人并非为诊断而建,脑部扫描解读中发现严重错误AI Algorithms Are Transforming Medical Imaging in Hospitals

环球医讯 / AI与医疗健康来源:www.medboundtimes.com美国 - 英语2026-09-24 20:45:00 - 阅读时长3分钟 - 1474字
新研究表明,通用型AI平台(如GPT‑5、Gemini 3 Pro等)在解读脑部CT扫描时存在20%的基本诊断错误率,且模型间解释差异巨大,甚至将缺血性中风误判为出血。研究人员指出,大型语言模型虽能生成看似权威的解释,但其底层解读可能错误或前后矛盾,必须由医学专家监督,不能直接用于临床诊断。
AI聊天机器人诊断脑部扫描严重错误医疗错误缺血性中风出血性中风医学监督
研究警告:AI聊天机器人并非为诊断而建,脑部扫描解读中发现严重错误

新研究显示,通用型AI平台可能产生关键且危险的医疗错误。

纽约州老韦斯特伯里——人工智能正在迅速改变医疗保健。AI系统现在能够通过视网膜照片检测糖尿病眼病,并分析CT图像以发现早期肺癌和中风的迹象。

如今,在全美乃至全球的医院里,专用算法正悄然协助医生,优先处理紧急扫描,标记那些可能被忽略的细微异常。这些专门的AI工具通常经过数百万张精确分类的医学图像训练,正越来越多地融入真实临床实践。

与此同时,另一种形式的AI吸引了公众的注意:大型语言模型(LLM)。这些广泛可用的系统,如ChatGPT和Claude,能够分析文本和图像。理论上,这些能力应该使它们非常适合医学任务,但通用型AI平台在医疗诊断方面是否可靠呢?

由纽约理工学院骨病医学院(NYITCOM)副教授Milan Toma博士领导的一项新研究给出了否定答案。根据学术期刊《Algorithms》上的论文,Toma及其合著者——包括NYITCOM高级开发安全运维工程师Mihir Matalia和医学生Sungjoon Hong——测试了世界上最先进的多模态大语言模型(GPT‑5、Gemini 3 Pro、Llama 4 Maverick、Grok4和Claude Opus 4.5 Extended)的可靠性。

研究人员向每个AI模型提供了相同的CT脑部扫描图像,该图像显示明确的颅内病变。然后,他们要求模型像放射科医生一样分析图像——识别所使用的成像技术、病变在大脑中的位置、主要诊断、关键特征以及可能的备选诊断。总体而言,研究结果发现,这些AI模型的基本诊断错误率为20%,并且在解释和评估方面存在令人担忧的差异,以及在评估中的不一致性。

起初,这些模型表现出了令人期待的结果:所有五个模型都正确地将图像识别为CT脑部扫描。其中四个模型还发现了一个关键发现:左侧大脑中动脉附近的缺血性中风。然而,有一个模型犯了一个根本性错误,将中风错误地归类为大脑对侧的出血。在真实的临床环境中,此类错误会严重影响患者的健康,因为缺血性中风和出血性中风需要不同的治疗方法。

即使在得出正确诊断的四个AI模型中,它们的解释也存在巨大差异。一些模型对中风首次发生的时间给出了不同的解释;其他模型在替代诊断和受影响的其他脑区以及钙化问题上存在分歧。研究人员随后引入了一个新奇的测试:他们要求每个AI模型对其他模型的诊断解释进行评分。这种交叉评估暴露了更多的不一致性,一些模型评分比其他模型更为苛刻。其中一个模型甚至认为这些发现显示的是慢性脑部异常而非急性中风,并因此系统地扣减了其他模型的分数。

近年来,Toma已发表了30多篇关于AI在医学诊断和医疗保健中的应用的同行评审研究,以及两本相关主题的书籍。

“我们的研究突显了AI领域的一个关键区别。大多数成功的医学AI工具都是任务特定的算法,它们在大量标注医学图像的数据集上训练,并针对非常具体的诊断任务进行了验证。”纽约理工学院骨病医学院(NYITCOM)副教授Milan Toma博士说。

“然而,大型语言模型并非为诊断而优化——它们是为语言和对话而构建的。因此,它们会生成听起来权威的解释,即使其底层解读是错误的或不一致的。”Toma说。

Toma和他的合著者总结道,未来医疗AI的发展方向很可能是将专门的诊断系统与语言模型结合起来。然而,尽管LLM可能在临床文档、总结报告或与患者沟通方面有用,但医学专家的监督对于所有诊断解读而言仍然是不可妥协的。

参考:

研究发表于《Algorithms》期刊。

(NewswiseHG)

【全文结束】