医疗科技行业是否忽视了经过验证的深度学习医学AI模型而过分关注未经充分验证的大语言模型和生成式AIIs the health tech business neglecting validated deep learning medical AI models versus less proven LLMs and generative AI? | Telehealth and Telecare Aware

环球医讯 / AI与医疗健康来源:telecareaware.com美国 - 英语2026-08-19 16:59:50 - 阅读时长3分钟 - 1287字
本文探讨了医疗AI领域的一个关键问题:行业是否过度关注未经充分验证的大语言模型(LLMs)和生成式AI,而忽视了已通过多年验证的深度学习医学AI模型。文章引用Eric Topol医学博士的研究指出,基于医学影像的AI系统在检测多种疾病方面已有大量验证,如通过视网膜扫描预测帕金森病、心脏病、中风和阿尔茨海默病,以及从CT图像中检测癌症等,这些技术却未被广泛应用;而医学大语言模型和生成式AI虽然备受追捧,却缺乏长期严格的临床验证,其对患者健康结果的实际益处证据有限。文章呼吁应加强已验证AI的应用,并对缺乏关键证据的领域进行必要的临床试验,解决这一医疗AI实施中的悖论。
医疗AI医学影像AI深度学习大语言模型生成式AI健康结果疾病检测临床验证视网膜扫描医疗科技
医疗科技行业是否忽视了经过验证的深度学习医学AI模型而过分关注未经充分验证的大语言模型和生成式AI

Eric Topol医学博士回答了他自己提出的惊人问题,对比了面向临床医生和患者的医学影像AI与决策支持系统的现状。他最近在Substack平台"Ground Truths"栏目发表的文章将促使你更深入地思考什么是真正经过多项研究验证的"医疗AI",而非仅仅被市场宣传的所谓"医疗AI"。

医学影像AI是一个已被绘制但尚未充分开发的领域。基于深度学习(DL)的医学影像AI模型已有超过十年的大量验证,且发展速度正在加快。已有多个经过验证的研究利用视网膜扫描信息作为预测未来医疗状况的指标,如帕金森病、心脏病、中风和阿尔茨海默病。视网膜显然是通往几乎所有器官的诊断门户;许多研究都聚焦于此,因为视网膜扫描相当常规。其他AI辅助模型已利用深度学习检测多种健康状况:胸腺疾病、心血管疾病,通过乳腺X光检查、结肠镜检查,以及重要的是,从为其他原因进行的计算机断层扫描(CT)图像中检测胰腺癌和其他癌症。"机会性AI"已用于检测一系列健康状况。Topol博士指出,尽管这些新技术在中国(PANDA)等国家已有应用,且至少有四家公司正在开发用于检测特定疾病的视网膜AI应用,但这些新诊断方法中没有一种已纳入常规临床实践。

另一方面,医学大语言模型(LLMs)和生成式AI可能正在建造空中楼阁。似乎每个人都在开发、投资和销售基于大语言模型的聊天机器人、辅助诊断、管理、患者分诊和直接患者使用工具。不幸的是,它们在缺乏通过长期严格研究获得的真实、持续证据的情况下被推向市场。现有的研究通常只是模拟、小规模研究或个案研究,需要进一步的真实世界验证。临床试验、基础设施以及对安全性、有效性和成本的监测都尚未到位,而时间已经不多了。(Raj Manrai在《科学》杂志中被引用)此外,生成式AI不断变化,使得研究难以长期追踪结果。Topol博士的结论是:"总之,几乎没有证据表明大语言模型对患者或医生的健康结果有益处。"

这并不是说,正如Topol博士所指出的,AI不会在医学研究、病历摘要、出院指导、翻译、行政工作(如计费代码文档化)、临床工作流程和保险授权等领域增长其有用性。AI已经进入了收入周期管理(RCM)领域,没有一家有声望的公司不使用AI赋能的工具。他引用的美国医学协会(AMA)研究表明,医生目前已经在使用这些技术,并且接受度正在增长。(对本文编辑而言,这类似于十年前的远程医疗使用图表,她预计会取得同样的进展。)

他将此称为影像AI与大语言模型之间的悖论。本文编辑则认为,医疗技术和投资不断追逐容易、"性感"且能快速产生收入/投资回报的东西,而不是那些更困难但已被证明可能对健康结果产生巨大影响的技术,这实在是一种遗憾。

Topol博士的结语恰到好处:

"让我们解决医疗AI实施中的这一悖论。这是一项双重且重要的任务:加强在已有验证的领域使用医疗AI,并对关键证据缺失的领域进行必要的临床试验,以证明大规模采用的合理性。"

【全文结束】