临床医生在评估医疗人工智能工具中发挥更大作用​​Clinicians take a larger role in evaluating AI tools for healthcare | MobiHealthNews

环球医讯 / AI与医疗健康来源:www.mobihealthnews.com美国 - 英语2026-09-11 00:21:39 - 阅读时长3分钟 - 1244字
在2026年HIMSS全球健康会议上,埃默里医疗保健首席AI官Nabile Safdar和麻省总医院布莱根AI高级总监Bernardo Bizzo介绍了Healthcare AI Challenge等倡议。该倡议通过共享数据集和标准化评估方法,让临床医生系统性地测试不同AI模型在放射报告、病历摘要等场景中的表现,目前已涉及40家机构的200多名参与者,完成五次挑战并测试了18个基础模型。两位专家强调,AI工具在医疗领域快速发展的同时,缺乏评估其安全性、可靠性和临床实用性的明确框架,而这一挑战平台旨在帮助医疗系统在投入大量资源前获取关键信息,衡量AI工具的实际效率提升和投资回报率。
医疗人工智能临床医生评估框架安全性可靠性临床实用性基准测试AI竞技场医疗工作流效率投资回报率
临床医生在评估医疗人工智能工具中发挥更大作用

在周三于拉斯维加斯举行的2026年HIMSS全球健康大会暨博览会上,埃默里医疗保健首席AI官Nabile Safdar与麻省总医院布莱根人工智能高级总监Bernardo Bizzo讨论了医疗领导者如何通过汇集数据并构建可供所有人使用的基准,来做出更智能、数据驱动的AI部署决策。

AI工具在医疗领域发展迅速,但许多临床医生缺乏评估其安全性、可靠性和临床实用性的明确框架。

Healthcare AI Challenge等倡议旨在弥补这一差距,为供应商提供结构化方法来测试新兴AI工具,并收集反馈,从而指导整个医疗系统更安全地采用这些工具。

Bizzo表示:“AI的机遇在于提高医疗工作流程效率,但医疗系统缺乏评估基础模型安全性和有效性的工具。”

Safdar指出,组织在承诺采用新AI系统之前,往往面临艰难的评估过程。部署这些工具需要投入实施、员工培训和流程整合。

Safdar说:“临床领导者不确定它是否带来了价值。”

尽管环境记录和影像AI等技术已显示出可衡量的益处,但更广泛的领域正变得越来越复杂。

Bizzo解释说,许多AI工具的投资回报率仍不确定。虽然技术强大,但大多数基础模型是作为通用系统开发的,而非专门针对医疗环境设计的工具。

Bizzo说:“我们面临的最大挑战是缺乏基准来评估这些工具的表现以及它们能为我们提供多大帮助。”

为解决这一问题,Bizzo和同事创建了一项旨在系统评估AI系统在多种临床场景下表现的倡议。

Healthcare AI Challenge允许来自参与机构的临床医生和研究人员使用共享数据集和标准化评估方法,测试不同的AI模型。

该倡议包含一个“AI竞技场”平台,临床专家可在其中审核不同AI模型输出的结果,并比较它们在放射报告或病历摘要等任务上的表现。

到目前为止,Healthcare AI Challenge已完成五次挑战,涉及来自40家机构的大约200名参与者,共进行了超过4500次评估。研究人员测试了18个基础模型,包括通用系统和医疗专用模型。

该平台允许临床医生从多个维度评估AI工具——而不仅仅是技术准确性。

Safdar说:“谈到AI,很多人会纠结于准确性。但你的家庭医生通常在想的是:‘它能让我更快吗?’”

在AI竞技场中,评估者可以比较人类表现与AI输出,或分析不同模型相互间的表现。他们还可以评估速度、临床实用性以及结果是否达到临床工作流可接受的阈值等因素。

Bizzo表示,目标是创建一种可重复的评估流程,让医疗系统在重金投入AI系统之前就能进行测试。

他说:“作为医疗专业人员,你在投资一个模型之前想知道的就是这些信息。”

展望未来,Bizzo表示有计划扩展该平台,使其直接与电子健康记录系统集成,并评估新兴的自主AI工作流。这些努力旨在衡量技术性能之外的、临床医生在实际使用该技术时获得的真实生产力提升。

他补充道:“我们希望衡量用户效率提高了多少,并提供这些信息,让你知道预期能获得多少投资回报率。”

【全文结束】