医疗保健领域的AI雄心是否遭遇了可靠性瓶颈?Have health care’s AI ambitions hit a reliability wall?

环球医讯 / AI与医疗健康来源:www.msn.com美国 - 英语2026-09-16 06:12:20 - 阅读时长5分钟 - 2282字
医疗保健组织在数字化转型中大幅增加AI投资,但仅18%的组织认为自己已准备好实施AI,暴露出从实验到可靠应用的巨大鸿沟。actAVA公司推出专门用于医疗保健的万亿参数模型Cura,强调企业应拥有专属的领域原生AI系统。同时,最新CHI-Bench基准测试显示,最强AI代理在复杂医疗工作流中的一次通过率仅28%,凸显出部署基础设施、治理与评估的重要性。未来医疗AI发展不仅取决于模型能力,更在于能否在真实运营环境中实现可靠、可问责的实用部署。
医疗保健AI可靠性数字化转型预测分析临床决策支持代理型AI治理评估CHI-Bench工作流
医疗保健领域的AI雄心是否遭遇了可靠性瓶颈?

医疗保健组织在推进运营现代化和改善服务交付的过程中,加速了数字化转型投资。最新行业数据显示,40%的组织每年在数字技术上投入5000万至1亿美元,66%的组织表示正在积极部署新的数字解决方案。这些努力反映了提升运营效率、改善患者服务以及简化行政流程的更广泛推动力。

随着这些投资的扩大,人工智能已日益融入医疗保健服务。如今,AI支持从预测分析到临床决策支持等一系列应用。预测性AI在医疗保健领域已应用数十年,它运用机器学习技术来预估未来结果,如再入院风险、早期疾病指标和治疗建议。

然而,数字化和AI应用背后的动力也暴露出显著的准备差距。尽管对先进技术的兴趣日益增长,但HIMSS市场洞察调查显示,只有18%的医疗保健组织认为自己已做好AI实施准备。

这一差距凸显了从实验转向可靠企业级应用的挑战,此时基础设施、治理和运营一致性变得至关重要。对于由医疗保健和AI技术领导者创立的、专为医疗保健打造的代理型AI生命周期管理平台actAVA而言,核心挑战是开发出使AI在复杂医疗环境中可靠、受管且可适应的所需系统。

作为这一使命的一部分,actAVA推出了Cura,一个专门为医疗代理场景构建的万亿参数模型。Cura旨在帮助企业将其自身的机构知识(包括工作流程、政策、工具和运营专长)转化为完全由自己拥有的智能。它是对一个愿景的大规模演示:使医疗保健组织不再租用通用AI,而是构建能够实现临床级别沟通、专家临床推理以及在复杂行政和临床工作流中可靠执行的领域原生系统。

“我们相信企业AI的未来不会由一个所有人租用的单一模型来定义,而是由成千上万个由依赖它们的企业所拥有、塑造并持续优化的专业系统来定义。”actAVA首席执行官兼联合创始人Kevin Riley说。

“医疗保健一直是一个可靠性至关重要的领域,因为决策直接关系到人员、流程和法规。AI的下一个阶段要求组织超越模型能力,思考如何在真实运营环境中部署、监控和改进智能。”

围绕企业AI的讨论通常聚焦于更大规模的模型和高级推理能力。然而,医疗保健工作流带来的挑战超越了模型性能。行政和临床运营涉及广泛的政策、多个系统、专业角色以及对准确性和问责制至关重要的决策。

首席技术官兼联合创始人Frank Wang将这一转变描述为从开发AI能力到构建可靠AI系统的转变。“构建一个令人印象深刻的AI演示可以很快,但创建能在数千个真实场景中稳定表现的系统需要不同的纪律,”Wang说。“企业AI的未来既依赖于智能,也依赖于编排、评估和持续改进。”

这一观点反映了更广泛的行业考量:医疗保健组织需要将模型、工作流、数据和治理流程连接起来的基础设施。能够通过协调工具和动作执行多步骤任务的代理型AI系统,带来了自动化的新机遇,但也需要保障措施来在规定边界内运行。

actAVA专注于构建管理AI代理整个生命周期所需的系统,从创建到评估和治理。这包括帮助代理遵循政策、跨多步骤流程工作以及安全地在医疗环境中操作的工具。它还在开发围绕医疗机构常见工作流和需求定制的专门语言模型。

这些发展背后的一个关键主题是所有权。医疗保健组织通常在其数据、流程和机构专业知识中拥有丰富的运营知识。Wang认为,未来的企业AI系统将越来越多地涉及组织对其工作流、模型和知识资产保持更大的控制权。领导团队指出,受监管行业倾向于依赖可预测、可重复的运营模式,这可能导致一种新兴的“90/10”架构转变:大约90%的企业AI工作负载将在商品或开放权重模型上运行以处理可重复的工作流,而只有10%依赖前沿模型处理新颖或高度复杂的用例。

首席AI官兼联合创始人Weiran Yao认为,这种转变反映了组织构建AI方式的更广泛进化。他说:“AI正在改变专业知识与技术之间的关系。机遇在于创建系统,使组织知识成为主动能力,同时保持负责任部署所需的治理和评估。”

随着研究人员考察AI代理在真实医疗环境中的表现,评估的重要性日益凸显。作为这一广泛努力的一部分,actAVA的研究人员与医疗专业人士和学术伙伴合作开发了CHI-Bench,一个用于评估AI代理能否完成复杂、长期医疗工作流的基准测试。该基准测试涵盖了提供方事先授权、支付方利用管理以及护理管理过程中的75项任务。

CHI-Bench并非聚焦于孤立的AI能力,而是围绕反映企业医疗运营的条件设计,包括多步骤流程、政策要求、角色转换以及与模拟医疗应用的交互。研究发现,表现最强的代理框架在pass@1指标下解决了28%的任务,而当需要多次尝试保持一致性时,性能进一步下降。

这些发现凸显了为什么部署基础设施已成为重要关注领域。医疗保健工作流不仅限于回答问题或生成信息;它们要求系统解释政策、跨多个阶段管理上下文,并在既定的运营边界内执行操作。

据Yao称,像CHI-Bench这样的基准测试的开发代表了在根据实际企业需求评估AI系统方面不断增长的努力。通过测试长期工作流,研究人员可以更好地了解AI代理在哪些方面表现有效,以及在哪里需要额外的工程、治理和监控机制。

对于探索AI采用的医疗保健组织而言,下一阶段可能取决于能否构建将技术能力与运营责任相结合的基础。随着AI系统更深入地嵌入医疗环境,评估性能、管理风险以及调整工作流的能力可能变得与模型本身同样重要。

医疗保健AI的持续演进很可能取决于组织如何有效地将先进模型与治理、评估框架和运营准备度相结合。随着这一领域的发展,进步不仅可能通过AI系统的复杂性来衡量,还可通过它们在复杂医疗环境中支持可靠、可问责且实用的应用能力来衡量。

【全文结束】