一项重要综述发现,人工智能可以帮助临床医生工作更快、更准确,但只有当系统围绕真实的临床工作流程、校准的信任关系和明确的责任划分构建时才能实现这一效果。
研究:《医疗健康领域人机协作:范围综述》
《npj数字医学》期刊即将发表的一篇新的范围综述文章讨论了人机智能协作在医疗健康领域的实用性的最新证据。
背景
人工智能在医疗健康领域的应用正在临床任务中迅速增加,包括医疗文档处理、分诊和任务优先级排序、图像解释以及护理协调。
然而,在涉及关键决策的医疗环境中,不能仅通过比较人工智能系统与临床医生的表现来评估人工智能的实用性。因此,在患者安全、专业责任和特定情境决策最为重要的医疗环境中,需要在有意义的人类监督下实现人与人工智能系统的协作。
包括世界卫生组织(WHO)、欧盟人工智能法案和美国食品药品监督管理局(FDA)在内的与健康相关的政策和监管框架强调,在关键医疗环境中实施人工智能系统应由合格专业人员监督和指导,并辅以人工监督措施,以最大限度地降低对健康、安全和基本权利的风险。
在这项范围综述中,作者分析了有关医疗健康领域人机协作的最新证据,重点关注跨临床任务评估人工智能的有效性;成功协作的技术、人类和组织决定因素;以及问责协作的伦理、安全和治理要求。
关键发现
该综述共纳入了2015年1月1日至2025年10月27日发表的140项实证研究,这些研究是从17,463条记录中筛选出来的。总体而言,这些研究表明人机协作在医疗健康领域有多项益处;然而,作者指出,这些益处在不同环境中的可比性较差。
该分析聚焦于三个主要领域,揭示了这种协作的有效性取决于具体任务,信任、工作流程整合和培训是成功协作的主要决定因素。值得注意的是,分析凸显了治理对人工监督的期望与这些研究评估之间的持续差距。
关于跨临床任务评估人工智能的有效性,分析显示存在明显的任务依赖性:人机协作的有效性因任务环境而异,这凸显了强调不同结果衡量标准的必要性。分析还表明,有效性通常使用短期任务级指标而非患者或系统结果进行评估。
关于成功协作的技术、人类和组织决定因素,分析揭示了协作与多项益处相关,包括性能提升、工作速度加快和接受度提高,这取决于系统的流程契合度和任务分配。
当人工智能用于特定、界定明确的任务(如优先处理病例、突出显示区域或起草文本)且临床医生保留最终决策责任时,观察到最清晰、最一致的益处。
在诊断解释方面获得了最大且最标准化的人机协作证据,而在筛查和优先处理任务、治疗决策以及行政或文档任务方面则获得了较小且更为异质的证据。
大多数分析诊断解释的研究报告了实施人机协作系统的好处。分析其他临床任务领域的研究也经常报告更多积极而非中性或负面的发现。
在伦理、安全和治理要求方面,分析确定问责制和患者安全是最常讨论的问题。然而,这些问题很少在主要评估中考虑,突显了政策对人工监督的期望与研究实际测试之间的差距。
意义
该综述突显了人机协作作为在医疗健康领域安全有效地实施基于人工智能系统的重要模式日益突出的地位。然而,尽管发展迅速,证据基础在任务类型、研究设计和协作概念化方面仍然不一致。
鉴于综述发现,作者建议协作有效性的评估应更具任务和情境针对性。有效性不应被视为跨越临床和行政任务的单一结构。未来研究应使用不仅反映准确性和效率,还展示工作流程影响、认知负担以及患者和系统结果的结果衡量标准来评估人机协作。
包括信任校准、界面设计、工作流程整合和培训在内的若干人类和组织因素可能推动人机协作的成功。允许临床医生在将人工智能应用于特定、界定明确的任务时保留最终责任的系统最有可能从协作中受益。
作者还指出,问责制和患者安全必须被视为未来研究的核心伦理衡量标准。除非得到透明度、可争议性、可追溯性以及对人工智能如何在实践中影响决策的明确组织治理的支持,否则仅靠人工监督是不够的。
作为一项范围综述,作者没有进行正式的偏倚风险或发表偏倚评估,这限制了研究结果的确定性和可比性,并且没有提供临床有效性的汇总估计。作者还指出,该综述仅限于英文研究,没有包括专门的灰色文献搜索,并专注于受控诊断解释研究,这可能过度代表了积极发现。
总体而言,这些发现为医疗健康领域人机协作的更具任务针对性、纵向和治理意识的评估奠定了基础。
引用:Strong J, Rogers H, Sun E, et al. 2026. Human-AI Collaboration in Healthcare: A Scoping Review. npj Digital Medicine. Article in press.
【全文结束】

