我目前正在研究人工智能在医疗保健中的实施情况,希望从技术和临床两个角度了解主要障碍、机遇和实际考虑因素。
具体而言,我关注以下方面:
- 数据隐私与患者保密性
- 人工智能模型中的偏见与公平性
- 人工智能工具与现有医院工作流程的整合
- 医疗专业人员的信任与接受度
- 监管与伦理挑战
- 人工智能在改善患者结果方面的实际有效性
我非常感谢在此领域工作的研究人员和医疗专业人员提供见解、参考文献、案例研究或意见。
Victor Liberale 回答:
在我看来,医疗保健中的人工智能实施不应被理解为简单地在临床系统中引入新的技术层。它是一种对证据、责任、不确定性和临床判断如何组织的更深层次的重新配置。因此,真正的问题不是算法能否预测、分类或生成合理的建议,而是它能否负责任地融入护理的道德、制度和认知生态中。
当前AI-医疗保健讨论中的一个主要问题是过度关注性能指标。许多系统因其令人印象深刻的AUC、准确率分数或基准测试结果而被视为具有临床变革性。然而,医学不是排行榜。一个模型可能在回顾性验证中表现良好,但仍无法改善诊断、治疗选择、工作流程、安全性、公平性或患者结果。预测性能与临床实用性之间的差距仍然是医疗AI中一个尚未解决的核心问题。只有当系统改变决策、改变护理轨迹、减少伤害、改善获取、在不降低注意力的情况下节省时间,或揭示临床医生和医疗系统系统性忽视的内容时,临床价值才开始显现。
第二个挑战是泛化能力。医疗保健数据不是生物现实的中性表示;它们是由特定机构、编码实践、访问模式、设备、人群、语言和专业文化产生的。在一个医院训练的模型可能在另一个医院悄然退化。为某一人群训练的模型可能复制该人群的盲点。为成本、使用或历史决策训练的模型可能会学习医疗系统的不平等,而不是患者的需求。这就是为什么外部验证是必要的但不充分的。我们需要重复的本地验证、子组性能分析、校准评估、对数据集偏移的监控以及部署后的模型更新明确计划。
第三个挑战是工作流程。人工智能系统经常失败不是因为它们在数学上薄弱,而是因为它们在临床上无家可归。它们在错误的时间、错误的界面、错误的解释级别出现,或者没有明确的操作路径。一个好的AI系统不应仅仅"给出答案";它应适合决策过程。它应知道何时保持沉默、何时提醒、何时支持、何时让步以及何时使不确定性可见。设计不良的AI可能会增加警报疲劳、文档负担和医疗法律模糊性。设计良好的AI应减少认知摩擦,而不是给已经疲惫的临床环境增加另一层数字噪音。
第四个问题是自动化偏见的风险。临床医生可能过度信任AI建议,因为它看起来客观、定量或技术先进。相反的问题也可能发生:临床医生可能因为不理解它、不信任它,或将其视为外部强加的监控而忽视有用的AI。因此,挑战不仅是"人类与机器",而是人-AI协作的质量。在临床决策中,AI不应取代判断;它应规范判断、扩展判断、挑战判断并使判断的假设更加明确。医生应保持负责,但不应被抛弃。算法应强大,但不应拥有主权。
公平性也必须被视为AI实施的主要终点,而不是装饰性的伦理附录。当AI识别被忽视的风险、改善专家获取或标准化高质量护理时,它可以减少差异。但当在有偏见的数据上训练、仅在资源丰富的环境中部署或未经子组分析评估时,它也可能放大结构性不公正。医疗保健中算法偏见的教训很明确:即使种族中立或阶级中立的模型,当它们的代理被社会污染时,也可能变得不公平。如果AI系统在改善平均性能的同时恶化了弱势群体的护理,那么它不应被视为临床上的成功。
对我来说,成功因素不如技术本身那么引人注目:具有临床意义的问题选择、多学科共同设计、前瞻性验证、与真实工作流程的整合、透明报告、适当任务的可解释性、部署后监控、偏见审计、治理、问责制和持续学习。医疗保健中的AI应被视为不太像成品,而更像是一个活生生的临床干预。像药物一样,它需要适应症、剂量、禁忌症、监控、不良事件检测和退出标准。像诊断测试一样,它需要校准、背景、先验概率和可解释性。像卫生政策一样,它需要公平性评估和机构责任。
最成功的实施将是那些从临床问题而不是技术机会开始的实施。我们应该问:目前哪些决策质量差、延迟、不平等、不安全或不必要地繁重?谁将对AI输出采取行动?如果模型出错会发生什么?谁负责?哪些患者群体可能受到伤害?部署后将监控什么?系统停止或更新的阈值是什么?没有这些问题,AI可能会成为技术精湛但缺乏临床智慧的另一个例子。
我的立场是,AI不会通过取代临床医生来拯救医疗保健,也不会仅凭自身就能使医学人性化。如果实施不当,它甚至可能加剧官僚医学。它真正的希望在于别处:使临床系统更具预见性、更具有反思性、更公平、更有能力从自身失败中学习。但这需要从以算法为中心的AI转向以护理为中心的AI。
我非常乐意与对此领域感兴趣的其他研究者合作,特别是在涉及临床决策支持、实施科学、患者安全、医学教育、睡眠医学、神经学、精神病学、卫生系统、数字健康治理以及AI向真实世界护理的伦理转化等项目中。
参考文献:
- Topol EJ. 高性能医学:人类与人工智能的融合. Nat Med. 2019;25:44–56.
- Yu KH, Beam AL, Kohane IS. 医疗保健中的人工智能. Nat Biomed Eng. 2018;2:719–731.
- Rajkomar A, Dean J, Kohane IS. 医学中的机器学习. N Engl J Med. 2019;380:1347–1358.
- Beam AL, Kohane IS. 医疗保健中的大数据和机器学习. JAMA. 2018;319:1317–1318.
- Kelly CJ, Karthikesalingam A, Suleyman M, Corrado G, King D. 为医疗保健提供临床影响的关键挑战. BMC Med. 2019;17:195.
- Wiens J, Saria S, Sendak M, et al. 负责任的医疗机器学习路线图. Nat Med. 2019;25:1337–1340.
- Ghassemi M, Naumann T, Schulam P, Beam AL, Chen IY, Ranganath R. 医疗保健数据的人工智能实用指南. Lancet Digit Health. 2019;1–e159.
- Ghassemi M, Naumann T, Schulam P, Beam AL, Chen IY, Ranganath R. 机器学习在医疗保健中的挑战与机遇综述. AMIA Jt Summits Transl Sci Proc. 2020;2020:191–200.
- Panch T, Mattie H, Celi LA. 医疗保健中人工智能的"不方便的真相". NPJ Digit Med. 2019;2:77.
- Sendak MP, D'Arcy J, Kashyap S, et al. 将机器学习产品转化为医疗保健交付的路径. EMJ Innov. 2020.
- Li RC, Asch SM, Shah NH. 开发医疗保健人工智能的交付科学. NPJ Digit Med. 2020;3:107.
- Feng J, Phillips RV, Malenica I, et al. 临床人工智能质量改进:迈向对医疗保健中AI算法的持续监控和更新. NPJ Digit Med. 2022;5:66.
- Nagendran M, Chen Y, Lovejoy CA, et al. 人工智能与临床医生:深度学习研究的设计、报告标准和声明的系统性综述. BMJ. 2020;368.
- Lam TYT, Cheung MFK, Munro YL, et al. 临床实践中的随机对照试验:人工智能的系统性综述. J Med Internet Res. 2022;24.
- Vasey B, Nagendran M, Campbell B, et al. 人工智能驱动的决策支持系统早期临床评估报告指南:DECIDE-AI. Nat Med. 2022;28:924–933.
- Liu X, Cruz Rivera S, Moher D, Calvert MJ, Denniston AK. 涉及人工智能的临床试验报告指南:CONSORT-AI扩展. Nat Med. 2020;26:1364–1374.
- Cruz Rivera S, Liu X, Chan AW, Denniston AK, Calvert MJ. 涉及人工智能的临床试验方案指南:SPIRIT-AI扩展. Nat Med. 2020;26:1351–1363.
- Collins GS, Dhiman P, Andaur Navarro CL, et al. TRIPOD+AI声明:使用回归或机器学习方法的临床预测模型报告的更新指南. BMJ. 2024;385.
- Chen IY, Pierson E, Rose S, Joshi S, Ferryman K, Ghassemi M. 医疗保健中的伦理机器学习. Annu Rev Biomed Data Sci. 2021;4:123–144.
- Obermeyer Z, Powers B, Vogeli C, Mullainathan S. 用于管理人群健康的算法中种族偏见的剖析. Science. 2019;366:447–453.
- Celi LA, Cellini J, Charpignon ML, et al. 加剧医疗保健差异的人工智能中的偏见来源. PLOS Digit Health. 2022;1.
- Goddard K, Roudsari A, Wyatt JC. 自动化偏见:频率、效应中介者和缓解者的系统性综述. J Am Med Inform Assoc. 2012;19:121–127.
- Khera R, Simon MA, Ross JS. 自动化偏见和辅助AI:AI驱动的临床决策支持造成伤害的风险. JAMA. 2023;330:2255–2257.
- Moor M, Banerjee O, Abad ZSH, et al. 通用医疗人工智能的基础模型. Nature. 2023;616:259–265.
- Singhal K, Azizi S, Tu T, et al. 大型语言模型编码临床知识. Nature. 2023;620:172–180.
【全文结束】

