医疗系统正在采用人工智能工具,帮助临床医生简化病历记录和护理计划的创建,每天为他们节省宝贵的时间。
但如果AI提供错误的事实,会对患者安全产生什么影响呢?
即使是ChatGPT和其他基于大型语言模型的生成式AI工具最普通的用户,也经历过错误——通常被称为"幻觉"。
当大型语言模型(LLM)找不到合适的答案而凭空捏造时,就会发生AI幻觉。本质上,当LLM不知道正确答案或无法找到适当信息时,它会编造回应,而不是承认不确定性。
这些编造的回应尤其成问题,因为它们通常非常令人信服。根据所问内容的不同,这些幻觉可能很难与事实信息区分开来。例如,如果LLM找不到特定病情或程序的正确医疗编码,它可能会编造一个数字。
核心问题是,LLM被设计用于预测下一个单词并提供回应,而不是在面对信息不足时承认这一点。这在技术力求提供帮助的驱动力与其在面对不确定性时生成听起来合理但不准确内容的倾向之间,造成了根本性的紧张关系。
为了进一步了解AI幻觉及其对医疗保健的潜在影响,我们最近采访了Medicomp Systems公司的首席医疗官杰伊·安德斯博士。该公司提供基于证据的临床AI系统,旨在使数据可用于互联护理和增强决策。他在产品开发中扮演关键角色,并作为与医疗社区的联络人。
问:AI生成幻觉的能力对希望使用AI的医疗临床和行政人员意味着什么?
答: 临床应用与行政应用的含义显著不同。在临床医学中,幻觉会造成严重问题,因为准确性不容妥协。我最近读到一项研究显示,AI摘要的正确率约为80%。这在大学里可能能得个B-等级,但在医疗领域,B-等级是不可接受的。没有人想要B-等级的医疗服务——他们想要A级护理。
让我从临床记录摘要中举一些具体例子,许多医疗IT公司正急于实施这一功能。当AI总结临床记录时,它可能犯两个关键错误。首先,它可能编造根本不存在的信息。其次,它可能错误归因疾病——将家庭成员的病情归到患者身上。例如,如果我说"我母亲有糖尿病",AI可能会记录成我有糖尿病。
AI在理解上下文方面也存在问题。如果我正在讨论体格检查,它可能会引入与体格检查无关的元素。它会忘记我们实际上在讨论什么。
对于行政任务,风险通常较低。如果AI在设备库存、药房供应或排班方面出错,虽然有问题,但这些错误不会直接伤害患者。当我们处理临床文档与操作物流时,风险本质上是不同的。
问:医疗AI中幻觉的潜在负面结果是什么?它们如何在流程和系统中传播?
答: 负面结果在多个层面上运作,并产生极难逆转的级联效应。当AI将错误的疾病、实验室结果或药物分配给患者的记录时,这些错误几乎不可能纠正,并可能产生灾难性的长期后果。
考虑这个场景。如果AI基于我母亲的病史错误地记录我患有白血病,我将如何获得人寿保险?雇主会愿意雇佣一个他们认为患有活动性白血病的人吗?这些错误会产生即时和长期影响,远远超出医疗环境。
传播问题尤其阴险。一旦错误信息进入医疗记录,它就会被复制并共享到多个系统和提供者。
即使我作为医生发现了错误并记录了更正,原始记录已经发送给众多其他医疗提供者,他们不会收到我的更正。这就像是危险的"传话游戏"——错误在医疗网络中传播,每次迭代都使追踪和纠正变得更加困难。
这创造了两种类型的传播:实际错误的传播和对系统信任的侵蚀。我见过AI生成的摘要甚至无法在单个文档中保持患者性别的连贯性——一会儿称某人为"他",一会儿称"她",一会儿又称"他"。
当律师在法律诉讼中遇到这种不一致时,他们会质疑一切:"如果它不能确定某人是男性还是女性,我们如何能相信任何信息?"
信任问题至关重要,因为一旦对AI生成内容的信心减弱,即使是准确的信息也可能被视为不可靠。
问:医院和医疗系统在使用AI工具时可以采取哪些行动来避免幻觉的负面后果?
答: 医疗组织需要战略性地实施AI,而不是像"向墙上扔泥巴"一样将技术应用于每个问题。关键是进行有针对性、有目的的部署,并加强人工监督。
首先,明确定义你试图用AI解决的问题。你是在处理临床诊断,还是在管理药房库存?在不了解技术能可靠做什么和不能做什么之前,不要直接跳入高风险临床应用。
我知道有一家供应商实施了一个AI脓毒症检测系统,其错误率高达50%。这家医院的CEO是我的朋友,他直接关闭了该系统,因为他们意识到他们甚至没有严重的脓毒症问题。
其次,仔细选择你的AI工具。不同的模型擅长不同的任务。GPT-4做得好的事情,Claude可能不行,反之亦然。用你自己的数据和患者群体验证技术。供应商应提供其系统的置信度水平,无论对你的特定用例,系统的准确率是90%、95%还是只有20%。
最重要的是,始终保持人工监督。AI应该增强人类流程,而不是取代它们。在实施或记录之前,始终让人工验证AI的输出。这适用于处理计费、编码或临床决策。当人工发现AI错误时,这种反馈可以帮助随时间改进系统。
当前环境感觉像混乱无序的边疆小镇。每个人都在没有适当验证或保障措施的情况下将AI用于一切。这种"为AI而AI"的心态是危险的。并非每个流程都需要人工智能。
如果一位患者带着低烧、喉咙痛和流鼻涕来到我的办公室,我不需要AI告诉我这可能是病毒性的。有些事情足够简单,添加AI复杂性只会增加成本和潜在错误。
问:医疗CIO、CAIO和其他IT领导者应该向在其工具中使用AI的供应商询问哪些问题,以了解他们如何防范幻觉?
答: IT领导者需要就验证和性能提出直接、具体的问题。从基础开始:您能为系统准确性提供什么置信度水平?您能演示您的AI如何使用与我们类似的真正医疗数据表现吗?不要接受模糊的承诺——要求提供性能指标的具体证据。
询问训练数据和验证过程。AI模型是如何训练的?使用什么类型的医疗信息?系统是否已针对您计划实施的临床场景进行了专门测试?不同的AI模型有不同优势,因此确保供应商的系统与您的预期用例一致。
询问人工监督机制。供应商建议如何将人工验证集成到他们的工作流程中?系统内置了哪些保障措施来标记潜在问题输出?供应商应该有关于保持人工监督的明确建议,而不是鼓励完全自动化。
请求有关错误检测和纠正过程的信息。当幻觉发生时——它们确实会发生——能多快识别和纠正?有哪些机制可以防止错误在系统间传播?供应商如何处理反馈以随时间改进他们的模型?
最后,警惕那些承诺看似太好的革命性能力的供应商。一些公司正在开发"替代医生"的聊天机器人或复杂的多LLM系统,声称能胜过临床医生。即使这些系统80%的时间是正确的,这也意味着它们有20%的时间是错误的。你愿意成为那20%中的一员吗?
目标不是完全避免AI。当适当使用时,该技术确实能带来真正的好处。但我们需要谨慎实施,采取适当的保障措施,并始终有人工监督。在医疗领域,风险太高,不能不采取最谨慎、经过验证的AI部署方法。
【全文结束】

