研究人员发现败血症治疗AI模型存在缺陷Researchers find flaw in AI models for sepsis treatment

环球医讯 / AI与医疗健康来源:www.news-medical.net美国 - 英语2026-08-29 16:12:46 - 阅读时长6分钟 - 2546字
埃默里大学研究人员发现,许多使用强化学习方法指导败血症治疗的AI模型存在时间错位缺陷,这一问题导致AI有时会使用未来事件来预测过去,如果部署到临床环境可能导致近半数患者被推荐过度治疗或治疗不足;研究团队开发了简单解决方案,消除这一缺陷可使患者死亡率降低8-10%,该研究已在《npj数字医学》期刊发表,警示AI在医疗领域应用需谨慎推进,避免因数据预处理错误而影响临床决策准确性。
败血症治疗AI模型缺陷强化学习时间错位过度治疗治疗不足死亡率数据预处理索引
研究人员发现败血症治疗AI模型存在缺陷

人工智能已经在医疗保健领域提升积极成果,并有望带来更多突破。然而,埃默里大学计算机科学助理教授唐胜普(Shengpu Tang)警告称,人工智能工具的部署——尤其是在生死攸关的医疗环境中——应以深思熟虑和有节制的方式进行。

唐和他的同事们发现,许多使用被称为"强化学习"的人工智能方法作为败血症治疗理论指导的同行评审研究中存在一个缺陷。

他们的研究发现发表在《npj数字医学》期刊上。

通过模拟实验,他们展示了一种常用于败血症治疗相关数据预处理和索引的技术存在问题。这种有缺陷的技术导致轻微的时间错位,使人工智能代理偏离时间轴,有时会使用未来事件来预测过去。

研究人员警告称,如果模型的测试数据以同样的方式错位,这个问题就会被隐藏起来。

"这一缺陷被'膨胀'的性能指标所掩盖,这些指标在纸上看起来很好,但在实践中会失败。"

——埃默里大学计算机科学助理教授唐胜普

研究人员表明,如果这些有缺陷的败血症治疗系统被部署在医疗环境中,它们会在近一半的患者状态下推荐过度治疗或治疗不足。

"我们发现,过去十年中使用强化学习分析败血症治疗的绝大多数论文都犯了这个时间错位的错误——包括我们自己的工作,"现任论文的第一作者唐说。

唐和他的同事们开发了一个简单的变通方法来避免这一缺陷,这代表了医疗强化学习问题表述方式的根本转变。

他们基于真实临床数据的模拟实验表明,当不解决这一缺陷时,指导败血症治疗的强化学习算法既不会降低也不会提高患者的死亡率。

然而,消除时间偏移缺陷后,模拟结果显示患者死亡率下降了8-10%。

"我们希望这项工作能作为警钟和路线图,为临床床边构建更安全、更可靠的强化学习模型,"唐说。

论文的合著者包括伦敦帝国理工学院电气与电子工程助理教授Sonali Parbhoo;密歇根大学计算机科学与工程教授Jenna Wiens;以及在哥伦比亚大学担任博士后研究员期间撰写该论文的Jiayu Yao。

败血症的高代价

败血症是一种严重疾病,当感染在体内引发危及生命的连锁反应时发生。由于免疫系统受损,住院患者往往特别容易受到伤害。根据疾病控制与预防中心的数据,每三个在医院死亡的成年人中就有一人在住院期间患有败血症。

一些医疗系统已经使用人工智能工具来帮助监测患者发生败血症的风险。这些预测工具的算法通常使用称为"监督学习"的机器学习方法开发。在训练过程中,将大量关于是否发展为败血症患者的生命体征和其他统计数据输入模型。然后,人工智能模型可以在现实世界中部署,提醒医护人员注意风险升高的患者。

风险预测工具的有效性促使计算机科学家希望更进一步,利用人工智能帮助指导治疗方案。诊断后的快速治疗对于防止组织损伤、器官衰竭或死亡至关重要。

然而,与风险评估不同,预测治疗方案需要在动态环境中同步各种数据集——不同类型的治疗,如静脉输液、抗生素、降压药物和手术;治疗的剂量或强度;治疗的持续时间;患者治疗前后的生命体征;以及生存/死亡率。

不同的学习框架

强化学习需要处理这种动态环境,并在没有单一预定义"是"或"否"答案的情况下,做出随时间发生的决策序列。例如,强化学习用于训练人工智能算法在基于回合的游戏中竞争,如国际象棋:人工智能代理观察棋盘,选择一个动作或移动,然后竞争对手做出移动。棋盘的配置不断变化,这个过程在离散的轮次中不断重复。

近年来,强化学习算法已被应用于医疗保健中的一系列顺序决策任务。这些算法分析历史治疗序列,以识别与有利结果相关的模式。学习到的决策规则将这些模式映射到基于不断变化的患者状况推荐的治疗方法。在离散时间的每一步,代理观察患者的生理状态并选择治疗方法。然后情况演变为新的状态。

唐在2020年作为研究生时曾撰写一篇论文,使用强化学习研究败血症治疗的最佳实践。

完成那项工作后,唐开始怀疑在强化学习中经常使用的数据预处理方法在医疗环境中可能无法提供最准确的结果。他和他的同事们开始深入研究这个问题,并发现了这个缺陷。

惊人的洞察

与在定义明确的轨迹上工作的标准强化学习基准不同,医疗应用通常涉及跨时间的不规则采样事件。例如,电子健康记录的数据录入可能实时发生,也可能不实时发生。

用于强化学习的患者状态和采取的治疗行动数据通过将它们切片成相等时间长度的窗口,将它们索引为离散时间单位来进行预处理。然后将这些索引对齐以形成状态-动作对。

问题在于,人工智能代理将患者状态视为生命体征的摘要,这只能在时间窗口结束时计算。然而,行动需要在该窗口开始时确定。

"患者可能在时间窗口的中间服用了药片,"唐解释说,"或者可能在窗口早期就开始了输液,但人工智能代理假设这些治疗的决策是由患者状态的摘要引起的,而该摘要只能在时间窗口结束时确定。"

唐和他的同事们开始调查其他使用强化学习训练败血症治疗模型的论文,发现80%的论文使用了有缺陷的方法。

他们还确定了一个简单的修复方法:将行动索引向后移动一个时间步,就能实现正确的时间对齐。

传播信息

开发者似乎假设用于训练监督学习模型的数据管理技术也适用于强化学习模型。

"许多人从未停下来思考索引在不同情况下的工作方式,"唐说。"重要的是要仔细思考,而不是仅仅以'自动驾驶'方式工作,以避免在数据预处理和索引中犯错。"

作为一名致力于开发人工智能工具以有效支持医疗保健工作者决策过程的计算机科学家,唐主张在部署这些工具时要保持有节制的步伐。

"我是个老派的人,"他说。"我确实认为人工智能在某些情况下发展过快,需要更多的审查。"

虽然当前的论文专注于败血症治疗,但唐担心这种有缺陷的技术可能出现在一系列强化学习模型中。

"人们似乎一次又一次地犯同样的错误,"唐说。"我们希望将这个问题传达给更多的人工智能研究人员和开发者——包括那些专注于医疗保健和更广泛应用的人——以确保他们意识到这个问题。"

【全文结束】