研究揭示人工智能医疗分诊中的盲点Research Identifies Blind Spots in AI Medical Triage

环球医讯 / AI与医疗健康来源:www.digitalinformationworld.com美国 - 英语2026-09-24 16:58:04 - 阅读时长6分钟 - 2673字
一项独立评估发现,OpenAI开发的ChatGPT Health工具在分诊建议中存在严重盲点:对于超过一半的紧急病例未能正确引导用户前往急诊,且自杀危机预警功能出现风险倒挂——低风险场景触发警报,高风险场景却沉默。该研究由西奈山伊坎医学院团队开展,首次独立验证了这款面向公众的LLM健康工具的安全性,呼吁对消费者AI工具进行常态化独立评估。
人工智能医疗分诊ChatGPTHealth急诊护理就医紧迫性重症案例自杀危机大语言模型患者安全临床判断症状评估胸痛气短过敏反应精神状态改变988生命热线分诊不足
研究揭示人工智能医疗分诊中的盲点

首个独立评估ChatGPT Health的研究对消费者人工智能工具在紧急医疗决策中的安全性提出质疑。

根据西奈山伊坎医学院研究人员的报告,ChatGPT Health——一款广泛使用的、直接向公众提供健康指导(包括关于就医紧迫性的建议)的消费者人工智能工具——可能在相当数量的重症案例中未能引导用户正确寻求急诊护理。

该研究于2026年2月23日在线发表于《自然·医学》杂志(快速通道),是自2026年1月该工具发布以来对其基于大语言模型的首个独立安全评估。研究还发现了该工具在自杀危机应对方面的严重担忧。

哈佛医学院生物医学信息学系主任Isaac S. Kohane(医学博士、哲学博士)未参与该研究,他表示:“大语言模型已成为患者获取医疗建议的第一站——但在2026年,它们在临床极端情况下的安全性最差,而正是这些情况需要靠判断力来区分漏诊的急诊和不必要的警报。当数百万人使用人工智能系统来决定是否需要急诊护理时,风险极高。独立评估应成为常规,而非可选。”

发布数周内,ChatGPT Health的开发商OpenAI报告称,每天约有4000万人使用该工具获取健康信息和指导,包括是否寻求紧急或急诊护理的建议。然而,调查人员表示,当时几乎没有独立证据证明其建议的安全性或可靠性。

“这一空白促使我们开展研究,”主要作者、西奈山伊坎医学院泌尿外科讲师Ashwin Ramaswamy(医学博士)说,“我们想回答一个基本但关键的问题:如果有人正在经历真正的医疗急症并向ChatGPT Health求助,它会清楚地告诉患者去急诊室吗?”

关于自杀风险警报,ChatGPT Health被设计为在高风险情况下引导用户拨打988自杀与危机生命热线。然而,调查人员发现这些警报的出现并不一致,有时会在低风险场景下触发,而令人担忧的是,当用户描述具体的自残计划时却未显示。

资深且共同通讯作者、西奈山伊坎医学院Barbara T. Murphy人工智能与人类健康系主任、Hasso Plattner数字健康研究所所长、Irene and Dr. Arthur M. Fishberg医学教授、西奈山健康系统首席人工智能官Girish N. Nadkarni(医学博士、公共卫生硕士)说:“这是一个特别令人惊讶且令人担忧的发现。虽然我们预期会出现一些变异性,但我们观察到的情况已超出不一致性。系统警报相对于临床风险出现了倒挂:在低风险场景下触发更可靠,而在有人分享他们打算如何伤害自己时却失效。在现实中,当某人确切说出他们如何自残时,那意味着更直接、更严重的危险,而不是更少。”

作为评估的一部分,研究团队创建了60个结构化的临床场景,涵盖21个医学专科。病例范围从适合家庭护理的轻微症状到真正的医疗急症。三名独立医生根据来自56个医学学会的指南确定了每种情况的正确紧迫程度。

每个场景在16种不同的背景条件下进行了测试,包括种族、性别、社会动态(如某人淡化症状)以及护理障碍(如缺乏保险或交通)。团队总共与ChatGPT Health进行了960次交互,并将其建议与医生共识进行了比较。

在测试由医生制定的60个真实患者场景时,研究人员发现,虽然该工具通常能正确处理明确的急症,但它在超过半数医生判定需要急诊护理的案例中出现了分诊不足。

调查人员还对系统在急诊医疗案例中的失败方式感到震惊。该工具经常在其解释中显示出识别出了危险发现,但仍然安抚患者。

Ramaswamy博士说:“ChatGPT Health在处理教科书式的急症(如中风或严重过敏反应)时表现良好,但在危险并非立即明显的更细微情况下则表现挣扎,而这些正是临床判断最重要的案例。例如,在一个哮喘场景中,系统在其解释中识别出了呼吸衰竭的早期警告信号,但仍建议等待而非寻求急诊治疗。”

研究作者建议,对于恶化或令人担忧的症状(包括胸痛、气短、严重过敏反应或精神状态改变),人们应直接寻求医疗护理,而非仅依赖聊天机器人的指导。在涉及自残想法的情况下,个人应联系988自杀与危机生命热线或前往急诊科。

不过,研究人员强调,这些发现并不意味着消费者应完全放弃人工智能健康工具。

研究的第二作者、西奈山伊坎医学院一年级医学生Alvira Tyagi说:“作为一名在人工智能健康工具已被数百万人使用的时代接受培训的医学生,我认为这些技术是我们必须学会审慎整合到护理中的工具,而不是临床判断的替代品。这些系统变化很快,因此我们现在的培训部分必须考虑学习如何批判性地理解其输出、识别其不足之处,并以保护患者的方式使用它们。”

研究人员表示,该研究评估了系统在某一时间点的表现。由于人工智能模型频繁更新,性能可能随时间变化,这凸显了独立评估的必要性。

Tyagi女士说:“在实时演变的工具旁边开始医学培训,让我清楚地认识到今天的结果并非一成不变。这一现实要求我们进行持续审查,以确保技术的改进转化为更安全的护理。”

团队计划继续评估ChatGPT Health的更新版本以及其他面向消费者的人工智能工具,并将未来研究扩展到儿科护理、用药安全和非英语语言使用等领域。

论文标题为《ChatGPT健康在分诊推荐结构化测试中的表现》。

该研究的作者(按期刊列表)为:Ashwin Ramaswamy(医学博士、公共政策硕士)、Alvira Tyagi(文学士)、Hannah Hugo(医学博士)、Joy Jiang(哲学博士)、Pushkala Jayaraman(哲学博士)、Mateen Jangda(理学硕士)、Alexis E. Te(医学博士)、Steven A. Kaplan(医学博士)、Joshua Lampert(医学博士)、Robert Freeman(护理学硕士、理学硕士)、Nicholas Gavin(医学博士、工商管理硕士)、Ashutosh K. Tewari(内外全科医学学士、外科硕士)、Ankit Sakhuja(内外全科医学学士、理学硕士)、Bilal Naved(哲学博士)、Alexander W. Charney(医学博士、哲学博士)、Mahmud Omar(医学博士)、Michael A. Gorin(医学博士)、Eyal Klang(医学博士)、Girish N. Nadkarni(医学博士、公共卫生硕士)。

图片来源:Tim Witzdam / Unsplash

本文最初发表于MountSinai,经许可在此转载。

审核人:Ayaz Khan。

【全文结束】