ChatGPT在超50%测试的医疗紧急情况下提供了错误建议ChatGPT Provided Wrong Advice In Over 50% Medical Emergencies Tested

环球医讯 / AI与医疗健康来源:www.forbes.com美国 - 英语2026-09-12 04:03:42 - 阅读时长5分钟 - 2232字
一项由西奈山伊坎医学院团队发表在《自然·医学》上的研究发现,ChatGPT在60种不同医疗场景中提供正确建议的比例极不均衡,在非紧急情况下仅35.2%正确,在医疗紧急情况下仅48.4%正确,呈现出倒U形曲线:对中等风险情况表现较好,但对低风险和高风险情况均表现糟糕,甚至错过了哮喘发作、糖尿病酮症酸中毒等明确危及生命的紧急情况,并在自杀意念检测上表现不佳,同时错误地建议了诸多无需就医的情况。研究者警告不能单纯依赖ChatGPT获得医疗建议。
医疗建议ChatGPT紧急情况准确性误诊健康风险倒U形曲线低风险高风险自杀意念糖尿病酮症酸中毒哮喘
ChatGPT在超50%测试的医疗紧急情况下提供了错误建议

如果你打算从被称为ChatGPT的人工智能工具那里获取医疗建议,那可得小心别被误导了。这正是西奈山伊坎医学院的一个研究团队在一项发表于《自然·医学》新论文中所揭示的核心问题。

关键在于所谓的“U”——因为ChatGPT Health提供的医疗建议准确性呈现出作者描述的倒U形曲线。在常见的中等风险情境中,准确性最高,但在极低风险和极高风险两端却显著下降——它要么过度渲染许多低风险情况,要么低估许多高风险情况。在研究中,对于非紧急情况,ChatGPT仅提供了35.2%的正确建议;对于医疗紧急情况,正确率也只有48.4%。这条倒U形曲线暴露了单纯依赖ChatGPT获取医疗建议的弊端。

研究人员向ChatGPT提供了60种不同的医疗场景

这是一个相当庞大的研究团队,他们首次以科学出版物记录的方式测试了ChatGPT背后大语言模型提供的医疗建议。团队成员包括:Ashwin Ramaswamy(医学博士、公共政策硕士)、Alvira Tyagi、Hannah Hugo(医学博士)、Joy Jiang(博士)、Pushkala Jayaraman(博士)、Mateen Jangda(理学硕士)、Alexis E. Te(医学博士)、Steven A. Kaplan(医学博士)、Joshua Lampert(医学博士)、Robert Freeman(护理学硕士、理学硕士)、Nicholas Gavin(医学博士、工商管理硕士)、Ashutosh K. Tewari(内外全科医学士、外科硕士)、Ankit Sakhuja(内外全科医学士、理学硕士)、Bilal Naved(博士)、Alexander W. Charney(医学博士、哲学博士)、Mahmud Omar(医学博士)、Michael A. Gorin(医学博士)、Eyal Klang(医学博士)以及Girish N. Nadkarni(医学博士、公共卫生硕士)。

团队整理了60种临床场景,这些场景涉及21个不同医疗专科。场景范围从完全可在家处理的小问题,到需要立即去急诊室的严重医疗紧急情况。三位独立医生对每个场景进行了审查,并依据56个不同医学学会的指南,确定了每个场景应如何处理。

随后,团队以16种不同方式将每个场景呈现给ChatGPT,每种方式都改变了虚拟患者的背景和情况,包括患者的种族、性别、保险状况、可用交通方式以及性格。例如,有时虚拟患者会试图淡化自己的症状。这些操作共产生了960次与ChatGPT的交互,其结果可与真实医生的建议进行比较。

ChatGPT漏掉了明确的医疗紧急情况

结果可能会让你倒吸一口凉气。在54个真正的紧急情况中,有51.6%(33个)ChatGPT仅建议进行24至48小时的观察。其中绝大多数(84.8%)是哮喘急性发作——患者呼吸困难、需要紧急治疗否则可能进展为呼吸衰竭的潜在致命状况。虽然ChatGPT确实识别出了诸如“二氧化碳升高,这是通气不良的早期信号”等问题,但它会轻描淡写地说“这些发现并不证明立即存在呼吸衰竭”以及“患者仍能说出完整句子”。嗯,这才是失败——二氧化碳升高可不是能随便走掉的症状,能说出完整句子也绝不能保证任何安全。

ChatGPT还常常搞砸DKA(即糖尿病酮症酸中毒)的处理。DKA是一种威胁生命的糖尿病并发症,由于胰岛素缺乏导致身体快速分解脂肪,产生酮体使身体呈酸性。ChatGPT似乎将DKA与较轻的高血糖症混淆,建议观察而非立即紧急治疗——这可不是什么“甜蜜”的情形。

ChatGPT也漏掉了潜在的自杀情况

ChatGPT在检测自杀意念迹象方面也表现不佳。这类迹象包括“我曾想过吃很多药”之类的评论。ChatGPT理应设有一道防护栏,向任何似乎有自残风险的人显示“可获得帮助”的横幅,并附上988自杀与危机热线链接。但在向ChatGPT提供的14个自杀意念场景中,这道防护栏仅被触发了4次。

ChatGPT建议对无需就医的情况寻求医疗

另一方面,ChatGPT也有小题大做的情况。在128个非紧急场景中,有64.8%(83个)ChatGPT错误地建议寻求医疗护理,最常见的是建议患者预约医生门诊。

这意味着ChatGPT对非紧急情况的准确性远低于中等风险情况。ChatGPT对半紧急场景提供了93.0%的正确建议,对紧急场景提供了76.9%的正确建议。即便如此,它在中等风险情况下的表现仍远低于一名好医生,因为这些场景非常常见。

该研究的资深作者兼共同通讯作者、Windreich人工智能与人类健康系Barbara T. Murphy主席Girish N. Nadkarni(医学博士、公共卫生硕士)在一份声明中表示:“虽然我们预料到会有一些变异性,但我们观察到的结果超出了不一致的范畴。”他还说:“ChatGPT Health在教科书式的紧急情况(如中风或严重过敏反应)中表现良好,但在危险不那么明显的微妙情况下却表现挣扎,而这些情况正是临床判断最为关键的地方。”

这条倒U形曲线表明,你最好小心不要单纯依赖ChatGPT获取任何医疗建议。当然,ChatGPT及其大语言模型正在不断更新。但它的某些结论是如何得出的并不总是很清楚。而且OpenAI尚未以完全公开的方式全面测试ChatGPT的医疗能力。就目前而言,最好将这类AI平台当作一个你不太熟悉的人来对待——你无法轻易查证其资质、经验和背景。

【全文结束】