新研究表明ChatGPT可能错过你的严重医疗紧急情况ChatGPT could miss your serious medical emergency, new study suggests - AOL

环球医讯 / AI与医疗健康来源:www.aol.com美国 - 英语2026-09-15 23:27:36 - 阅读时长6分钟 - 2555字
一项新研究发现,ChatGPT Health在分诊严重医疗紧急情况时存在重大缺陷:它未能为超过一半的真正紧急情况推荐急诊,同时在约三分之二的轻微病例中过度建议就医。研究还发现该工具在自杀风险预警方面表现不一致,且易受家人意见影响而低估病情。专家强调AI不能替代医生判断,但可作为辅助工具。
ChatGPTHealth医疗紧急情况急诊自杀风险医疗建议临床判断安全评估低估紧急情况高估轻微病例健康决策
新研究表明ChatGPT可能错过你的严重医疗紧急情况

本文讨论自杀话题。如果你或你认识的人有自杀念头,请拨打自杀与危机生命热线988或1-800-273-TALK(8255)。

人工智能一直被吹捧为医疗领域的福音,但一项新研究揭示了它在提供医疗建议方面的潜在缺陷。

今年1月,OpenAI推出了ChatGPT Health,这是流行聊天机器人工具的医疗专用版本。该公司将该工具介绍为“一种专用体验,能够安全地将您的健康信息与ChatGPT的智能结合在一起,帮助您在应对健康问题时感到更知情、更有准备、更有信心。”

但西奈山伊坎医学院的研究人员发现,该工具未能为“相当数量”的严重医疗病例推荐急诊。

这项发表在2月23日《自然·医学》期刊上的研究旨在探讨ChatGPT Health——据报道每天约有4000万用户——在处理人们询问是否要寻求急诊的情况时的表现。

“目前,没有任何独立机构在这些产品面向公众之前对其进行评估,”主要作者、纽约市西奈山伊坎医学院泌尿外科讲师阿什温·拉马斯瓦米博士告诉福克斯新闻数字频道。“我们不会接受药物或医疗设备未经评估就上市,我们也不应该接受一个数千万人用来做健康决策的产品未经评估。”

研究团队创建了涵盖21个医学专科的60个临床场景,从轻微病症到真正的医疗紧急情况。三位独立医生根据56个医学会发布的临床实践指南,为每个病例分配了适当的紧急程度。研究人员与ChatGPT Health进行了960次交互,以观察该工具的反应,并考虑了性别、种族、就医障碍和“社会动态”等因素。

虽然“明确无误的紧急情况”——如中风或严重过敏——通常处理得很好,但研究人员发现该工具“低估”了许多紧急医疗问题。例如,在一个哮喘场景中,系统承认患者有呼吸衰竭的早期迹象,但依然建议等待而不是寻求急诊。

“ChatGPT Health在中度严重病例中表现良好,但在两端都失败了——而那些恰恰是最需要正确判断的病例,”拉马斯瓦米告诉福克斯新闻数字频道。“它低估了超过一半的真正紧急情况,又高估了约三分之二临床指南建议在家处理的轻微病例。”

这位医生指出,低估可能危及生命,而高估则可能压垮急诊科并延误真正需要救治的患者。

研究人员还发现了自杀风险预警的不一致性。在某些低风险场景中,它引导用户拨打988自杀与危机生命热线;而在其他场景中,即使患者讨论自杀意念,它也未能提供该建议。

“自杀防护栏的失败最令人担忧,”研究合著者、西奈山医疗系统首席人工智能官吉里什·N·纳德卡尼博士告诉福克斯新闻数字频道。ChatGPT Health的设计是在有人描述自残想法时显示危机干预横幅。纳德卡尼说:“我们测试了一位27岁的患者,他说一直在考虑吃很多药。当他单独描述症状时,横幅100%出现。然后我们添加了正常的化验结果——同一患者、同一句话、同一严重程度——横幅消失了。一个在一种情境下完美运行、在几乎相同的情境下完全失效的安全功能……是一个根本性的安全问题。”

研究人员还对社交影响方面感到惊讶。纳德卡尼说:“当场景中的家人说‘没什么大不了的’——这在现实生活中经常发生——系统将低估患者症状的可能性提高了近12倍。每个人都有配偶或父母说他们反应过度。人工智能不应该在潜在紧急情况下同意他们。”

福克斯新闻数字频道联系了ChatGPT的创建者OpenAI,请求置评。

福克斯新闻高级医学分析师马克·西格尔博士称这项新研究“很重要”。未参与该研究的西格尔告诉福克斯新闻数字频道:“它强调了一个原则:虽然大型语言模型可以对明确无误的紧急情况进行分诊,但在处理细微差别的情境时则困难得多。这就是医生和临床判断发挥作用的地方——了解患者病史的细微差别、他们如何报告症状以及他们对健康的态度。”西格尔说,ChatGPT和其他大型语言模型可以成为有用的工具,但“不应该被用来提供医疗指导”。“机器学习和对数据的持续输入可以提供帮助,但永远无法弥补根本问题——需要人类判断来决定某事是否真正紧急。”

德克萨斯州的急诊医生和人工智能专家哈维·卡斯特罗博士强调了这项研究的重要性,称其“正是我们需要的那种独立安全评估”。“创新进展迅速,监督也必须同样迅速,”未参与该研究的卡斯特罗告诉福克斯新闻数字频道。“在医疗领域,最危险的错误发生在极端情况——当某种情况看起来轻微但实际上灾难性时。这正是临床判断至关重要的地方,也是人工智能必须经受压力测试的地方。”

研究人员承认研究设计存在一些潜在局限性。拉马斯瓦米说:“我们使用了医生撰写的临床场景而非真实患者对话,并且在单一时间点进行了测试——这些系统会频繁更新,因此性能可能会变化。”此外,大多数被遗漏的紧急情况发生在危险取决于病情随时间变化的情境中。目前尚不清楚同样的问题是否会在急性医疗紧急情况下出现。由于系统必须选择一个固定的紧急程度类别,测试可能无法反映它在来回对话中可能给出的更细致建议。另外,该研究的规模不足以可靠地检测推荐建议因种族或性别而出现的微小差异。

“我们需要持续审计,而不是一次性研究,”卡斯特罗指出。“这些系统会频繁更新,因此评估必须持续进行。”

研究人员强调了针对严重问题寻求即时护理的重要性。拉马斯瓦米建议:“如果感觉有什么严重问题——胸痛、呼吸困难、严重过敏反应、自残念头——请去急诊科或拨打988。不要等人工智能告诉您没事了。”

研究人员表示,他们支持使用人工智能来改善医疗可及性,并且进行这项研究不是为了“拆台”。“这些工具在正确的事情上可以真正有用——理解您已经收到的诊断、查清您服用的药物及其副作用、或者获得在短暂就诊中未能充分解答的问题答案,”拉马斯瓦米说。“这与决定是否需要急诊是完全不同的用例。把它们当作医生的补充,而不是替代。”

卡斯特罗也同意AI健康工具的好处应与其风险相权衡。“AI健康工具可以增加可及性、减少不必要的就诊、并赋予患者信息。它们本质上并不危险,但还不能替代临床判断。”“这项研究并不意味着我们在医疗领域放弃AI,而是意味着我们让它成熟起来。独立测试和更强的防护栏将决定AI是成为安全网还是负担。”

原始文章出处:ChatGPT could miss your serious medical emergency, new study suggests

【全文结束】