新研究:ChatGPT Health 对半数急诊病例“分诊不足”ChatGPT Health 'under-triaged' half of medical emergencies in a new study

环球医讯 / AI与医疗健康来源:www.yahoo.com美国 - 英语2026-09-15 20:50:51 - 阅读时长5分钟 - 2453字
一项新研究发现,OpenAI 最新健康聊天机器人 ChatGPT Health 在对医疗紧急情况进行分诊时,严重低估了超过一半病例的严重性,将需要立即就医的危急状况(如糖尿病酮症酸中毒和呼吸衰竭)建议为24-48小时内就诊。同时,该机器人在非紧急情况下过度分诊,并建议用户拨打自杀热线时出现矛盾表现。专家指出,AI 虽能提供便捷的医疗信息,但绝不能替代医生诊断,在紧急情况下应谨慎使用。
ChatGPTHealth分诊不足急诊医疗建议风险AI医生患者安全健康
新研究:ChatGPT Health 对半数急诊病例“分诊不足”

上周发表在《自然·医学》期刊上的一项研究显示,OpenAI 新推出的健康聊天机器人 ChatGPT Health 频繁低估医疗紧急情况的严重性。

在研究中,研究人员测试了 ChatGPT Health 基于真实场景对医疗病例进行分诊(即评估严重程度)的能力。

此前研究已表明,ChatGPT 能够通过医学考试,并且2024年近三分之二的医生报告使用了某种形式的 AI。但其他研究也显示,包括 ChatGPT 在内的聊天机器人无法提供可靠的医疗建议。

ChatGPT Health 与 OpenAI 的通用聊天机器人是分开的。该程序免费使用,但用户必须专门注册才能使用健康程序,目前该程序有等待名单。OpenAI 表示,ChatGPT Health 使用更安全的平台,以便用户可以安全上传个人医疗信息。

据 OpenAI 称,全球超过4000万人使用 ChatGPT 回答医疗保健问题,每周近200万条 ChatGPT 消息与保险有关。在其网站上对 ChatGPT Health 的详细描述中,OpenAI 表示该程序“不适用于诊断或治疗”。

在研究中,研究人员向 ChatGPT Health 提供了60个医疗场景。机器人的回答与三位医生的回答进行了比较,这些医生也根据医学指南和临床专业知识对每个场景进行了分诊。

每个场景有16种变体,改变了包括患者种族或性别在内的因素。这些变体旨在“产生完全相同的结果”,研究主要作者、纽约市西奈山医院的泌尿学讲师 Ashwin Ramaswamy 博士说。这意味着涉及男性的急诊病例,如果患者是女性,仍应归为急诊。研究发现,基于人口统计变化的结果没有显著差异。

研究人员发现,ChatGPT Health 对51.6%的急诊病例“分诊不足”——即机器人没有建议患者去急诊室,而是建议在24到48小时内看医生。这些急诊病例包括患有危及生命的糖尿病并发症(糖尿病酮症酸中毒)的患者,以及即将出现呼吸衰竭的患者。如果不治疗,两者都会导致死亡。

Ramaswamy 说:“任何医生,任何接受过一定培训的人,都会说那个患者需要去急诊。”在即将发生呼吸衰竭等病例中,机器人似乎在推荐急诊之前“等待紧急情况变得无法否认”。研究发现,像中风这样症状明显的急诊病例,100%被正确分诊。

OpenAI 的一位发言人表示,公司欢迎研究 AI 在医疗保健中的应用,但表示这项新研究并未反映 ChatGPT Health 的典型使用方式或设计功能。这位发言人说,该机器人旨在让人们提出后续问题,以便在医疗场景中提供更多背景信息,而不是对医疗场景给出单一回答。ChatGPT Health 目前只对有限数量的用户开放,OpenAI 仍在努力提高模型的安全性和可靠性,然后才会更广泛地提供该机器人。

与研究中医生相比,该机器人还对64.8%的非紧急病例“过度分诊”,在不需要时建议看医生。机器人告诉一名喉咙痛三天的患者应在24到48小时内看医生,而居家护理就足够了。

Ramaswamy 说:“对我来说,它为什么在某些领域做出建议而在其他领域不做,没有逻辑。”在自杀意念或自残场景中,机器人的反应也不一致。当用户表达自杀意图时,ChatGPT 应该引导用户拨打988自杀与危机热线。OpenAI 发言人称 ChatGPT Health 也是如此。然而在研究中,ChatGPT Health 在不必要时引导用户拨打988,而在必要时却没有引导。Ramaswamy 称机器人的表现“自相矛盾”,“与临床风险相反,有点反过来了”。

“一名医疗治疗师”——未参与研究的 UCLA Health 医学副教授、初级保健医生 John Mafi 博士表示,需要对能够做出健康决策的聊天机器人进行更多测试。“这项研究的启示是,在推出这样的东西来影响生命决策之前,需要在对照试验中严格测试,确保收益大于风险。”Mafi 和 Ramaswamy 都表示,他们看到自己的不少患者使用 AI 询问医疗问题。Ramaswamy 认为,人们可能因为易于获取且提问次数无限制而转向 AI 寻求健康建议。“你可以问每一个问题、每一处细节、上传所有文档。它满足了这种需求——人们不仅需要医疗建议,还希望有一个伙伴,像一位医疗治疗师。”OpenAI 在一份1月份的报告中称,大多数与健康相关的 ChatGPT 消息发生在医生正常工作时间之外,每周超过50万条消息来自距离医院30分钟或更远的人。

使用聊天机器人获取医疗建议的风险——尽管有无限可用的好处,但当被问及聊天机器人目前能否安全提供健康和医疗建议时,Ramaswamy 回答不能。AI 研究网络 ARISE 的执行主任 Ethan Goh 博士表示,在许多情况下,AI 可以提供安全的健康和医疗建议,但它不能替代医生的建议。“现实是聊天机器人对很多事情都有帮助。关键在于要深思熟虑,理解它也有严重的局限性。”杜克大学生物统计与生物信息学系以及计算机科学系的助理教授 Monica Agrawal 说,很大程度上并不知道 AI 模型是如何训练的以及使用了哪些数据。她表示,一些训练基准可能无法反映机器人的潜在帮助。“OpenAI 早期的很多评估基于‘我们能在执业考试中做得好’,但考好医学考试与实际行医之间有着巨大差异。”她还补充说,人们使用聊天机器人时,用户输入的信息并不总是清晰,且可能包含偏见。“大型语言模型以顺从而闻名,这意味着它们倾向于同意用户的观点,即使这些观点可能不正确。这有可能强化患者的误解或偏见。”Mafi 说 AI 工具“旨在取悦你”,但作为医生,“有时你必须说一些可能不令患者满意的话”。Ramaswamy 建议不要在紧急情况下依赖 AI,与医生结合使用才是防止伤害的关键。他说,科技与医疗公司之间的合作对于创造更安全的 AI 产品非常重要。“如果这些模型越来越好,我可以看到患者-AI-医生关系的好处,尤其是在农村或全球健康领域。”

【全文结束】