新研究显示ChatGPT Health对半数医疗紧急情况“分诊不足”ChatGPT Health 'Under-Triaged' Half Of Medical Emergencies In A New Study

环球医讯 / AI与医疗健康来源:jrreport.wordandbrown.com美国 - 英文2026-09-15 22:44:26 - 阅读时长3分钟 - 1473字
一项发表在《自然医学》杂志上的新研究发现,OpenAI推出的健康聊天机器人ChatGPT Health在评估医疗紧急情况的严重程度时,经常低估其紧急程度,对超过一半的急诊病例建议了非紧急的处理方案,如预约24-48小时内的医生门诊,而非立即前往急诊室。研究还发现机器人在非紧急病例上过度分诊,并在自杀意念等场景中出现不一致的回应,引发了对其在医疗领域可靠性的担忧。
ChatGPTHealth医疗紧急情况分诊不足健康人工智能医疗建议糖尿病酮症酸中毒呼吸衰竭中风自杀意念
新研究显示ChatGPT Health对半数医疗紧急情况“分诊不足”

ChatGPT Health——OpenAI新推出的专注于健康的聊天机器人——根据上周发表在《自然医学》杂志上的一项研究,经常低估医疗紧急情况的严重程度。

在这项研究中,研究人员测试了ChatGPT Health基于真实场景对医疗案例进行分诊(即评估严重程度)的能力。

此前的研究表明,ChatGPT可以通过医学考试,并且近三分之二的医生报告称在2024年使用了某种形式的人工智能。但其他研究也显示,包括ChatGPT在内的聊天机器人并不能提供可靠的医疗建议。

ChatGPT Health与OpenAI的通用ChatGPT聊天机器人是分开的。该程序是免费的,但用户必须专门注册才能使用健康程序,目前该程序有等待列表。OpenAI表示,ChatGPT Health使用更安全的平台,用户可以安全地上传个人医疗信息。

据OpenAI称,全球超过4000万人使用ChatGPT回答医疗保健问题,每周近200万条ChatGPT消息涉及保险。在其网站上对ChatGPT Health的详细描述中,OpenAI表示它“不适用于诊断或治疗”。

在研究中,研究人员向ChatGPT Health输入了60个医疗场景。然后将聊天机器人的回应与三位医生的回应进行了比较,这三位医生也审查了这些场景,并根据医疗指南和临床专业知识对每个场景进行了分诊。

每个场景有16个变体,改变了包括患者种族或性别在内的因素。这些变体旨在“产生完全相同的结果”,主要研究作者、纽约市西奈山医院泌尿科讲师阿什温·拉马斯瓦米博士说。这意味着涉及男性的紧急病例如果患者是女性,仍应被归类为紧急情况。研究没有发现基于人口统计学变化的结果有显著差异。

研究人员发现,ChatGPT Health对51.6%的急诊病例“分诊不足”。也就是说,机器人没有建议患者去急诊室,而是建议在24到48小时内看医生。

这些紧急情况包括患有危及生命的糖尿病并发症——糖尿病酮症酸中毒的患者,以及出现呼吸衰竭的患者。如果不治疗,两者都会导致死亡。

拉马斯瓦米说:“任何医生,任何接受过任何程度培训的人都会说,那个患者需要去急诊科。”

他说,在即将发生呼吸衰竭等案例中,机器人似乎在“等待紧急情况变得不容忽视”后才建议去急诊室。

研究发现,像中风这样具有明确症状的紧急情况,被正确分诊的概率为100%。

OpenAI的一位发言人表示,公司欢迎对人工智能在医疗保健中应用的研究,但称这项新研究并未反映ChatGPT Health的典型使用方式或设计功能。发言人表示,该聊天机器人旨在让人们提出后续问题,以便在医疗情况下提供更多背景信息,而不是对医疗场景给出单一回应。

发言人表示,ChatGPT Health目前只对有限数量的用户开放,OpenAI仍在努力改进模型的安全性和可靠性,然后才会更广泛地提供该聊天机器人。

与研究中的人类医生相比,该聊天机器人还对64.8%的非紧急病例进行了“过度分诊”,在没有必要的情况下建议预约医生。机器人建议一位喉咙痛三天的患者在24到48小时内看医生,而居家护理就足够了。

拉马斯瓦米说:“对我来说,它为何在某些领域做出推荐而在其他领域不做出推荐,没有逻辑可言。”

在自杀意念或自残场景中,机器人的回应也不一致。

当用户表达自杀意图时,ChatGPT本应引导用户联系988(自杀与危机热线)。OpenAI发言人表示,ChatGPT Health的工作方式相同。然而,在这项研究中,ChatGPT Health却在不需要时引导用户联系988,而在必要时却没有引导。

【全文结束】