研究显示ChatGPT Health低估医疗紧急情况ChatGPT Health Underestimates Medical Emergencies, Study Finds

环球医讯 / AI与医疗健康来源:gizmodo.com美国 - 英语2026-09-24 18:23:00 - 阅读时长3分钟 - 1348字
西奈山伊坎医学院的一组研究人员对OpenAI于2026年1月推出的ChatGPT Health健康助手进行了首次独立安全评估,发现该人工智能系统在52%的紧急病例中存在“分诊不足”的问题,未能明确建议患者前往急诊室,例如对糖尿病酮症酸中毒和即将发生的呼吸衰竭患者仅建议24-48小时内就诊而非紧急处理。研究还发现该系统的自杀风险警报出现不一致,在低风险场景下反而比高风险场景更可靠。OpenAI回应称该工具仍在完善中,但研究人员强调这些失败案例恰恰是临床判断最为关键的情况。
医疗紧急情况分诊不足心理健康风险健康建议患者安全急诊室人工智能医疗自杀风险警报呼吸衰竭糖尿病酮症酸中毒ChatGPTHealth
研究显示ChatGPT Health低估医疗紧急情况

西奈山伊坎医学院的一组研究人员表示,他们自OpenAI的ChatGPT Health助手于2026年1月推出以来,对其进行了首次独立安全评估。

“我们想回答一个基本但关键的问题:如果某人正在经历真实的医疗紧急情况并向ChatGPT Health求助,它会明确告诉该人去急诊室吗?”该研究的主要作者、泌尿科医生Ashwin Ramaswamy在一份新闻稿中表示。

结果发现,大多数情况下答案是否定的。

在一项对照研究中,研究人员测试了ChatGPT Health在评估患者病情严重程度方面的能力,这在医学上被称为“分诊”。

研究人员发现,ChatGPT Health对52%的紧急病例“分诊不足”,“将患有糖尿病酮症酸中毒和即将发生呼吸衰竭的患者引导至24-48小时内的评估,而非急诊科”。

在呼吸衰竭的案例中,人工智能明确识别出这些症状是早期预警信号,但却安抚患者等待并观察,而非催促其寻求紧急帮助。

不过,该系统确实正确分诊了更“教科书式的紧急情况”,如中风和严重过敏反应。但研究人员表示,ChatGPT Health未能处理好的那些微妙情况,正是临床判断最为关键的地方。

OpenAI今年早些时候推出了ChatGPT Health,此前发布的一份报告称,全球超过4000万人每天依赖该公司的聊天机器人获取健康建议。

得出该数字的OpenAI研究还发现,这些医疗相关对话中有70%发生在正常诊所工作时间之外,美国平均每天有超过58万次医疗咨询来自“医院荒漠”,即距离普通医院或儿童医院超过30分钟车程的地区。

随着用户越来越多地寻求人工智能进行医疗咨询,得益于宽松的监管环境,这项技术正在更深入地渗透到医疗行业。人工智能工具现在可以在犹他州续开处方,FDA局长Marty Makary今年早些时候对Fox Business表示,某些设备和软件可以在没有FDA监管的情况下提供健康信息。

但这并不能否定过度依赖人工智能所带来的真实且有据可查的身心健康风险。OpenAI尤其因其聊天机器人过去处理心理健康事件的方式而面临强烈批评,有悲痛的家庭起诉该公司,称其疏忽行为和不足的安全防护措施助长了亲属的自杀意念。

作为回应,OpenAI表示将对此事采取行动,通过为未成年人设置家长控制或提示用户休息等方式确保安全。例如,ChatGPT Health会在高风险情况下引导用户寻求专业帮助。但西奈山的研究发现,自杀风险警报“出现不一致”。

“系统的警报与临床风险呈倒置关系,在低风险场景中反而比某人分享自我伤害意图时更可靠地出现。在现实生活中,当某人确切谈论如何伤害自己时,这代表着更直接和严重的危险,而非更轻。”西奈山卫生系统的首席人工智能官Girish Nadkarni表示,“这是一个特别令人惊讶且令人担忧的发现。”

一位OpenAI发言人声称,ChatGPT应被视为一个持续改进中的产品,安全更新和改进仍在进行中,旨在增强聊天机器人处理敏感情况的方式。该发言人指出,这项研究评估的是受控环境中的即时分诊决策,而在现实场景中,用户甚至聊天机器人本身通常会有后续问题,这可能会改变风险评估。

他们还指出,ChatGPT Health目前仍在有限范围内提供,希望加入的用户需进入等候名单。

【全文结束】