当玛吉·史密斯在2022年生病时,她寻求了一系列专家的帮助。
她因为顽固性咳嗽看了过敏症专科医生;因为咳嗽和呼吸困难看了三位肺病专家;因为严重胃酸反流看了耳鼻喉科医生;在锻炼时几乎晕倒后看了心脏病专家。她感觉到大多数医生都固守在自己的专业领域,无法拼凑出完整的谜团。
最终,70岁的史密斯(来自北卡罗来纳州斯瓦纳诺阿)转向了人工智能聊天机器人Claude。通过长时间的对话以及一个Facebook群组,她得出结论:自己患有长新冠,并且引发了自主神经功能紊乱——这是一种在病毒后综合征中常见的状况,身体难以调节脉搏、血压、消化和体温等功能。
现在,史密斯在就诊时会带着AI的建议,并且她选择医生时部分取决于他们是否愿意接受AI在她决策中的作用。她说,结合医生和Claude的建议,她的症状已经变得可控。
“医疗系统真的辜负了我,”她说,“依赖AI获取医疗建议是好事吗?我不这么认为。但这是目前可用的选项。”
越来越多的人开始向聊天机器人咨询健康建议:根据3月发布的一项民意调查,三分之一的成年人出于这个目的使用它们。
《纽约时报》的报道表明,一个值得注意的群体是患有复杂慢性病的女性,这些疾病往往难以被理解。患者可能需要数年时间才能获得诊断,更不用说缓解了。部分原因是症状涉及多个专科,但也因为这些疾病——如长新冠和自身免疫性疾病——对女性的影响不成比例,而医生更倾向于轻视或推迟处理女性的症状。
去年秋天,数百人回应了一项请求,讨论他们如何将AI用于健康。此后,《纽约时报》进行了数十次采访,探讨出现的模式。
本文采访的女性表示,她们知道聊天机器人经常提供错误信息,有些人也遇到过严重错误。大多数人表示,她们更愿意依赖医生,但感觉无法做到。
“使用聊天机器人获取医疗建议存在很多问题,”斯坦福大学以人为本人工智能研究所联合主任詹姆斯·兰迪说,“但我认为我们也必须承认,人们这样做是有原因的。”
旧模式,新技术
长期以来,患者一直通过论坛、社交媒体、谷歌和WebMD进行自我诊断。很容易找到被医生忽视、自行研究并最终证明正确的患者——也有追求未经批准的治疗方案并导致灾难性错误的患者。
因此,在某些方面,使用AI来弥补医疗保健的失败是一个旧故事的新版本,美国医学会首席执行官约翰·J·怀特博士说。但技术的本质使其既更强大也更危险。
聊天机器人经常邀请人们详细描述他们的病史,包括上传检查结果。它们可以给出看似个性化、全面且权威的回应,即使事实并非如此。
一些初创公司正在测试专门的AI产品来帮助诊断疾病。但通用聊天机器人“尚未经过彻底评估”用于个性化诊断,并且可能犯下重大错误,麻省总医院布列根数据科学与人工智能临床负责人丹妮尔·比特曼博士说。
AI模型可以从高质量和低质量的来源中提取信息,或者产生幻觉。除非用户提问,否则不一定能获得引用来源,而且需要科学素养才能判断这些来源是否可靠并支持聊天机器人的说法。
聊天机器人有时可以诊断出棘手的病例。例如爱达荷州的用户体验研究员帕蒂·科斯特洛。
十多年前,科斯特洛醒来时感觉不对劲。她会连续几天或几周出现恶心、腹泻、胃灼热和疲劳等症状,有间歇但无长期改善。她看了很多医生,做了各种检查,其中几项显示炎症迹象,但都没有给出诊断。发作越来越频繁。
“这正在毁掉我的生活,”去年她告诉ChatGPT,描述了自己的症状和整体健康状况,并提到了炎症。
在九个可能的诊断中,聊天机器人列出了肥大细胞活化综合征——肥大细胞(免疫系统的一部分)错误地认为体内有危险物质,导致没有明确诱因的过敏反应。科斯特洛说,她读到的关于这种疾病的所有信息似乎都与她的症状吻合。
她带着这个建议去看了过敏症专科医生,并得到了MCAS诊断。通过药物,她估计自己已经好转了大约80%。
科斯特洛并非唯一通过AI找到诊断的人,但她的经历并非普遍情况。
2月发表的一项研究发现,当没有医学背景的人被给予详细场景,并被告知使用聊天机器人来识别诊断并确定下一步行动时,他们正确回答的比例不到一半。
OpenAI(ChatGPT的制造商)的一位发言人引用了该公司健康团队负责人卡兰·辛格哈尔此前的一份声明。(《纽约时报》已起诉OpenAI,指控其侵犯版权;OpenAI否认了这些指控。)辛格哈尔表示,2月研究的设计与人们实际使用聊天机器人的方式不符。该公司还指出,其模型随着时间的推移变得更加先进,同时强调它们仍然“不能替代专业医疗建议”。
制造Claude的Anthropic公司没有回应置评请求。
科学素养与怀疑精神
也许并不令人意外的是,许多与《纽约时报》分享的成功案例来自具有医学专业知识的人。
31岁的卡罗琳·甘韦尔是丹佛的一位盆底物理治疗师。她接受过解剖学和生理学培训,并且经常治疗慢性疼痛患者。
她自己的疼痛始于十几岁。她感觉到脊柱、躯干和骨盆出现痉挛,就像“一切都向内扭曲”一样。她说,性行为时感觉像砂纸。
17岁时,她被诊断出焦虑症;大学时,被诊断出纤维肌痛;研究生时,被诊断出慢性疲劳综合征加上心身症状;然后又回到纤维肌痛。但她在患者身上见过纤维肌痛,认为这个诊断并不符合她的情况。
2025年10月,她用精确的医学术语向ChatGPT描述了症状,并要求列出10个可能的诊断。她的专业知识使她能够排除许多建议。在超过12,000字的对话中,她反驳了不合理的诊断,并探索了那些看似合理的诊断。
ChatGPT的建议之一是盆腔淤血综合征,一种血管疾病。甘韦尔接受了一项手术来确认诊断。她在一月份做了手术,现在症状完全消失。
“我一直很想给我的初级保健医生发一条信息,但还没有发,想告诉她:‘我早就告诉过你了,’她说,‘你本来打算让我在慢性疼痛中度过余生。’”
她承认,许多用户无法像她那样提示ChatGPT并评估其回答。她问道,有多少人会意识到其中几个建议毫无意义?——©2026纽约时报公司
本文最初发表于《纽约时报》。
【全文结束】

