会说话但不精通医学:聊天机器人在健康问题上的局限性„Gut im Reden“ – aber nicht in Medizin: Was Chatbots bei Gesundheitsfragen versagen lässt

环球医讯 / AI与医疗健康来源:www.soester-anzeiger.de德国 - 德语2026-08-19 04:55:24 - 阅读时长9分钟 - 4189字
最新研究表明,当前流行的聊天机器人在回答健康问题时准确率不足50%,且约五分之一的错误回答具有潜在危险性;尽管数百万人将AI工具作为健康咨询的第一站,但专家警告这些系统基于模式识别的工作方式无法替代医生的诊断能力,特别是在信息有限的情况下容易做出错误结论,消费者应将其视为医疗专业人员的补充而非替代。
健康聊天机器人AI健康咨询AI健康建议风险健康信息准确性健康AI局限性AI诊断错误医疗AI监管健康信息可信度
会说话但不精通医学:聊天机器人在健康问题上的局限性

数百万人向聊天机器人咨询健康问题。然而,新研究表明:人工智能犯错的频率超出预期——且后果可能很危险。

西卡森——当研究人员尼古拉斯·蒂勒(Nicholas Tiller)开始将健康问题输入聊天机器人进行测试时,他预料到会有一些不足之处——但没想到失误程度如此之大。五款人工智能产品、250个问题,总体正确率仅略高于50%。蒂勒评估认为,错误回答中每五分之一具有潜在危险性。"如果有人遵从这些建议,极有可能造成伤害,"他说,"这确实令人震惊。"

数百万美国人经常使用ChatGPT和Gemini等人工智能工具作为感冒、癌症等各种健康问题的首要咨询渠道。本月发布的两项研究暗示这可能不是个好主意——至少在没有高度怀疑态度的情况下。

研究表明人工智能在医学问题上存在明显弱点

蒂勒是Harbor-UCLA医学中心Lundquist生物医学创新研究所的研究助理,他的研究发表在《BMJ Open》上。Mass General Brigham的另一个团队采用了完全不同的方法;这项研究发表在《JAMA Network Open》上。

两项研究都设计为在真实条件下进行测试,人们既提出开放式问题,也提出更结构化的封闭式问题,后者要求简短、明确的回答——通常只有几个词——或只需回答是或否。蒂勒的研究集中于常被错误信息扭曲的主题,提出的问题如:5G会导致癌症吗?出于健康益处,我应该喝多少生牛奶?

诊断过程复杂——这正是许多模型失败之处

在《JAMA Network Open》发表的这项工作中,测试人员向21个模型模拟了29个基于Merck手册专业版的实际医疗情况——这是一本广泛使用的医学参考书——就像向医学生或住院医师提问一样。例如,告诉聊天机器人有一位30岁患者有腹痛,询问该怎么办。这些人工智能系统——包括ChatGPT、Gemini、Claude、DeepSeek和Grok的各种版本——倾向于过早下结论,在80%的情况下给出错误答案。

这项研究与最近一项测试虚假信息如何渗入人工智能系统的实验结果一致。2024年,一个研究团队编造了一种疾病——"bixonimania"——并在互联网上散播完全虚构的研究,声称这是一种由过多屏幕时间导致眼睛发红、刺激的紊乱。研究人员甚至没有特别努力掩盖这是骗局。

人工智能给出自信且令人满意的答案——即使答案是错误的

蒂勒表示,BMJ Open小组使用了对抗性框架来"给人工智能模型施加压力"。2025年2月,他们测试了ChatGPT、Gemini、Meta AI、DeepSeek和Grok的版本。研究人员提出了10个关于五个热门话题的开放式和封闭式问题:癌症、疫苗、干细胞、营养和运动表现。

他们根据准确性和完整性评估答案,并将其分为三类:无问题、有些问题或高度有问题。人工智能在封闭式问题上表现优于开放式问题,但五款聊天机器人的答案质量相似。

一个对蒂勒来说的大问题是模型回答问题时表现出的自信程度。在250个问题中,只有两次人工智能——Meta AI——拒绝回答。一个问题涉及最佳用于增肌的合成代谢类固醇;回答是人工智能无法提供有关非法使用物质的信息。另一个问题涉及化疗的替代疗法,此时人工智能建议咨询医疗专业人员。

人工智能"极其罕见"承认自己不知道

蒂勒表示,这两种回答都是合理且负责任的。然而,人工智能承认不知道某事、没有足够信息回答问题或质疑问题的情况"极其罕见"。

人工智能遇到困难的另一个领域是细微差别。例如在新冠和疫苗问题上,蒂勒表示Grok包含他称为"虚假平衡元素"的内容,造成存在争议的印象,而科学共识是疫苗可以预防严重疾病、住院和死亡。

"当人们读到听起来权威的回答时,这给了它错误的可信度,"蒂勒说。他补充说,这些人工智能聊天机器人大多不会根据信息来源的可靠性来权衡信息或验证其有效性。去年10月发表在《自然》旗下《npj Digital Medicine》上的一项早期研究表明,一个弱点可能在于人工智能聊天机器人被设计得过度乐于助人和附和。这诱使它们不去质疑不合逻辑的医疗请求。

"结果显示初始同意意愿很高(所有模型高达100%),其中乐于助人优先于逻辑一致性,"作者写道。

企业做出回应——但专家要求明确指导原则

企业已经在改进其人工智能系统处理健康问题的方式。Meta在4月8日宣布已发布其人工智能的更新版本,特别关注健康领域,并表示"已与1000多名医生合作,收集培训数据,以提供更准确和全面的回答"。OpenAI则与250多名不同专业的执业医生合作,以改进其最新模型的回答——包括更好地识别不确定性并更频繁地提出澄清问题。

尽管如此,Mount Sinai Health首席人工智能官、Mount Sinai医学院Icahn医学院人工智能与人类健康系主任吉里什·纳德卡尼(Girish Nadkarni)认为,需要第三方独立测试和指导方针,以及更广泛的公开辩论,讨论这种监督是否应以食品和药物管理局或联邦贸易委员会等机构的正式监管形式进行,或者是否可以创建一个行业组织进行测试并授予质量认证。

"必须有一些指导原则,"纳德卡尼说。与此同时,蒂勒和萨奇建议消费者将人工智能视为医疗专业人员的补充,而非替代。"聊天机器人并非为健康而设计,"蒂勒说,"它们只为一件事而设计:模仿对话中的语言流畅度。它们只是善于交谈,就像你去车行买车时遇到的销售人员。"

华盛顿邮报免费阅读四周

您的《华盛顿邮报》品质通行证:获取独家调查和200多篇文章,免费阅读四周。

这些测试使用了通用人工智能工具。自那以后,多家公司一直在努力改进其健康功能或将专业人工智能应用程序推向市场。许多被评估的模型自研究期间以来已更新,这可能会提高其性能。

四分之一的人使用聊天机器人获取健康信息,较年轻的人在之前的30天内更有可能使用人工智能获取与健康相关的信息或建议。这是本月发布的West Health-Gallup Center on Healthcare in America第三项调查的结果,该调查对约5600名成年人进行了全国代表性抽样。其中相当一部分人——14%或约1400万人——报告说,由于从人工智能获取信息或建议而没有去看医生,尽管他们本来会去。

"显然,人们在医疗保健中依赖未经验证的聊天机器人是极其令人担忧的,"West Health Policy Center总裁蒂姆·拉什(Tim Lash)说,该非营利、无党派组织专注于老龄化和医疗保健可负担性。同时,他在数据中也看到了希望的迹象。从信任角度看,受访者分为三组:三分之一使用人工智能并信任它,三分之一使用它但不信任它,其余人则不确定。

"这向您表明,人们对信息质量的护栏和保护存在合理的担忧,"拉什说。当今流行的许多聊天机器人基于大型语言模型(LLMs),这些模型通过大量文本训练以理解语言。它们的原始目的是产生类似人类的语言。这些模型可以参考哈佛医学院或克利夫兰诊所等建立良好的医学来源,但也包括社交媒体和问答论坛。

然而,医生的任务几个世纪以来基本保持不变:治疗和照顾病人。一个核心挑战是确定患者确切患有什么疾病——在医学中称为鉴别诊断。这是一个收集症状、权衡测试结果并根据科学文献将范围缩小到最可能原因的过程——带有人类直觉的成分。将人工智能聊天机器人定向到医生掌握的复杂推理是一项挑战。

在2025年1月至12月进行的《JAMA Network Open》研究中,研究人员提出了29个案例,基于Merck手册专业版中的案例——这是一个广泛使用的医学参考书——就像向医学生或住院医师提出的那样。例如,告诉聊天机器人有一位30岁患者有腹痛,并询问该怎么做。人工智能系统——包括ChatGPT、Gemini、Claude、DeepSeek和Grok的各种版本——倾向于过早下结论,在80%的情况下给出错误答案。

"当被要求从不确定、有限的数据中得出结论时,它们表现不佳,"Mass General Brigham的MESH孵化器执行主任、该研究的合著者之一Marc Succi说。在患者案例调查的后期阶段,当有更完整的信息时,这些模型却表现出色。背后是ChatGPT的OpenAI和Google(Gemini)拒绝置评。DeepSeek和xAI(Grok)没有回应置评请求。(《华盛顿邮报》与OpenAI有内容合作伙伴关系。)

开发Claude的Anthropic表示,当人们提出医学问题时,该系统经过训练以承认其作为人工智能的局限性。"我们的使用政策很明确:医学诊断和患者护理被视为高风险应用,需要由合格的专业人员审查所有人工智能支持的内容或决定,"一位发言人说。

Mount Sinai Health首席人工智能官、Mount Sinai医学院Icahn医学院人工智能与人类健康系主任吉里什·纳德卡尼(Girish Nadkarni)表示,这种差异揭示了当前聊天机器人一代的一个核心弱点:它们主要通过模式识别工作——当信息稀缺时,这种方法就会失败。

"人类拥有一般智力。我们通过推理理解情况,"没有参与这些新研究的Nadkarni说。"人工智能聊天机器人用它们拥有的数据进行插值,而不是用它们没有的数据进行外推。"研究人员在结论中总结了这个问题:"临床医生保持不确定性并迭代完善鉴别诊断,而LLMs则过早地收敛到单一答案。"

作者简介

Ariana Eunjung Cha是国家记者。此前,她曾是《邮报》驻上海和旧金山的分社社长,以及巴格达的通讯员。

这篇文章最早于2026年4月23日以英文在"Washingtonpost.com"上发表——作为合作的一部分,现在以翻译形式提供给IP PEN.MEDIA门户网站的读者。

【全文结束】