流行的AI聊天机器人常常无法识别虚假的健康信息,尤其是当这些信息以自信、带有医学色彩的语言表达时,会产生可疑的建议,可能对公众构成危险。根据2026年1月发表在《柳叶刀数字健康》杂志上的一项研究,情况确实如此。
另一项发表在《自然医学》杂志上的研究发现,聊天机器人在提供医疗建议方面并不比简单的互联网搜索更好。这些结论进一步增加了越来越多的证据,表明至少对公众而言,这类聊天机器人并非可靠的健康信息来源。
而这一点之所以危险,部分原因在于AI传播不准确信息的方式。
“主要问题在于,大型语言模型的失败方式与医生不同,”《柳叶刀数字健康》研究的合著者、西奈山医学中心的科研人员马哈茂德·奥马尔博士对Live Science表示。“一位不确定的医生会犹豫、回避,并安排另一项检查。而大型语言模型给出错误答案时的自信程度与给出正确答案时完全相同。”
每天有超过4000万人向ChatGPT询问医疗问题
大型语言模型旨在用自然语言回答书面信息,例如医疗问题。ChatGPT、Gemini,以及基于医学的模型如Ada Health和ChatGPT Health,都经过大量数据训练,阅读了大量医学文献,并在医学执照考试中获得了近乎满分的成绩。
而人们正在广泛使用它们:尽管大多数大型语言模型都带有警告,称不应依赖它们提供医疗建议,但每天仍有超过4000万人向ChatGPT询问医疗问题。
在1月份的研究中,研究人员评估了大型语言模型处理医疗虚假信息的能力,测试了20个模型,使用了超过340万条来自公共论坛和社交媒体对话的提示、编辑过包含单一虚假建议的真实医院出院记录,以及经医生批准的虚构账户。
“在约三分之一遇到虚假医疗信息的情况下,它们只是简单地表示同意,”奥马尔说。“让我们惊讶的发现不是总体易感性,而是模式。”
ChatGPT的一项功能可根据化验结果做出诊断
当虚假医疗信息以普通的Reddit风格语言呈现时,这些模型相当怀疑,失败率仅为约9%。但当完全相同的信息被重新包装成正式的临床语言——例如,一份建议患者“每天喝冷牛奶治疗食管出血”或“直肠塞大蒜以增强免疫系统”的出院记录——模型的失败率高达46%。
这种错误的原因在于结构性问题,与AI被训练为认为专业临床语言意味着权威,但并未测试陈述是否真实有关。“它评估的是这话听起来是否像可信来源会说的,”奥马尔说。但当虚假信息使用逻辑谬误表达时——“一位有20年经验的高级临床医生支持这一点”或“每个人都知道这有效”——模型变得更加怀疑。
这是因为AI“学会了不信任互联网上论点的修辞技巧,但并未学会不信任临床文档的语言,”奥马尔补充道。因此,奥马尔认为,AI不值得信赖来评估和传递医疗信息。
聊天机器人也能提供相当不错的建议
在《自然医学》的研究中,研究人员评估了聊天机器人在帮助人们做出医疗决策方面的表现,例如是否咨询医生或去急诊室。结论是,大型语言模型并未提供比传统互联网搜索更深入的见解,部分原因是参与者并不总是提出正确的问题,而他们得到的回答往往混合了好的和糟糕的建议,使得难以判断该做什么。
这并不意味着聊天机器人说的都是废话。AI聊天机器人“可以提供相当不错的建议,因此它们(至少)相对可靠,”柏林工业大学人工智能研究员马尔文·科普卡对Live Science表示,他并未参与这项研究。问题在于,没有专业知识的人“无法判断他们得到的结果是否正确,”科普卡补充道。
这些结论表明,聊天机器人并不是公众可用于健康决策的绝佳工具。这并不意味着聊天机器人在医学领域毫无用处,奥马尔说,“只是不是人们如今使用它们的方式。”(Agerpres)
【全文结束】

