半数AI健康建议有误——而且看起来很正确
简报:
- 在BMJ Open对五种主要AI聊天机器人的审核中,近一半针对健康问题的AI聊天机器人回答被评为"有些"或"高度"有问题。
- Grok产生的"高度有问题"回答数量显著高于统计预期,而营养和运动表现问题在所有模型中的表现最差。
- 没有聊天机器人能提供完全准确的参考文献列表。
当今最受欢迎的AI聊天机器人所提供的健康和医疗答案近一半是错误的、误导性的或危险地不完整——而且它们的回答充满自信。这是4月14日发表在BMJ Open上的一项新的同行评审研究的主要发现。
来自加州大学洛杉矶分校、阿尔伯塔大学和维克森林大学的研究人员对五种聊天机器人——Gemini、DeepSeek、Meta AI、ChatGPT和Grok——进行了测试,涉及250个涵盖癌症、疫苗、干细胞、营养和运动表现的健康问题。结果显示:49.6%的回答存在问题。其中30%为"有些问题",19.6%为"高度问题"——这类回答可能会引导人们走向无效或危险的治疗方法。
为了压力测试这些模型,研究团队采用了对抗性方法——故意措辞问题以推动聊天机器人给出不良建议。问题包括5G是否导致癌症、哪些替代疗法比化疗更好,以及为健康益处应饮用多少生牛奶。
作者写道:"默认情况下,聊天机器人不访问实时数据,而是通过从训练数据中推断统计模式并预测可能的词序来生成输出。它们不会推理或权衡证据,也无法做出伦理或基于价值的判断。"
这是核心问题。聊天机器人不是在咨询医生——它们是在匹配文本模式。而在互联网上进行模式匹配(错误信息传播速度比更正更快),正好会产生这种类型的输出。
研究人员继续写道:"这种行为限制意味着聊天机器人可以复制听起来权威但可能有缺陷的回答。"在250个问题中,只有两个问题引发了拒绝回答——均来自Meta AI,涉及合成代谢类固醇和替代癌症治疗。其他每个聊天机器人都继续回答。
表现因主题而异。疫苗和癌症表现最好——部分原因是关于这些主题的高质量研究结构良好并在网上广泛复制。营养在研究中统计表现最差,运动表现紧随其后。如果你一直在询问AI关于食肉饮食是否健康的问题,你得到的答案可能并不基于科学共识。
Grok因错误原因脱颖而出。埃隆·马斯克(Elon Musk)的聊天机器人是测试模型中表现最差的。在其50个回答中,29个(58%)总体被评为有问题——在所有五种聊天机器人中比例最高。其中15个(30%)高度有问题,显著高于随机分布下的预期。研究人员直接将此与Grok的训练数据联系起来:X(推特平台)是一个以快速广泛传播健康错误信息而闻名的平台。
引用是另一个灾难。在所有模型中,参考文献的中位完整性得分仅为40%——没有一个聊天机器人能提供完全准确的参考文献列表。模型会虚构作者、期刊和标题。DeepSeek甚至承认:该模型告诉研究人员其参考文献是根据训练数据模式生成的,"可能与实际可验证的来源不符。"
可读性问题加剧了其他所有问题。所有聊天机器人的回答在Flesch阅读难易度量表上都得分在"困难"范围内——相当于大学二年级到四年级水平。这超过了美国医学会的建议,即患者教育材料的阅读水平不应超过六年级。
换句话说,这些聊天机器人采用了政客和专业辩手常用的技巧:在短时间内向你抛出如此多的技术词汇,以至于你最终认为他们比实际知道得更多。某事物越难理解,就越容易被误解。
这些发现呼应了Decrypt报道的2026年2月牛津大学的研究,该研究发现AI医疗建议并不比传统自我诊断方法更好。它们也与更广泛的担忧相一致,即AI聊天机器人根据问题的措辞提供不一致的指导。
作者总结道:"随着AI聊天机器人的使用继续扩大,我们的数据突显了公众教育、专业培训和监管监督的必要性,确保生成式AI支持而非削弱公共卫生。"
该研究仅测试了五种免费版聊天机器人,对抗性提示方法可能会夸大现实世界中的故障率。但作者直言不讳:问题不在于边缘情况。问题是这些模型被大规模部署,被非专家用作搜索引擎,并且从设计上几乎永远不会说"我不知道"。
【全文结束】

