科学家发明假眼病测试AI识别能力,ChatGPT和Gemini却将其视为真实疾病Scientists invented a fake eye disease to see if AI chatbots could spot it, but the experiment took an unexpected turn when ChatGPT, Gemini started treating the fictional illness as a real medical condition - The Times of India

环球医讯 / AI与医疗健康来源:timesofindia.indiatimes.com瑞典 - 英语2026-08-30 15:56:15 - 阅读时长5分钟 - 2346字
瑞典研究人员故意发明了一种名为"bixonimania"的虚构眼病,以测试AI聊天机器人能否识别虚假医疗信息。结果显示,包括ChatGPT和Gemini在内的多个大型语言模型将这种不存在的疾病描述为真实病症,暴露了AI系统容易传播错误信息的弱点。更令人担忧的是,一些研究人员在自己的工作中引用了这些虚构研究论文而未察觉其虚假性,这凸显了在健康等敏感领域依赖AI可能带来的风险,特别是当用户将聊天机器人作为医疗咨询的第一来源时可能引发的自我诊断危险。
健康眼病AI错误信息医疗信息虚假疾病识别能力
科学家发明假眼病测试AI识别能力,ChatGPT和Gemini却将其视为真实疾病

一种虚构的眼部疾病揭示了人工智能存在的真实问题。瑞典研究人员故意发明了一种称为"bixonimania"的病症,目的是测试流行的AI聊天机器人能否识别虚假的医疗信息。然而,几个大型语言模型自信地将这种不存在的疾病描述为真实疾病,显示了错误信息如何轻易地通过基于互联网数据训练的AI系统传播,尤其是在健康等敏感问题上。

该实验还揭示了另一个问题:一些研究人员引用了与这种虚构疾病相关的假科研论文,却没有注意到这些研究公开承认它们是编造的。

一个有真实目的的假疾病

该项目由哥德堡大学的医学研究员Almira Osmanovic Thunström领导,她同时也是瑞典Chalmers Industriteknik的AI战略家和创新经理。

她在教授学生关于大型语言模型(LLMs)如何构建和训练时想到了这个主意。

"有趣的是,他们中很少有人,甚至AI领域内的许多人,都不了解大型语言模型是如何构建的,"她告诉《科学美国人》(Scientific American)的"Science Quickly"播客主持人Rachel Feltman。

为了演示这些系统如何收集信息,Osmanovic Thunström和她的同事们创造了bixonimania,这是一种虚构的眼部疾病,据称与过度使用屏幕和蓝光暴露有关。

目标不是欺骗人们,而是看看聊天机器人能否区分可靠的在线信息和故意植入的虚假材料。

"我真的想要一个清晰的案例,能够在整个系统中留下线索,展示数据是如何被处理的、如何被输出的,以及在分发信息时预测模型和训练模型如何工作,"Osmanovic Thunström补充道。

"说谎的失败者"

2024年初,研究人员开始在互联网上散布关于这种假疾病的信息。

他们在Medium上发布了两篇博客文章,并将两篇研究论文上传到科学预印本服务器,该服务器用于在同行评审前共享研究。

这些论文本身就包含几个明显的线索,表明它们不是真实的。

主要作者被列为Lazljiv Izgubljenovic,这个名字翻译为"说谎的失败者"。一项研究的标题大致意思是"色素沉着:一个真实的BS设计"。这些论文感谢了包括"银河三体"和《指环王》在内的组织,同时致谢了"企业号星舰"的同事和《老友记》中的Ross Geller教授。

至少有一篇论文甚至明确表示:"整篇论文都是编造的。"

这些报告后来已从服务器中移除。

"我没有想到预印本(在学术界有点像小报,因为任何东西都可能出现在那里)会被数据库如此认真地对待,"Osmanovic Thunström告诉"Science Quickly"。

聊天机器人将疾病视为事实

警告还不够。

在这些虚假材料出现在网上后,几个主要的AI聊天机器人开始将bixonimania视为合法的医疗状况。

据《自然》杂志(Nature)报道,微软Bing的Copilot将其描述为"确实是一种有趣且相对罕见的疾病"。谷歌的Gemini表示它是"由过度暴露于蓝光引起的疾病"。OpenAI的ChatGPT也在用户描述长时间使用屏幕后出现的症状(如眼睛发痒、眼睑发红和刺激感)时推荐了这种疾病。

一些聊天机器人的回应是在用户直接询问bixonimania之后。另一些则在人们描述与蓝光暴露相关的症状时(即使没有提到其名称)建议了这种假疾病。

结果揭示了大型语言模型的一个缺陷,一个弱点。它们通过识别所吸收信息中的模式来生成答案,而不是独立验证该信息是真实的还是完全编造的。

甚至研究人员也被蒙蔽

该实验发现了另一个意想不到的问题。

一些科学家在自己的工作中引用了这些编造的研究论文,这表明他们可能没有真正阅读他们引用的论文。

如果他们阅读了,就会发现许多玩笑和明确的声明,揭示这些论文是虚构的。

对于伦敦大学学院的错误信息研究员Alex Ruani(他没有参与该项目)来说,这些发现说明了错误信息如何同时在科学和技术系统中传播。

"这是关于错误信息和虚假信息如何运作的大师课,"Ruani告诉《自然》杂志。

他们补充说:"如果科学过程本身及其支持系统是熟练的,而且它们没有捕捉和过滤掉这样的内容,我们就完了。"

为什么这很重要

大型语言模型正越来越多地被数百万人用于回答健康问题、解释医疗状况,甚至提供情感支持。

如今,许多用户将聊天机器人视为咨询医疗专业人员之前的第一信息来源。如果用户试图使用AI进行自我诊断而不是真正咨询医生,这可能很危险。

bixonimania实验说明了这种做法存在风险的原因。这些系统从大量在线内容中学习,如果错误或编造的信息进入其训练数据,就可能成为其回应的一部分。

剑桥大学的社会科学家Jonathan Goodman和Mariam Rashid(他们没有参与这项研究)表示,AI工具有价值,但用户仍需要批判性地对待它们。

虽然AI和互联网等工具有助于我们,"确保我们使用它们而不是被它们操纵,这取决于我们自己,"他们为《对话》(The Conversation)撰文写道。

他们还指出,根本问题远远超出了AI的范围。

"错误信息一直存在,"Goodman和Rashid为《对话》撰文写道。"新的变化是它传播的速度、生成它的工具以及它模仿真实事物的逼真程度。"

【全文结束】