虽然聊天机器人和大型语言模型可以回答许多日常问题,但根据科学期刊《自然医学》的一项新研究,它们不应成为你寻求医疗建议的首选。
研究中,1298名英国参与者被要求使用诸如ChatGPT或Meta的Llama 3等大型语言模型来获取医疗建议。按照这种方式使用时,LLM正确识别病情的比例低于34.5%。
LLM在研究中的表现
研究承认,LLM在医学知识基准测试中获得的分数已相当于通过美国医师资格考试的水平,且由LLM生成的临床文档“被评为与医生书写的文档质量相当甚至更好”。然而,当研究参与者试图通过向LLM提问来获得同样结果时,却未能成功,这暴露了一个问题。研究发现,这是因为用户往往没有提供足够的信息。在30个抽样互动中,有16个的初始消息仅包含部分信息。
研究指出:“在两例案例中,LLM最初给出了正确回答,但在用户添加更多细节后,又加入了新的错误回答。”这表明与聊天机器人进行更多对话并不能提高获得正确医疗诊断的概率。在初次诊断后,LLM仅44.2%的时间向用户提供了正确的后续步骤。
人们使用聊天机器人寻求医疗建议的频率如何?
根据ChatGPT母公司OpenAI的一项调查,五分之三的美国成年人表示使用AI来获取健康信息。“他们正在使用AI来获取初次感到不适时的信息,咨询AI为就诊做准备,并利用AI更好地理解患者的指示和建议。”OpenAI表示。
尽管ChatGPT网站上有一个小免责声明写着“ChatGPT可能会出错。请检查重要信息”,但许多人仍把聊天机器人的话当作事实。
这项研究提醒我们,不应依赖ChatGPT及类似聊天机器人提供医疗指导,尤其是在严肃的情况下。
本文所含信息仅供教育和参考目的,不构成健康或医疗建议。如有任何关于健康状况或健康目标的问题,请务必咨询医生或其他合格的健康服务提供者。
【全文结束】

