人工智能在代表医生回复患者时正在犯危险的错误——一项大型研究发现,医生往往被迫从头重写AI生成的回复。
研究人员警告,AI生成的回复可能包含不准确的医疗建议和无关信息,而真正的医生会立即察觉。这一发现对英国政府近期宣布的在NHS(英国国家医疗服务体系)快速推广AI的计划提出了新的质疑。几天前,卫生大臣詹姆斯·默里宣布了这一计划,承诺该技术将把医生从文书工作中解放出来,加快治疗速度,并帮助减少等候名单。
此举是NHS England耗资数十亿英镑推动AI在整个医疗服务体系中加速部署的一部分,包括帮助临床医生记录诊疗、通过NHS应用分诊患者、起草文件以及削减行政负担的工具。官员们坚称,AI被用于支持医生,而非取代他们。
但研究表明,AI生成的草稿、摘要和患者信息存在危险错误的风险,这些回复看似专业,却可能遗漏关键的临床警示信号。这项新研究还指出,该技术可能让医生花费比节省下来的更多的时间——医生有时纠正AI生成的回复所花的时间比从头开始写还要长。
科学家们发现,这些系统常常生成过长的回复,包含不准确或无关的医疗信息,并且未能提出经验丰富的临床医生认为必要的跟进问题。其中一个案例涉及一名32岁女性,因胃酸反流正在服药,她向医生抱怨持续恶心。AI生成的回复建议她在适应药物的同时可能需要调整饮食。然而,医生立即删除了这个建议,转而问了一个计算机未能考虑的关键问题——她是否有可能怀孕。
科学家表示,这个案例说明了AI如何能够生成令人信服的医学术语,却忽视了至关重要的临床推理。其他研究人员此前曾发现AI给患者推荐不当药物、以及未能识别需要紧急医疗评估的情况的实例。
这项由美国达特茅斯学院进行的新研究分析了超过1万名患者与其家庭医生之间约14.6万条真实对话。它还测试了由主流AI系统(包括ChatGPT、Claude、Gemini、Llama、Aloe和Qwen)生成的回复。研究人员发现,AI生成的回复往往无法与临床医生实际会写的内容相匹配,经常遗漏重要问题,同时添加了不必要或不准确的细节,医生随后不得不将其删除。
计算机科学助理教授、该研究的首席作者之一萨拉·普鲁姆表示:“我们发现AI听起来像医生,但思考方式不像医生。”普鲁姆教授警告说,存在一种风险,即只是用一种行政负担取代另一种,她说:“你不想把大语言模型整合到工作流程中,只是转移瓶颈,让医生把认知精力花在当AI的清洁工、修正错误上。但如果我们不小心,这很可能会发生。”
牛津大学循证医学中心的医疗研究员汤姆·杰斐逊博士说:“医学不是一门精确的科学,你不能相信机器。我对AI在医疗领域的日益广泛应用感到极为担忧。AI会犯错,无法区分高质量证据和‘噪声’(劣质证据)。如果你必须去检查它,那就不是在节省时间。”
此前的研究也已引发安全担忧。由麻省总医院布里格姆分院和哈佛医学院进行、发表在《柳叶刀数字健康》上的一项研究发现,7.7%的AI生成的患者回复可能造成严重伤害。此外,格罗宁根大学医学中心在2025年进行的一项为期16周的荷兰研究发现,AI生成的回复草稿未能显著节省临床医生的时间,主要原因是这些回复仍需仔细检查和编辑。这些发现加剧了人们对AI在医疗领域快速应用速度的担忧。
批评者警告说,AI还可能捏造事实、犯事实性错误,并遗漏经验丰富的医生能立即察觉的细微临床线索。合著者、家庭医生蒂姆·伯迪克博士表示,AI仍需人工仔细监督,并补充道:“我看不到有哪个时候,门户网站能在未经临床医生编辑的情况下直接回复患者。”他还指出,冗长的AI生成草稿可能会拖慢医生的速度,因为它们可能包含错误信息。“如果你必须修改75%的信息,你花在修改上的时间和精力可能比从头开始写还要多。”他说。
研究人员得出结论,每一份AI生成的回复在发送给患者之前都应继续由临床医生检查。伯迪克博士还强调,患者不应期望计算机在短期内取代医生,并强调:“我们距离让临床医生脱离工作流程还差得很远。”
研究团队发现,可以通过训练AI模仿个体医生的沟通风格来改进AI,这将使回复质量提高约三分之一,并减少临床医生需要编辑的工作量。NHS England首席执行官吉姆·麦基爵士表示:“我们未来几年对技术进行的重大改革将改变服务。NHS应用中的新AI工具将帮助患者第一次就获得最适合其需求的服务——无论是全科医生预约、前往药房还是关于在家自我护理的建议——以便临床医生确保最需要全科医生预约的人能更快得到预约。”
“我们还看到引入AI笔记工具带来的巨大好处,临床医生发现他们可以将多达四分之一的时间用于与患者相处,因此我们正在NHS中尽可能快地推广这些工具。我们优先考虑能带来最大改变的改进,并支持地方领导采纳这些工具,以推动其服务的变革——帮助减少等候名单并改善数百万患者的护理,使NHS为未来做好准备。”
【全文结束】

