人工智能在代表医生回复患者时会犯下危险错误——一项重大研究发现,医务人员常常被迫从头重写这些回复。研究人员警告,AI生成的回复可能包含不准确的医疗建议以及真正的医生能立即发现的无关信息。这些发现对政府快速将AI推广至国民医疗服务体系的做法提出了新的质疑。几天前,卫生大臣詹姆斯·默里宣布了这一举措,承诺该技术能解放医生的文书工作、加速治疗并帮助减少等待名单。
这一举措是英格兰国民医疗服务体系耗资数十亿英镑推动AI在整个医疗系统加速部署的一部分,包括帮助临床医生记录问诊、通过NHS应用程序分诊患者、起草文件以及减少行政负担的工具。官员们坚称,AI被用于支持医生,而非取代他们。
但研究表明,AI生成的草稿、摘要和患者信息存在危险错误的风险,这些信息看起来完美,却可能遗漏关键的临床预警信号。这项新研究还表明,该技术可能耗费医生更多时间而非节省时间——有时医生修正AI生成的回复所花的时间比从头撰写还要长。
科学家发现,这些系统经常生成过长的回复,包含不准确或无关的医疗信息,并且未能提出有经验的临床医生认为必不可少的后续问题。其中一个例子涉及一名因胃酸反流正在服药的32岁女性,她联系医生抱怨持续恶心。AI生成的回复建议她在适应药物的同时可能需要调整饮食。然而,医生立即删除了这一建议,转而问出了一个计算机未能考虑的关键问题——她是否可能怀孕。科学家表示,这个例子说明了AI如何能生成令人信服的医学语言,却忽略了至关重要的临床推理。
其他研究人员曾发现AI向患者推荐不适当药物、以及未能识别需要紧急医疗评估的情况的例子。
这项由美国达特茅斯学院进行的新研究分析了超过10,000名患者与其家庭医生之间的约146,000次真实对话,并测试了包括ChatGPT、Claude、Gemini、Llama、Aloe和Qwen在内的主流AI系统生成的回复。研究人员发现,AI生成的回复通常与临床医生实际写出的内容不符,常常遗漏重要问题,同时添加了医生随后必须删除的不必要或不准确的细节。
计算机科学助理教授、该研究的主要作者之一萨拉·普雷姆表示:“我们发现AI可以听起来像医生,但无法像医生一样思考。”普雷姆教授警告,存在只是将一种行政负担替换为另一种的危险,她说:“你不想将大型语言模型整合到工作流程中,却只是把瓶颈转移,让医生把认知精力花在扮演AI的清洁工上、去修正错误。但如果我们不谨慎,这很可能是结果。”
牛津大学循证医学中心的医疗研究员汤姆·杰斐逊博士说:“医学不是一门精确科学,你不能信任机器。我对AI在医疗领域日益增长的使用感到极为担忧。AI会犯错,且无法区分高质量证据和‘噪音’(劣质证据)。如果你必须检查它,那你并没有节省时间。”
早期的研究也引发了安全担忧。由麻省总医院布莱根分院和哈佛医学院进行、发表在英国《柳叶刀·数字健康》杂志上的一项研究发现,7.7%的AI生成的患者回复可能导致严重伤害。而2025年格罗宁根大学医学中心进行的一项为期16周的荷兰研究发现,AI生成的草稿回复未能显著节省临床医生时间,主要原因是这些回复仍需仔细检查和编辑。这些发现加剧了人们对AI在医疗领域应用速度之快的担忧。
批评者警告,AI还可能编造事实、犯事实性错误,并遗漏有经验医生能立即发现的细微临床线索。合著者、家庭医生蒂姆·伯迪克博士表示,AI仍需要仔细的人类监督,并补充道:“我看不到有哪个时刻可以使患者门户系统能在未经临床医生编辑的情况下回复患者。”他还指出,冗长的AI生成草稿可能拖慢医生速度,因为它们可能包含错误信息。“如果你必须编辑75%的信息,你可能在修改上花费的时间和精力比从头撰写还要多。”
研究人员得出结论,每个AI生成的回复在到达患者之前都应继续由临床医生检查。伯迪克博士还强调,患者不应期望计算机在不久的将来取代医生,他说:“我们离将临床医生从工作流程中移除还差得很远。”研究团队发现,可以通过训练AI模仿个体医生的沟通风格来改进AI,这样能将回复质量提升约三分之一,并减少临床医生需要的编辑量。
英格兰国民医疗服务体系首席执行官吉姆·麦基爵士表示:“我们未来几年正在进行的重大技术改革将改变服务。NHS应用程序中的新AI工具将帮助患者首次就获得最适合其需求的服务——无论是全科医生预约、去药房还是在家自我护理的建议——这样临床医生就能确保最需要全科医生预约的人更快得到预约。”“我们还看到了引入AI笔记工具的巨大好处,临床医生发现他们能与患者多相处四分之一的时间,因此我们正在尽快在全NHS推广这些工具。我们优先考虑能带来最大改变的改进,并支持地方领导采纳这些改进以推动服务变革——帮助减少等待名单、改善数百万患者的护理,使NHS为未来做好准备。”
我们的标准:GB新闻编辑章程
【全文结束】

