研究人员评估AI生成的急诊室出院指示翻译中的安全风险Researchers Examine Safety Risks in AI-Generated Translation of Emergency Department Discharge Instructions

环球医讯 / AI与医疗健康来源:news.cuanschutz.edu美国 - 英语2026-08-29 17:39:42 - 阅读时长5分钟 - 2493字
科罗拉多大学安舒茨医学院研究人员开展了一项研究,探讨人工智能如何翻译针对西班牙语患者的急诊室出院指示及当前评估方法能否可靠确定这些翻译的安全性。研究发现自动化评估指标与临床医生人工审查结果存在显著差异,特别是在准确性、术语使用和语言流畅性等关键领域。该研究强调在高风险临床环境中仅依靠自动化评分不足以确保AI翻译安全有效,需要采用分层评估方法来保证医疗翻译质量,避免可能危及患者安全的翻译错误,如将"随餐服用"错误翻译为"不要随餐服用"等可能改变患者行为的严重问题。
AI翻译急诊室出院指示安全风险语言障碍患者安全医疗沟通临床风险翻译质量健康
研究人员评估AI生成的急诊室出院指示翻译中的安全风险

对于科罗拉多大学安舒茨医学院急诊医学兼职临床讲师威廉·蒙多(William Mundo)医学博士、公共卫生硕士来说,医疗中的语言障碍挑战既是职业问题,也是深刻的个人体验。

"作为一名双语临床医生,也是两个不会说英语的移民的子女,这项工作对我个人意义深远,"蒙多表示。"我亲眼目睹了语言障碍如何影响我自己的家庭在医疗系统中的导航能力,而我每天都在我的患者身上看到同样的挑战。"

这些经历促使他开展了一项新研究,探讨人工智能如何翻译针对西班牙语患者的急诊室出院指示——以及当前的评估方法是否能可靠地确定这些翻译的安全性。

该研究由蒙多领导,并由科罗拉多大学安舒茨医学院急诊医学系副教授、研究副主任伊丽莎白·戈德堡(Elizabeth Goldberg)医学博士、理学硕士、美国急诊医师学会会员共同指导。该研究调查了在评估大型语言模型(LLM)翻译的出院指示时,自动化评估指标与人工审查之间的差异。这项研究在2026年美国医学信息学协会(AMIA)Amplify会议上展示,研究了自动化评估方法与临床医生审查在评估AI翻译的西班牙语出院指示方面的比较。

为何出院指示如此重要

出院指示是急诊室就诊结束时提供给患者最重要的面向患者的文件之一。它们通常包括用药说明、随访建议、症状监测指南以及关于何时寻求紧急医疗帮助的警告。对于英语能力有限的患者来说,准确翻译的指示可以在支持安全的门诊护理中发挥关键作用。

"在急诊医学中,患者出院是最高风险的时刻之一,"戈德堡表示。"从急诊室到家中或从急诊室到医疗机构的护理过渡充满了诸多问题,即使临床医生和护士试图优化沟通。"

与住院环境不同,急诊室专注于解决急性医疗问题,提供稳定治疗,并确保患者能够安全过渡到下一阶段的护理。随后,患者被期望在出院后独立管理自己的护理,通常是在短暂的高压力临床接触后,几乎没有机会进行澄清。

研究人员表示,当存在语言障碍时,这些挑战会变得更加严重。

"临床医生试图通过使用Google Translate等翻译工具来做正确的事情,但我们知道这些工具有时并不准确,"戈德堡解释说。"患者可能无法充分理解它们,从而无法按照临床医生的预期建议采取行动。"

大型语言模型(LLM)的日益普及为改善医疗保健中的语言一致性沟通创造了新的机会,特别是在忙碌的急诊室中,口译服务和专业翻译资源可能有限。但研究作者警告说,在将此类系统广泛部署到临床护理之前,必须仔细评估翻译质量。

比较自动化指标与人工审查

为了评估翻译质量,研究团队比较了自动化评分系统与结构化人工审查。自动化指标包括BLEU、NIST、ROUGE和基于概念的嵌入余弦相似度——这些工具常用于机器翻译和自然语言处理研究。

根据科罗拉多大学安舒茨医学院生物医学信息学助理教授、科罗拉多大学安舒茨健康人工智能中心联合主任高艳君(Yanjun Gao)博士的说法,选择这些指标是为了代表传统的词重叠方法和新的语义相似度方法。

BLEU、NIST和ROUGE通过测量共享的单词和短语来评估翻译句子与参考翻译的相似程度。NIST略有不同,它为更具信息量或临床意义的术语赋予更大的权重。嵌入余弦相似度试图通过在语义向量空间中比较翻译来衡量意义保留,而不仅仅依赖于确切的措辞。

研究团队还使用多维质量指标框架(MQM)进行了人工评估,该框架评估准确性、术语、流畅性和适当受众等维度。临床医生审查了翻译,以确定指示是否保留了临床重要的意义,并且对患者来说仍然易于理解。

指标的不足之处

研究人员发现,自动化指标和人工判断并不总是一致。

"我们发现自动化指标和MQM通常表明AI翻译质量很高,但临床医生的审查在准确性、流畅性等对意义敏感的领域发现了不一致,"蒙多表示。

许多差异涉及可能具有严重临床影响的错误。自动化指标经常未能识别错误翻译的用药说明、遗漏的返诊注意事项,或涉及否定和紧急性的错误。

"一个例子是将'take with food'(随餐服用)翻译为'do not take with food'(不要随餐服用),"高解释道。"由于存在大量词汇重叠,尽管这代表了潜在的有害指示,翻译仍可能获得可接受的分数。"

研究人员还指出,通用领域嵌入模型可能难以区分细微但临床上重要的差异,例如"每日"与"每日两次"或"轻度不适"与"严重疼痛"。

为了更好地描述这些问题的影响,临床医生审查员根据潜在的临床风险对错误进行了分类,区分了风格问题、模糊措辞以及可能改变患者行为或危及安全的错误。

构建更好的评估框架

该研究还检查了影响翻译性能的因素,包括模型选择、提示设计和源文本复杂性。具有更强指令遵循能力的大型模型通常能产生更连贯的翻译,特别是对于涉及多种药物或条件性建议的较长出院指示。关于临床背景和患者受众的明确提示也在人工审查中提高了流畅性和可读性。

然而,研究人员强调,在高风险的临床环境中,仅靠自动化评估是不够的。

"我们的研究结果表明,这些工具不应仅基于自动化分数来部署,"蒙多表示。"医疗系统需要分层评估方法:自动化指标用于模型选择,结构化的MQM审查用于领域级评估,以及针对高风险内容的有针对性的人工监督,因为在这些内容中临床意义最为重要。"

最终,该研究认为,评估临床翻译需要的不仅仅是测量文本相似度。

"出院指示的成功不在于它与参考翻译相似,"高表示。"而在于英语能力有限的患者能够理解它、信任它,并正确地采取行动。"

特邀专家

伊丽莎白·戈德堡(Elizabeth Goldberg)医学博士、理学硕士、美国急诊医师学会会员

威廉·蒙多(William Mundo)医学博士

高艳君(Yanjun Gao)博士

【全文结束】