视觉赋能AI记录员减少临床对话中的遗漏:来自模拟用药史的证据Vision-Enabled AI scribes reduce omissions in clinical conversations: evidence from simulated medication histories | npj Digital Medicine

环球医讯 / AI与医疗健康来源:www.nature.com澳大利亚 - 英语2026-10-09 04:04:05 - 阅读时长15分钟 - 7257字
本研究开发并评估了一种基于Google Gemini模型和Ray-Ban Meta智能眼镜的视觉赋能AI记录员,用于记录用药史。通过在110次模拟药师-患者访谈(其中10次用于训练,100次用于测试,共2160个数据点)中的测试,该AI记录员在视频输入下实现了98%的整体准确率(药物名称、剂量、适应症等达到97%-99%),显著优于仅音频输入的81%(P<0.001)。视频输入使遗漏错误从358次降至10次,表明视觉信息对提升临床文档完整性至关重要。研究为多模态AI在临床记录中的应用提供了有力证据。
健康AI记录员视觉赋能用药史临床对话准确性遗漏视频音频药物患者药师多模态文档
视觉赋能AI记录员减少临床对话中的遗漏:来自模拟用药史的证据

摘要

大多数环境AI医疗记录员仅处理音频,忽略了临床重要的视觉细节。我们利用谷歌的Gemini模型和雷朋Meta智能眼镜开发了一种视觉赋能AI记录员,用于记录用药史——这是一项需要音频和视觉输入的双重任务。十名临床药师对110次模拟用药史访谈进行了视频录制。在10次训练录制进行迭代提示工程后,该记录员在100次测试录制(2160个数据点)上进行了评估,涉及患者细节和药物特定字段。视觉赋能记录员实现了98%的整体准确率(2114/2160个数据点),从患者细节的96%到给药说明和适应症的99%不等。视频输入显著优于仅音频处理(98% vs 81%,P<0.001),主要得益于遗漏错误减少(视频10例 vs 音频358例)。视觉赋能AI记录员显著改善了需要视觉输入的任务的文档准确性,显示出大幅减少临床文档中遗漏错误的潜力。

引言

生成式人工智能(AI)融入临床工作流程正在迅速推进。最早且最广泛采用的应用之一是环境AI医疗记录员,它利用医患对话中录制的音频自动生成结构化临床文档。这些工具有望大幅减少行政负担、规范文档并提高临床医生效率和与患者互动的时间。然而,由于当前的AI医疗记录员仅处理音频输入,这限制了其捕获完整临床背景的能力。在真实咨询中,重要健康信息往往是多模态的,包括视觉检查实物(如药瓶、标签、设备)以及患者外观、体位和行为传递的非语言信息。因此,仅音频记录员在细节可见但未口述时容易出现遗漏、不一致或误解。用药史对话就是这一挑战的典型例子,因为它们结合了可见物(如包装、标签和视觉线索)与医患的口述信息。有些细节本质上是视觉的,而另一些则可通过视觉和口述两种方式传达。这种重复对AI有利,因为它允许即时交叉验证,有助于最小化遗漏和转录错误。

近期多模态生成式AI的进步使得模型能够同时处理音频和视觉输入。这一能力创造了更了解上下文的AI医疗记录员的可能性,不仅感知所说内容,还感知所见内容。这种功能可以克服仅音频工具的局限性,并显著提高许多临床任务的记录性能。在本研究中,我们开发并评估了一种基于谷歌Gemini模型的视觉赋能AI记录员。该AI记录员用于记录模拟药师-患者访谈中的用药史,访谈通过雷朋Meta智能眼镜录制。次要目的是比较AI记录员在处理视频(即视觉+音频)输入与仅音频输入时的准确性。

结果

训练集表现

在10次模拟用药史训练视频录制中,AI记录员在30个患者细节数据点(即10次录制中每次的患者姓名、出生日期和药物过敏史各一个)和180个药物特定数据点(即10次录制中每次的36个数据点,包括药物名称、强度与剂型、给药说明、适应症和相关临床记录)上进行了训练。训练集共产生210个数据点。经过迭代提示工程后,AI记录员在训练数据中正确记录了99%(208/210)的数据点。补充信息给出了最终提示,构成了工程化AI用药史记录员的基础。

测试集准确性

在100次模拟用药史测试视频录制中,AI记录员在300个患者细节数据点(即100次录制中每次的患者姓名、出生日期和过敏史各一个)和1860个药物特定数据点(即100次录制中每次的372个数据点,包括药物名称、强度与剂型、给药说明、适应症和临床记录字段)上进行了评估。测试集共产生2160个数据点。关于在测试集中建立药师记录参考,经第二位药师审核,有45个数据字段被标记由第三位审核员复核;其中仅11个需要更新——部分代表因临床主观性可能出现的差异。

总体而言,工程化的视觉赋能AI记录员正确记录了98%(2114/2160)的评估数据点(表1,图1和图2)。其中包括患者细节96%(288/300)的准确率,药物名称98%(363/372),强度与剂型97%(362/372),给药说明99%(369/372),适应症99%(368/372),相关临床记录98%(364/372)。不同药师参与访谈时,记录员对给药说明(范围97%-100%,P=0.93)、适应症(范围94%-100%,P=0.26)或临床记录(范围93%-100%,P=0.25)数据点的准确性无显著差异。然而,在患者细节(范围80%-100%,P<0.001)、药物名称(范围89%-100%,P=0.008)和强度与剂型(范围86%-100%,P=0.009)数据中,不同药师之间的AI记录员准确性存在显著变化(补充表1)。图3展示了相应模型输入和AI记录输出的示例。

(图1:研究数据集、开发、评估和关键结果概览;图2:视频与仅音频输入下多模态AI记录员在用药史记录中的准确性比较;图3:开发的多模态AI记录员将视频和音频输入自动记录为结构化用药史文档的工作示例)

测试集错误分类

在2160个数据点中,46个(2%)被视觉赋能AI记录员记录错误(与人类记录参考相比)。其中包括36个“有所为”(记录错误内容)错误和10个“有所不为”(信息缺失)错误。补充表2和3显示了AI记录员处理视频录制时的错误详情。补充表4和5提供了视觉和音频输入以及错误输出的示例。

36个“有所为”错误包括患者细节11个,药物名称8个,强度与剂型8个,给药说明2个,适应症2个,临床记录5个。患者细节错误中,9个涉及错误出生日期,1个涉及错误姓名,1个涉及不恰当的过敏记录(对虾过敏记录为无已知过敏)。药物名称方面,3个错误源于误识别乐卡地平,5个涉及复方产品的错误记录(例如,度他雄胺/坦索罗辛被记录为索利那新/坦索罗辛)。8个强度与剂型错误中,5个涉及复方产品强度的错误记录,2个误表示单药产品强度(如145毫克记录为160毫克),1个误将剂型记录为“缓释”。2个给药说明错误中,1个涉及错误的每日给药时间,1个将“按需服用”记录为“每晚服一片或两片”。观察到的适应症错误涉及一种用于泼尼松治疗期间胃保护的药物被记录为“烧心”,以及一种药物的适应症被记录为疼痛,但录音中并未提及。5个临床记录错误包括3个使用时长错误和2个临床记录信息与给药说明冲突的情况。

10个“有所不为”错误(即AI记录员指示数据点缺失但实际上存在的情况)包括患者细节1个,药物名称1个,强度与剂型2个,给药说明1个,适应症2个,临床记录3个。值得注意的是,经审核,所有“有所不为”错误均可通过人工检查视频录制截图和AI记录员生成的逐字转录稿来解决,以支持临床工作流程中的验证。

视频与音频输入比较

为评估视觉输入对AI记录员准确性的贡献,对100次测试集用药史录制进行仅音频输入的处理。仅音频输入下AI记录员正确记录了81%(1750/2160)的数据点,显著低于视频输入的98%(2114/2160)(P<0.001;表1,图1,图2)。

具体而言,视频输入在患者细节(96% vs 91%,P=0.006)、药物名称(98% vs 80%,P<0.001)、强度与剂型(97% vs 28%,P<0.001)和给药说明(99% vs 91%,P<0.001)数据的准确性显著高于仅音频输入。适应症(99% vs 99%,P=1.00)和临床记录(98% vs 99%,P=0.18)数据在视频和仅音频之间无显著差异(图2,表1)。仅音频输入下准确性的下降主要由于“有所不为”错误大幅增加。仅音频输入共出现358个“有所不为”错误,而视频输入仅为10个(P<0.001;补充表6)。“有所为”错误在仅音频输入下也更多(52个 vs 36个),但差异无统计学意义(P=0.063)。补充表7和8显示了AI记录员在处理仅音频输入时的错误详情。

图4展示了各药师在各数据字段上视频与音频输入记录准确性差异的热图。对于所有药师,视频输入在药物名称(范围5%-47%)、强度与剂型(35%-85%)以及9/10药师的给药说明(高达29%)方面准确性持续更高(图4)。

(图4:按药师和数据类别划分的AI记录员视频与音频输入准确性差异热图)

讨论

本研究开发并评估了一种先进的视觉赋能AI记录员,旨在增强对包含关键视觉元素的临床接触的自动化文档记录。用药史对话是信息密集型临床接触的一个例子,包含精细细节,包括药物名称、强度与剂型、给药说明、适应症和相关临床记录。这些细节通常通过口述和视觉线索两种方式传达,一旦遗漏可能立即产生重大临床后果。在包含2160个数据点的100次模拟用药史中,AI记录员实现了98%(2114/2160)的整体准确率,从患者细节的96%到给药说明和适应症的99%。观察到的46个错误中,36个是“有所为”错误,即AI记录员记录了事实上不正确的信息。其余10个是“有所不为”错误,即信息在视频录制中可观察到却被标记为缺失。本研究的一个关键发现是视频内容显著提高了AI记录员的准确性。值得注意的是,AI记录员的性能从视频输入的98%下降到仅音频输入的81%(P<0.001),这主要是由“有所不为”错误大量增加引起的(仅音频358个 vs 视频10个)。此外,记录强度与剂型的准确性从视频的97%下降到仅音频的28%。这些结果凸显了AI记录员与视频录制设备结合使用的临床潜力,以减少仅音频系统中常见的文档局限性,特别是对于需要音频和视觉信息输入的任务。

当前专有环境仅音频AI医疗记录员的准确性通常在82%至98%之间,用于生成临床咨询笔记。尽管这些工具的使用日益增多,许多临床医生认为它们有用,但重要的是要认识到这些数字反映的是咨询中口述信息的性能,因此忽略了临床医生需要额外处理书面或视觉线索以完成文档任务的工作。举例说明这一局限,最近一项研究评估了由仅音频AI记录员生成的14份咨询笔记。在平均每份笔记400个单词中,每份笔记发现超过20个错误,其中超过80%是遗漏(与临床医生记录的完整参考相比)。这些发现表明,在当前技术下,临床医生仍需花费大量时间审查、纠正和完成AI生成的笔记,这与定性的临床医生报告一致。认识到这些不足,近期工作已尝试将视觉输入整合到AI记录工作流程中以提高完整性和准确性。例如,一个基于机器人辅助根治性前列腺切除术视频训练的AI记录员在158例测试中实现了87%的检测和记录手术步骤的准确率。类似地,一个为腹腔镜胆囊切除术报告生成开发的混合视觉-语言模型达到了93%的准确率。在这些进展基础上,本研究首次评估了为用药史记录设计的多模态AI记录员。该系统在100次视频录制中实现了与人类记录参考相比98%的准确率,比仅音频处理提高了17%,且“有所不为”错误从仅音频输入的358次减少到视频输入的10次。这一发现凸显了将视觉背景纳入依赖视觉信息沟通的文档任务中的临床价值。

尽管本研究开发的用于辅助用药史记录的多模态AI记录员在2160个评估数据点中达到了98%的准确率,但重要的是要认识到,与人类记录参考相比,发现了46个错误。这些错误突显了临床医生在完成用药史过程中进行监督的极端重要性。46个错误中,36个是“有所为”错误,包括记录的患者姓名和出生日期不准确,以及药物名称、强度与剂型、给药说明、适应症和临床记录的错误记录。这些错误可能反映了视觉相似产品或相近剂量变体(例如145毫克与160毫克片剂)之间的歧义,而另一些则可能源于视觉或口述细节的捕获不完整、口述内容与可见内容之间的时间不匹配,或记录设备和基础AI模型的固有局限。此外,在某些字段(包括患者细节、药物名称和强度与剂型)上观察到不同药师之间的错误率显著差异,尽管尚不确定这些差异是由于模拟过程中信息口述或视觉呈现方式的变化,还是AI记录员性能的局限。若不加以纠正,此类错误可能在后续临床工作流程中对患者护理产生重大后果。此外,观察到10个“有所不为”错误,表明即使信息在录制中对人类药师是可观察的,记录技术仍存在完全完成文档的局限性。在努力最小化或消除此类错误的同时,亟需研究建立临床工作流程和协议,以促进人类主导的AI记录文档验证。在本研究中,记录员提供了一份结构化报告,包含所选药物包装/标签截图以及逐字转录稿,以帮助临床医生在签署文档前进行高效验证。开发稳健的人机交互## 方法

数据来源

五对研究临床药师(共10人),具有不同的口音、语言背景和性别,使用雷朋Meta智能眼镜录制了110次独特的模拟用药史访谈。每次模拟中,一名药师(佩戴眼镜)扮演临床医生,另一名扮演患者。其中10次模拟录制被选用于AI记录员开发(训练集)。其余100次录制保留用于AI记录员测试(测试集)。测试集在AI记录员开发期间不可用,仅在开发完成后分析一次。110个临床场景均独特且由作者团队提前规划,基于其集体临床经验。场景设计基于美国疾病流行数据反映常见临床情况,并包含常见处方药和非处方药。每个场景涉及患者使用约3至5种药物。模拟中使用100种不同的物理药瓶,包括片剂、胶囊、注射剂和乳膏的包装盒或瓶子。每个容器使用iPharmacy软件按照美国药典(USP)标准贴标。访谈场景还包括未当场展示的产品的提及,如非处方药或按需服用的药物和补充剂。所有录制在安静的会议室进行,采用标准荧光照明,两名药师面对面坐下。一名研究人员(B.D.M.)在场提供技术支持。所有110次录制在分析前存储在云存储中。

对于每次录制,由临床药师B.D.M.创建人类记录参考作为金标准进行比较。每次用药史按照推荐文档标准结构化,包括患者层面细节(姓名、出生日期、药物过敏史)和药物层面细节(药物名称、强度与剂型、给药说明、适应症和相关临床记录)。所有人类记录的用药史由第二名临床药师(N.S.)独立审核并验证准确性,如有分歧则由第三名药师(A.M.H.)裁决。

AI记录员开发

视觉赋能AI记录员使用谷歌Gemini-Pro-2.5-exp-05-06开发,这是一个多模态基础模型,因其强大的性能和同时处理音频与视频输入的能力而被选用。记录员使用经过验证的提示工程策略进行工程化,包括关于测试、任务分解、示例包含、结构化输出格式和输出验证的指导。使用10次训练视频录制迭代优化提示以最大化准确性(图1)。

简而言之,工程化提示将模型任务设定为记录用药史访谈,分解为记录患者细节(姓名、出生日期、药物过敏史)和药物特定数据(药物名称、强度与剂型、给药说明、适应症和相关临床记录)的步骤。模型被指示以结构化JSON格式返回这些信息。使用第二个提示验证输出,通过提供原始视频和草稿输出,指示模型识别并纠正任何错误或遗漏。其他策略包括提供输入-输出示例(即用药史录制及其正确输出),生成药盒/标签截图和逐字转录稿以帮助临床工作流程中的验证。

记录员经过迭代训练,直到训练数据中没有进一步准确性提升。最终提示配置见补充信息。超参数设置为温度0.0,top_p 0.95,最大输出长度16,000 tokens以确保确定性输出。开发和测试在2025年1月至5月之间使用Python(v3.12)在Visual Studio Code(v1.99.1)中进行。AI记录员系统,包括训练期间使用视频录制优化的所有提示,在测试集揭盲和评估之前被冻结。

AI记录员测试

使用100次测试集用药史访谈录制评估开发的AI记录员性能。对于每次访谈,将AI记录员生成的输出与人类记录参考(金标准)进行比较。评估患者层面字段(姓名、出生日期、药物过敏史——每次访谈记录一次)和药物层面字段(药物名称、强度与剂型、给药说明、适应症和临床记录——访谈中提及的每种药物记录一次)的准确性。相关临床记录包括录制中包含的任何视觉或口述信息,这些信息通常会在用药史中记录(例如,给药细节、近期变化、使用时长)。每个数据字段分类为正确或不正确。不正确的条目进一步分为“有所不为”或“有所为”错误,如文献中记录用药错误所定义。“有所不为”错误发生在所需字段在AI输出中缺失/未知,而在人类记录参考中存在时;“有所为”错误则发生在存在值但与参考不一致时。这些术语描述了与基于视频录制的药师记录参考的分歧,并不归因于错误的根本原因。临床记录字段中包含超出人类记录参考的额外信息的条目被视为正确,前提是该信息在视频或音频录制中可识别且不与其他任何字段冲突。两名临床药师(B.D.M.和N.S.)独立完成审核,分歧由第三名药师(A.M.H.)裁决。

所有分析和可视化在RStudio(版本5.1)中进行,统计显著性设定为P<0.05。使用描述性统计检查AI记录员的准确性,并以柱状图呈现。据估计,100次视频录制测试集对于一种字段类型可产生超过300个数据点(即患者层面、药物名称、强度与剂型、给药说明、适应症和临床记录数据字段),在预测准确性95%的情况下,预测误差幅度为±2.5%(即该字段的观察准确性为95%将导致95% CI为92.5%至97.5%)。

对于次要目标,将用于处理视频录制的相同优化提示应用于每次录制的仅音频版本。使用描述性统计和配对McNemar检验评估视频与仅音频输入之间记录性能的差异。假设不一致率≤10%(与两种模态通常一致一致),超过2000个配对数据点提供超过90%的功效(双尾McNemar检验,α=0.05)以检测≥5%的绝对准确性差异。使用热图可视化不同药师在处理视频与仅音频时记录准确性的差异。

本研究由弗林德斯大学人类研究伦理委员会批准(项目ID:7800),符合澳大利亚国家健康与医学研究委员会的《人类研究伦理行为国家声明》。

数据可用性

所有数据,包括模拟病例中使用的患者和药物细节以及相应的AI输出,均可在以下网址获取:

代码可用性

用于创建视觉赋能AI记录员的Python代码可在以下网址获取:Vision-Enabled-AI-Scribe.

其他信息

出版商注:Springer Nature对已出版地图中的管辖权主张和机构归属保持中立。

【全文结束】