Google的AI医疗助手在真实诊所研究中展示医生级别的诊断推理能力Google’s AI medical assistant shows doctor-level diagnostic reasoning in real clinic study

环球医讯 / AI与医疗健康来源:www.news-medical.net美国 - 英语2026-09-10 23:51:32 - 阅读时长5分钟 - 2235字
谷歌的对话式AI系统AMIE在100名患者的真实急诊护理试验中,安全地进行就诊前医疗访谈,并生成与医生相当的诊断见解,展示了AI助手如何改变日常临床工作流程。研究由Beth Israel Deaconess医学中心及谷歌研究团队联合开展,AMIE在实时监督下完成病史采集,未触发安全停止,且改善了患者对医疗AI的态度,盲审评估显示其鉴别诊断质量与人类初级医疗提供者无显著差异,但在实用性和成本效益方面仍落后于人类医生。
健康医疗AI诊断患者安全临床研究初级保健病史采集对话式AIAMIE医生短缺信任度
Google的AI医疗助手在真实诊所研究中展示医生级别的诊断推理能力

在一项涉及100名患者的真实急诊护理试验中,谷歌的对话式AI系统AMIE安全地进行了就诊前医疗访谈,并生成了与医生相当的诊断见解,为AI助手如何改变日常临床工作流程提供了早期展望。

研究:一项在门诊初级保健诊所开展的对话式诊断AI的前瞻性临床可行性研究。图片来源:khunkornStudio / Shutterstock

*重要提示:arXiv发布未经同行评审的初步科学报告,因此不应被视为结论性、指导临床实践/健康相关行为或作为既定信息对待。

在近日发表于arXiv预印本服务器上的一项研究中,研究人员开展了一项前瞻性可行性研究,以评估AMIE(清晰医学智能探索器)在急诊诊所对100名成年患者进行就诊前病史采集的真实世界表现。

尽管在患者与AI交互过程中有医生实时监督,并由临床医生在研究多个阶段进行评估,但研究发现,基于LLM的对话式AI模型运行安全,交互过程中未触发任何预设安全停止。

此外,该模型被报告改善了患者对医疗AI的态度,并且在盲法医生评审中,其产生的鉴别诊断质量与人类初级医疗提供者相当。

AI进入诊所,医疗系统面临日益严重的医生短缺

尽管现代医学取得了显著技术进步——许多技术旨在减少直接医生投入,如机器人辅助手术——但全球医疗系统正面临初级保健医生日益短缺的问题。

研究发现,医生与患者数量之间的差距已经导致医生工作量显著增加和前所未有的职业倦怠率。

为缓解这些结构性压力,研究人员越来越多地寻求利用现代计算进步和数字解决方案,尤其是大型语言模型(LLM)。

在受控的临床前环境中,这些复杂的人工智能(AI)算法在参与细微临床推理和模拟逼真患者交互方面显示出潜力。

例如,此前使用经过培训的客观结构化临床考试(OSCE)演员进行的实验室测试表明,谷歌的AMIE能够收集病史并生成与人类医生相媲美的诊断报告。

然而,批评者认为,真实的临床实践远比标准化模拟复杂。真实患者带来多样的沟通风格、不同程度的健康素养以及不可预测的情绪(如焦虑),这些在LLM训练数据中很少体现。

因此,在将这些工具安全整合到常规医疗实践之前,必须仔细评估其真实世界性能,以确保它们能够应对意外临床复杂性而不造成伤害。

谷歌研究团队通过推文宣布:“今天我们宣布与@BIDMC_Medicine合作开展的首个此类研究结果,关于我们的临床推理对话式AI——AMIE。在一项真实世界临床研究中,AMIE被发现安全、可行且受到患者欢迎。”——2026年3月11日

研究人员在真实急诊就诊中测试AMIE,而非模拟患者接触

本研究旨在验证AMIE在实时临床工作流程中的安全性和性能。

该研究设计为一项前瞻性单臂可行性研究,在Beth Israel Deaconess医学中心下属的门诊初级保健诊所Healthcare Associates进行。

研究对象为100名已预约非紧急急诊就诊的成年患者。

在预约就诊前最多五天,参与者与AMIE进行安全的文本聊天。

模型性能在患者接诊过程中受到监控,AMIE动态调整问题以基于疑似诊断和信息缺口收集患者病史,而非依赖静态问卷。

所有患者与AI的交互均通过屏幕共享由一名获得认证的内科医生实时监控。

接诊交互后,参与者接诊交互后,参与者完成了评估其体验的调查问卷。

聊天记录摘要、自动生成的临床总结以及参与者的调查结果,会在急诊就诊前转交给即将接诊该患者的临床医生。

最后,八周后,一个独立的医生小组进行了盲法病历审查,将AMIE和人类临床医生生成的管理方案的准确性和安全性,与患者就诊及随访后记录在医疗档案中的最终临床评估进行比较。

AI安全地处理了病史采集,并产生与临床医生相当的诊断

在试验的主要安全性结果中,AMIE被判定在监督下是安全的。监督患者与AI交互的医生在所有100次交互中均未触发一次安全停止,尽管偶尔会进行小幅澄清。

与聊天机器人的互动也显著提高了患者的信任度。

在“对AI总体态度量表”(GAAIS)上的调查得分在聊天后呈积极变化,并且在患者见到医生后仍保持较高水平。

在评估AMIE的临床推理能力时,盲法评估员发现AMIE和人类临床医生在鉴别诊断的总体质量上没有显著差异。

此外,在标准化病例摘要的盲法评估中,AI提出的管理方案的适当性和安全性与人类临床医生相当。

然而,人类临床医生在设计既实用又具有成本效益的管理方案方面显著优于AMIE。

这些差异可能反映了临床医生对患者背景信息和现实医疗约束(包括获取纵向病历和工作流程考量)有更大的访问权限,而这些在研究中并未完全提供给AI。

初步结果将对话式AI定位为受监督的临床助手

该研究表明,在受监督的研究环境中,一个对话式诊断AI系统可以安全有效地从真实患者处收集临床病史。

尽管AI尚不能自主行医,但这些发现支持其作为协作式临床工具和医生助手的新兴角色。研究结果强调需要进行更大规模的多中心研究,以确认在不同患者群体中的安全性、有效性和普适性。

*重要提示:arXiv发布未经同行评审的初步科学报告,因此不应被视为结论性、指导临床实践/健康相关行为或作为既定信息对待。

来源:探索在真实世界临床研究中进行对话式诊断AI的可行性

期刊参考文献:初步科学报告。Brodeur, P., 等人。(2026)。一项在门诊初级保健诊所开展的对话式诊断AI的前瞻性临床可行性研究(第2版)。arXiv。DOI:10.48550/ARXIV.2603.08448

【全文结束】