谷歌的新人工智能可能永远改变医疗保健(谷歌DeepMind AI联合临床医生详解)Google's new AI could change healthcare forever (Google DeepMind AI co-clinician explained)

环球医讯 / AI与医疗健康来源:www.msn.com美国 - 英语2026-10-09 10:20:06 - 阅读时长12分钟 - 5597字
本文详细介绍了谷歌DeepMind开发的AI联合临床医生系统,通过实时视频交互与体格检查,在68项医疗咨询能力上与人类医生相当或更优,经盲测胜出GPT-5.4等模型,但在关键危险信号和复杂检查上仍不如人类,标志着医疗AI的重大突破但仍需完善。
健康医疗保健人工智能诊断体格检查患者医生远程医疗分诊症状治疗
谷歌的新人工智能可能永远改变医疗保健(谷歌DeepMind AI联合临床医生详解)

但谷歌刚刚推出了一项足以让地球上每一位医生真正关注的东西。这并非因为AI要取代他们,而是因为它在68个不同方面的实际医疗咨询中,超越了众多医生。这是AI认知能力——它能看见你、听见你、回应你、观察你如何呼吸、如何行走,并实时引导你完成体格检查。接下来几分钟,我将向大家展示三个关键演示,并解析基准测试,让你准确理解其工作原理。让我们深入探索。你好,我是你的虚拟医疗助手。今天有什么可以帮你的?我腹部剧痛。多年来,我们的团队一直致力于研究AI如何有意义地增强医患关系。今天,我们希望提供一个透明的窗口,展示我们的进展。医生们谈论超级智能医疗AI已有70多年。这是最令人着迷的知识挑战——如何评估那些在某些方面像人类专家一样行动,但其他方面却失败的机器?在保持深度临床推理的同时进行非常自然的诊断对话,一直是核心的技术难题。你即将看到我假装是一名急性胰腺炎患者。我能清晰地看到你。你看起来不舒服,这与你描述的疼痛和无法喝水的情况相符。为了帮助确定病因,我想进行一次简短的引导式体格检查。这是一种新型系统,它不仅能在打字文本空间中进行交流,还能说话,更重要的是,能通过摄像头观察患者,并指导患者完成体格检查。疼痛是局限在那个区域,还是会移动到其他地方,比如后背或下腹部?大部分时间都在那个区域,但我后背也有些疼痛。大多数医生看到这个病例,他们的脑子里会尖叫:疼痛是否放射到背部?是否放射到背部?看到推理过程并发现模型本身也在思考这一点,真的很酷。为了帮助确定病因,我想进行一次简短的引导式体格检查。如果可以的话,你能躺下并露出腹部吗?这样我就能看到你提到的区域。不行,但我可以在椅子上做。不,我的肚脐不疼。好的,感谢你澄清肚脐本身不疼。既然疼痛在肚脐周围而且是灼烧感,你能试着按压肚脐上方一点的位置,然后告诉我是否引起压痛吗?哦,是的,真的很疼。AI要求我按压肚脐。它不疼。然后AI根据这一点调整了体格检查要求,说:你能试着按压上方吗?那是上腹部区域,正是急性胰腺炎疼痛的位置——就像这个病例一样。这正是医生会做的事情,令人印象深刻。你可以实时看到它正在响应我们的视频,真正观察我们,并基于所见改变评估。它也在遵循体格检查的最佳实践:先检查你认为患者不疼的区域,了解基线,然后再移动到疼痛区域。这个智能体正在制定一个非常具体的计划,说明需要调查什么以及采取什么策略来减少诊断不确定性。当你按压时疼,还是松开时疼?都疼,真的很疼。它在测试所谓的“反跳痛”。这是一个很好的问题。我个人不会通过远程医疗问患者这个。反跳通常是医生在患者躺下时评估的。这绝对是一个好问题。再说一次,如果我要问反跳痛,我希望患者在我面前。这不是我通过远程医疗会做的事。肚脐周围持续不断的剧烈灼烧痛、严重呕吐且无法喝水,以及按压和松开时的压痛,我担心这可能是严重的医疗问题,比如阑尾炎或胰腺炎。需要立即进行当面评估。请呼叫急救服务,或让别人带你去最近的急诊室。我认为将阑尾炎或胰腺炎纳入鉴别诊断是合理的。有时临床接触不像选择题那样有简单答案。我当然会对这两种不同诊断的概率做出非常不同的排列。最终重要的是下一步行动。从这个角度看,AI系统是完全正确的。下一步将是急诊护理、生命体征、补液、实验室检查,在美国和世界许多地方,几乎肯定会进行CT扫描,从而获得明确诊断。在急诊室,他们可能会先检查你的生命体征,如血压和脉搏,因为呕吐可能导致脱水。然后他们会进行血液检测,寻找感染或炎症的迹象,并可能进行影像学检查,如超声波或CT扫描,看你的阑尾、胰腺或胆囊是否有问题。他们可能会给你静脉输液补水,并用药缓解疼痛和恶心。这听起来是个清晰的计划吗?很有趣,不是吗?你可以在这段视频中看到,这些系统确实取得了进展,它们显然具备识别正确诊断、以有用方式引导患者检查,甚至对严重医疗投诉进行分诊的能力。但另一方面,希望这些视频也展示了该系统仍有很大改进空间。虽然还处于早期阶段,但前景……在下一个案例中,哈佛的医生Jason因眼睑下垂来就诊。这是一个非常有趣的病例,因为它需要好医生提出非常复杂的问题,还要仔细检查患者。患者表现出了我称之为“未被提示的体征”。这对任何观看的人来说当然非常明显。问题是:这对AI系统来说在多大程度上是明显的?在这个案例中,我假装是一名患有重症肌无力的患者。像这样眼睑下垂绝不正常。我们想测试AI是否会看到我的眼睑不正常,并是否会询问。我注意到我的右眼睑最近比左眼睑下垂得更多。我能看到你提到的右眼睑下垂。你第一次注意到这种情况是什么时候?大概一个月前。我抱怨右眼睑下垂,它立即看着我的脸,确认我的眼睑确实下垂。它在思维日志中写道——我们可以查看——“我看到患者的眼睑下垂”。它没有说“哦,看起来他的眼睑下垂”。它是在患者说出之后才说的。这些是与人类和AI系统截然不同的有趣发现。AI系统真的注意到了吗?如果患者继续谈论他有失眠症,它会提起他的下垂眼吗?你注意到瞳孔大小有变化吗?有复视吗?或者眼睛疼痛吗?瞳孔大小没有变化,也不疼,但我确实有时会看到重影。复视在一天中的特定时间更频繁吗?比如当你累的时候?是的,我注意到刚醒来时不太严重。然后过了一两个小时,开始日常活动后……我的眼睑下垂得更厉害,复视也更严重。有一种非常相似的疾病叫兰伯特-伊顿肌无力,它会在一天中逐渐好转。所以它立即问了一个神经科医生知道要问的最重要的相关问题。在思维日志中,我们看到它写道:上睑下垂和复视的疲劳性强烈提示神经肌肉接头疾病,主要是重症肌无力——这是准确的评估。现在,你能抬头看天花板并保持注视大约30秒吗?这并非对每个患者都做的千篇一律的检查动作。实际上你几乎从不做这种体格检查动作。这相当令人印象深刻。这是一种针对远程医疗调整的适当体格检查。也许神经科医生会这样做。我不确定。可能有神经科医生通过远程医疗这样做,但我从未想过这么做。所以看着很酷。根据我们的讨论,最有可能的是重症肌无力。其他可能原因包括兰伯特-伊顿肌无力综合征或类似机械性问题,但疲劳性使重症肌无力成为主要考虑。下一步是进行进一步检查,并转诊给专科医生,比如神经科医生,以确诊并开始治疗。我基本上同意AI模型所说的。这是典型的、几乎是刻板的重症肌无力表现。更重要的是,模型是正确的。还有很多检查要做,其中很多需要当面进行。所以患者应该尽快被神经科医生看到。如果我在初级保健诊所通过远程医疗看到这个患者,我会得出完全相同的鉴别诊断、完全相同的推理和完全相同的下一步。我应该对这种疾病非常担心吗?虽然重症肌无力是一种慢性病,但好消息是它通常很容易通过治疗控制。大多数患者可以过上充实积极的生活。主要需要注意的是,在极少数情况下,它可能影响呼吸肌肉,这就是为什么需要专科医生参与监测。你担心疾病的任何具体方面吗?这和我诊断类似疾病时说的话非常相似——安抚患者,告诉他们这是可治疗的疾病,他们有能力过正常生活。AI在医疗保健中的潜力巨大。但这类具有实时、低延迟、流畅视频模型的技术非常新。正如我们的工作所示,它们会以令人惊讶和微妙的方式表现出优势和局限性。越多视角参与越好。我们希望分享这些视频能帮助人们理解这一点。你好,我是你的虚拟医疗助手。今天有什么可以帮你的?你好,我的右肩很疼,想检查一下。这个例子展示的是,通过实时、低延迟的视频处理,AI系统不仅能采集病史,还能进行体格检查,寻找患者非常细微的线索,同时指导他们进行一系列动作和测试——这是真正的医生在通话中可能会做的事情。你即将看到我的同事Ryu Tano,他是DeepMind的研究科学家,他在假装一名肩部受伤的患者。我们构建了这个场景来展示一个逐渐出现的过度使用损伤。在构建这样的场景时,我们非常具体地规定了哪些信息应该主动提供,哪些信息只有在被明确询问时才应提供。很抱歉听到你的右肩疼。当你尝试抬臂、举过头顶或做特定动作时,疼痛会加重吗?我想是吧。好的,考虑到你的工作,这说得通。在1到10的评分中,1是无痛,10是无法想象的剧痛,你现在怎么评分?4或5分。有时患者进来会试图淡化疼痛,看起来挺舒服,你一开始无法判断他们有多疼。你问这个问题,有时他们会说“我疼到10分”,那么你得比他们说“1或2分”时更严肃对待。有时你能从脸上看出来,但有时真的看不出来。所以这是一个很好的问题,AI问了这个问题很好。我想看看你的肩膀能怎么活动。你能试着将右臂笔直向前抬起,然后向侧面尽量抬高,同时避免太剧烈的疼痛吗?好的,让我试试。向前。是的,疼。是的,有点疼。这一刻特别有趣,因为它很好地展示了我们医疗AI智能体的视频处理能力。例如,查看它的内部思考,你会发现智能体从视频流中注意到非常详细的观察:首先是被测试的特定动作的范围,而且智能体还注意到患者在做这个动作时犹豫了一下。此外,智能体令人印象深刻地列出了还需要测试哪些其他动作,以确定可能的诊断。谢谢你做的。看起来你可以向前抬臂很远,但很疼。现在,请试着将手臂向侧面笔直抬起,同样尽量抬高,同时避免太剧烈的疼痛?哦,是的,很疼,相当疼。我喜欢这次检查的一点是,模型实际上告诉他要做他没做的事。模型让他向前和向侧都做,他只做了一个。然后模型自然注意到他只做了一个,并要求他做另一个。这是非常人性化的——首先要患者做太多事,因为同时做多个体格检查动作在认知上很密集。然后意识到要求太多并回头,也非常人性化。我喜欢这个细节。谢谢你向我展示。你向前抬臂和向侧抬臂时经历的疼痛,加上你提到的僵硬和夜间疼痛,表明你可能有肩袖问题,可能是撞击或肌腱炎,这与你的工作史相符。对于即时处理,我建议继续休息肩部,定期冰敷,并考虑使用非处方止痛药如布洛芬(如果对你安全的话)。请物理治疗师提供定制锻炼也会有益。根据症状是否改善,以后可能需要进一步影像检查如超声波或MRI。它在这里做得很好,识别出即使是肩袖损伤,但还不至于严重到患者无法移动手臂、现在就需要MRI。当我们看患者时,一个重要决定是:现在需要影像吗?需要MRI吗?还是可以给一些时间,通过物理治疗和非处方药如泰诺和布洛芬来恢复?它做出了正确的评估。当Ryu进行这项检查,我们开始看到哪些动作引起疼痛时,我当然开始觉得这听起来像是肩袖肌腱炎。然而,我很清楚还有其它检查需要做。我认为这里展示的可能是过早关闭诊断,还有一些很容易做的体格检查体征可以给我们更大的确定性。我需要手术吗?根据我们的讨论,对于我们怀疑的肩部问题(如肩袖撞击或肌腱炎),手术通常不是首选治疗。我们通常先尝试保守治疗,如休息、调整活动(特别是工作),以及物理治疗。如果这些治疗几个月后没有改善症状,或者有明显的肌腱撕裂,才会考虑手术。考虑到你的工作,明智的做法是暂时避免搬运重物。它做的一切都合适,但只选择了八个最合适测试中的三个。它肯定没有精确定位。特别是,我想看到撞击测试。回顾视频,我认为不能说这绝对是肩袖损伤,也可能是粘连性关节囊炎。鉴别诊断中还有其他项目。但最终,保守治疗(我们称之为物理治疗、休息、冰敷、布洛芬、泰诺等非处方药,看看是否能自行恢复)是正确的决定,并且他们恰当地评估了疾病的急性程度。我认为这是一个有趣的案例,你可以看到模型如何让患者做一系列动作,但并非随机或刻板地遵循规则。相反,每次检查时,AI系统都在尝试解释发现,用这些来筛选最可能的诊断,然后智能地推理接下来应该执行哪些检查。DeepMind做的第一件事是每个AI实验室都声称会做,但几乎没有人真正做到的:他们把模型放在真正的医生面前。一项盲测,面对面,没有营销,没有挑选。如果你看这张图表,最上面一行:医生将AI联合临床医生与现有的临床医生工具(2026年3月医生已经在使用的)进行比较。67%的时间医生更偏好AI联合临床医生。26%偏好现有工具,5%表示中立。但更有趣的是下面一行:他们将其与GPT-5.4 thinking with search(大模型,评论区大多数人每月付20美元的那个)进行测试。AI联合临床医生仍然以63比30获胜。现在,当你思考这一点时,这不仅仅是感觉检查。这是“无害”框架,由学术医生测试所谓的“作为错误”和“不作为错误”——即AI是否在撒谎,以及是否遗漏了关键信息。因为在医学中,AI没说的东西和说的东西同样可能害死你。在98个真实的初级保健查询中,AI联合临床医生在97个案例中记录了零个关键错误。97/98。这很疯狂,因为这是医疗AI以前从未达到的数字。

好了,证据敏感性是一回事,但药物呢?这就是有趣的地方。这是RxQA基准测试。它基于OpenFDA数据构建。其核心是向AI系统提出那种在真实诊疗中医生会问的、开放式的药物问题:药物相互作用、剂量、边缘案例。而这正是几乎所有AI模型历史上都会崩溃的地方,因为LLM是在开放网络上训练的,而开放网络在药物数据方面,懂的都懂——垃圾进垃圾出。AI联合临床医生不仅略微领先,而是全面超越了这项测试中的所有其他前沿AI系统,特别是当问题的提问方式与医生实际提问方式一致时:开放式、模糊、带着真实患者的复杂背景。这种区别很重要。大多数医疗AI基准测试是选择题——A、B、C、D——那只是教科书式测试。真正的医学不提供选项。真正的医学是:“我妈妈已经吃了这个药10年,现在她的脚踝肿了,这有问题吗?”而AI正是通过这类问题获胜的。

好了,它能阅读证据,能推理药物,但它能像医生一样行动吗?这就是第三个基准测试的作用。这也是整个测试中最重要的之一。DeepMind与哈佛和斯坦福的医生合作,构建了20个合成临床场景。然后他们让10位真正的医生扮演患者。他们让AI联合临床医生进行诊疗,然后从140个不同的诊疗技能维度对其进行评估——140个。这不仅仅是回答问题是否正确。这包括同理心、床旁