Doctor GPT?人工智能76%的时间能正确回答医疗问题Doctor GPT? AI Gets Healthcare Questions Right 76% of the Time - AOL

环球医讯 / AI与医疗健康来源:www.aol.com美国 - 英语2026-07-29 19:21:16 - 阅读时长9分钟 - 4030字
宾州州立大学的一项研究测试了大型语言模型(如ChatGPT、Google Gemini、Meta LLaMA)对真实患者医疗查询的回答准确性,由九名宾州州立大学医生评估,发现这些模型产生医学上有效答案的准确率约为76%。研究显示,大型语言模型在初级护理和鉴别诊断方面表现良好,但在皮肤科、心理健康及需要测试或图像的病例方面表现欠佳。专家强调这些工具应作为临床医生的补充而非替代品,并讨论了相关伦理问题、现有防护措施以及对持续发展的监管和用户教育的需求,同时指出尽管76%的准确率优于传统搜索引擎自我诊断,但与人类医生约10-11%的误诊率相比仍有差距。
大型语言模型医疗问答准确率76%初级护理鉴别诊断皮肤科心理健康临床医生补充工具医疗伦理用户教育监管防护措施自我诊断
Doctor GPT?人工智能76%的时间能正确回答医疗问题

[导语] 宾州州立大学的Amulya Yadav博士与主持人Jeffrey讨论了一项新的宾州州立大学研究,该研究测试了大型语言模型(ChatGPT、Google Gemini、Meta LLaMA)对真实患者查询的回答。这项由九名宾州州立大学医生评估的研究发现,大型语言模型产生医学上有效答案的准确率约为76%。在这次采访中,Yadav博士解释了大型语言模型在哪些方面表现良好(初级护理、鉴别诊断),在哪些方面表现不佳(皮肤科、心理健康、需要测试或图像的病例),以及这些工具应该如何作为临床医生的补充而非替代品使用。他们还讨论了伦理问题、现有防护措施,以及对不断发展的监管和用户教育的需求。

[杰弗里·斯奈德,广播退休网络]

现在请到的是宾州州立大学的Amulya Yadav博士。Yadav博士,很高兴见到您。感谢您今天早上加入我们的节目。谢谢您邀请我,Jeffrey。很高兴来到这里。

[杰弗里·斯奈德,广播退休网络]

很高兴见到您,博士。我半开玩笑地说,根据您的研究,我可能再也不需要我的初级保健医生了,因为人们正在访问GPT、ChatGPT,并且大多数时候能够得到准确的答案。

[Amulya Yadav,宾州州立大学]

嗯,是的,这取决于我们如何量化"大多数"这个词。我们的研究表明,在许多当代大型语言模型中,包括ChatGPT、Google的Gemini以及Meta的LLaMA系列模型,平均而言,我们收集了来自宾州州立大学社区成员提供的患者查询。

在我们从宾州州立大学社区收集的所有查询中,大型语言模型似乎能够提供有效的答案。我们定义了"有效性",虽然不需要深入形式化定义,但基本上有效性与准确性相当。因此,大型语言模型能够为76%的查询提供准确答案。

也就是说,大型语言模型生成的答案中,大约四分之三的答案是正确的。这种正确性是由宾州州立大学认证的医生评判的。我们有一个由宾州州立医学院九名医生组成的小组,他们负责裁决语言模型生成的答案是否准确、是否有害、是否有同理心等等。

[杰弗里·斯奈德,广播退休网络]

哦,抱歉打断您。我想问一下,您对实际认证的医疗从业者评判这些来自大型语言模型的信息实际上是正确的这一结果有何反应?您对此感到惊讶吗,博士?

[Amulya Yadav,宾州州立大学]

说实话,这让我感到惊讶,但我的惊讶应该没有太大价值,因为我不是医学专家,我是计算机科学家。因此,我的先入之见是语言模型在这方面会表现得很糟糕,无法回答健康查询,缺乏细微差别,无法处理边缘情况,就像我们使用Google进行自我诊断时的常见观念一样。

如果您曾经使用Google搜索,您会知道那些恐怖故事,我们所有人都经历过。我们去Google说我们有头痛,而Google告诉我们这可能是胃癌的征兆,或者一些疯狂的事情。

这就是我心理模型运作的基础。因此,我原本预期语言模型在回答问题时同样糟糕。所以,说实话,我对它们表现得这么好感到惊讶。

另一方面,还有一点需要考虑的是,76%这个数字看起来不错,但与人类医生的误诊率相比如何?这是我在线快速搜索的结果,有几个看起来相当可信的网站表示人类医生的误诊率约为10%或11%。

相比之下,大型语言模型的准确性仍然不如人类医生。76%很好,似乎比从Google进行自我诊断要好得多。

但这是否足以让我们完全取消医疗保险,只需订阅ChatGPT Pro,因为这就是我们所需要的医生?我认为我们还没有达到那个阶段,至少根据我们有限的数据集来看,情况似乎并非如此。

[杰弗里·斯奈德,广播退休网络]

博士,是否存在某些疾病或病症,大型语言模型表现得更好?您知道,我猜没有诊断,它无法告诉我是否有高血压或心脏病,但它可能能够提供关于您所说头痛或某种常见疾病的信息。那么,它在某些领域是否比其他领域表现更好?

[Amulya Yadav,宾州州立大学]

这是一个很好的问题。让我们谈谈它在哪些方面表现良好。您提到需要诊断或需要测试结果才能做出诊断的情况,这些方面ChatGPT或语言模型确实不如其他类别表现得好。

我们在皮肤科方面也看到了它表现不佳的情况,这很合理。您可以想象,大多数皮肤科查询需要人们上传皮肤照片,而现在研究界已经达成了相当多的共识,即基于视觉的语言模型,即理解图像、与图像进行推理的语言模型,不如仅处理文本查询的语言模型工作得好。

因此,每当您需要上传皮肤照片并询问语言模型"您认为这是湿疹吗?这是其他什么问题"时,可以理解的是,它们的表现不如不需要基于图像的查询好。

第三个表现不佳的类别是心理健康查询。这有很多影响,因为有很多投资正在投入到为心理健康、治疗等设置大型语言模型的初创企业和基础设施中。

根据我们有限的样本量,语言模型似乎无法生成很好的回答。有大量的研究表明语言模型非常谄媚,而人类咨询师并不总是应该这样做。他们并不总是应该同意患者,而语言模型有这种本能,想要同意人类要求他们做的任何事情。

我相信您在网上读过相关文章,关于语言模型告诉某人"是的,如果我是你,我也会这样做"的罕见案例,显然您处于非常艰难的境地。正是由于这种谄媚,我们的数据集中的语言模型在生成对心理健康问题的回应方面也表现不佳。

在表现良好的方面,关于一般医疗问题的查询,即您会带去初级保健医生的问题。例如,我有普通感冒症状。我有流感症状等。这类查询,语言模型表现得非常好。

还有一种称为鉴别诊断(Differential Diagnosis)的情况,大型语言模型在这方面也表现得非常好。

[杰弗里·斯奈德,广播退休网络]

那么,您是否认为这可能是拜访医生的补充工具?就像Dr. Dougal并不是医生的替代品一样,这也不一定是医生的替代品,而是一种补充,实际上可以用作帮助医生完善诊断的工具。

它是否可以被医生用来帮助患者?博士,这是它的发展方向吗?

[Amulya Yadav,宾州州立大学]

绝对正确。我认为有多种可能的使用场景。

当然,您完全正确,我们不应该将这些工具视为人类医生的替代品,因为目前它们不是。存在一些真实的使用场景,世界卫生组织的统计数据表明,近一半的世界人口无法获得高质量的医疗保健。

因此,对于那半数无法获得医生服务的人口,即使他们可能有钱,或者可能根本没有钱去看医生,能够访问一个可以给出正确答案的医疗聊天机器人——76%的时间是正确的——总比完全没有医生要好。

因此,如果您属于那半数人口且无法获得医生服务,这是一个非常好的工具。

即使在您可以获得高质量医疗服务的情况下,这也应该仅被视为一种补充。我完全同意,这些语言模型的输出对医生最有价值,因为我认为我们现在都了解,即使在美国,医疗保健的需求与供应之间也存在巨大的不匹配。

医疗保健的需求远远大于医疗保健的供应。初级保健医生的等候时间很长等等。因此,这种工具可以真正加快或提高医生的工作效率,使他们能够利用有限的高质量时间为更多患者提供服务,而不牺牲他们提供的服务质量。

因此,这确实是思考这个问题的好方式。

[杰弗里·斯奈德,广播退休网络]

让我问您关于伦理方面的最后一个问题。我想美国医学会和其他一些联邦州监管机构可能会希望设置一些防护措施。您认为这样做有意义吗?

不仅医生使用它作为工具,而且您提到了自杀,我记得这些可怕案例中的一些,但我们是否需要一个框架?在涉及医疗方面时,是否有必要为这些大型语言模型设置一些约束框架?

[Amulya Yadav,宾州州立大学]

绝对需要。我们当然需要防护措施,需要一个防护措施的框架,需要监管等。但重要的是要理解,任何创建防护措施框架的尝试——顺便说一句,当今的大型语言模型中确实存在防护措施。

我们谈到的那些恐怖案例,即大型语言模型鼓励某人自我伤害,这些案例很少见,主要是因为存在防护措施。

另一点需要注意的是,由于问题的多样性和向大型语言模型提问的方式的多样性,这总是一场猫捉老鼠的游戏。您可以制定一组防护措施,它们对预期使用场景效果良好,但很快就会有另一组用户以稍微不同的方式提问。

而该防护措施将无法适应这种情况。有一条关于我们所说的对抗性或破解大型语言模型的研究线,专门关注如何让大型语言模型说出它们不应该说的话,如何让大型语言模型绕过内部设置的防护措施。

因此,这总是一场猫捉老鼠的游戏。我认为更重要或更有用的思考方式是,我们需要——当然需要框架。我们需要监管,这个框架和监管需要适应。它需要不断发展,因为这些大型语言模型也在不断进化。

但更重要的是,患者和医生都需要意识到这些语言模型不应被视为替代品。无论它们生成什么,都不应被视为必要。我们需要让自己意识到,随着我们越来越多地听到这个信息,它会内化:这些模型生成的任何内容都不是绝对真理。

不应将其视为绝对真理。对它应该持保留态度。大型语言模型告诉您可能患有癌症,这不需要说明任何问题。

因此,在使用这项技术时保持清醒头脑并为了我们的利益使用它非常重要。如果一个人使用大型语言模型进行自我诊断,收到不利诊断,但具有这种情感成熟度:这只是个语言模型,这不是医生,但它这样告诉我,也许我应该去看真正的医生检查一下。这将是良好地使用这项技术的方式,而不是惊慌失措,认为我的生活即将发生不好的事情。

因此,与监管部分相比,我们更需要这种意识。

[杰弗里·斯奈德,广播退休网络]

是的,嗯,就像任何工具一样,您需要了解它,需要接受关于它的教育,并且在使用工具时需要有正确的视角。Yadav博士,很高兴见到您,很好的研究。非常感谢您加入我们,我们期待很快再次邀请您参加我们的节目,先生。

[Amulya Yadav,宾州州立大学]

谢谢您,Jeffrey。

本文最初由TheStreet于2026年6月10日发布,首次出现在退休版块。

【全文结束】