医学:领先的大型语言模型明显胜过专业的小型语言模型Medizin: Führende LLMs schlagen spezialisierte kleine Sprachmodelle klar | heise online

环球医讯 / AI与医疗健康来源:www.heise.de德国 - 德语2026-07-25 10:34:35 - 阅读时长5分钟 - 2178字
一项发表在《自然医学》上的研究表明,在医学测试中,领先科技公司(OpenAI、Google和Anthropic)的大型语言模型表现优于专业医学AI系统。研究通过三个不同测试(MedQA Benchmark、HealthBench和真实临床查询基准)评估了GPT-5.2、Gemini 3.1 Pro Preview和Claude Opus 4.6等通用模型与OpenEvidence、UpToDate Expert AI等专业系统的性能,结果显示通用模型在医学知识准确率、临床回答质量和实用性方面均明显领先,这对医疗机构选择AI系统和相关监管政策具有重要启示意义,表明AI系统在医学领域的效能更取决于其基础模型能力而非专业化程度。
医学AI大型语言模型专业临床AI系统医学知识测试临床正确性临床安全性MedQAHealthBenchRCQ
医学:领先的大型语言模型明显胜过专业的小型语言模型

一篇发表在《自然医学》(Nature Medicine)上的最新研究比较了专业临床AI系统(OpenEvidence和UpToDate Expert AI)与领先AI公司(OpenAI、Google和Anthropic)的大型语言模型(LLMs)。在该研究的各项测试中,这些通用LLM的表现均优于专业医学AI系统。

许多医生使用专门针对医学问题和研究的AI应用。提供商声称,他们的系统经过领域特定的训练数据或检索增强生成(RAG)技术专门优化,非常适合在医学中应用。

纽约(NYU Langone Health)的一个研究团队在《自然医学》期刊上发表的一项研究中,比较了两个专业医学AI系统与领先AI公司的通用LLMs。结果非常明显:在所有三个测试领域中,OpenAI、Google和Anthropic的LLMs都优于专业临床AI。

比较通过三个不同的医学测试

被研究的临床AI工具OpenEvidence和UpToDate Expert AI均面向医疗专业人员,用于回答专业问题。它们与领先的LLMs GPT-5.2(OpenAI)、Gemini 3.1 Pro Preview(Google)和Claude Opus 4.6(Anthropic)进行了比较。在部分研究中,Google Search AI Overview也被纳入比较,因为该功能在医生日常工作中随时可用。

研究设计包含三个部分。第一部分中,系统回答了500个美国医学执照考试风格的医学问题(MedQA Benchmark)。第二部分包括500个来自HealthBench的任务,这是一个根据医生标准评估医学回答的基准测试。第三部分,特别是非常贴近实际的部分,研究人员开发了一个"真实临床查询基准测试(RCQ)"。他们使用了100个匿名的真实问题,这些问题实际上是医生在日常工作中向NYU Langone Health的GPT实例提出的。这些针对真实临床问题的回答由12名美国医生进行盲测和随机评估。评估标准包括临床正确性、完整性、安全性和易懂性,评分范围为1-4分。总共产生了1800个模型-问题-评估结果。

通用LLMs在医学知识测试中表现更好

在传统的医学知识基准测试MedQA中,Gemini以97.4%的准确率位居榜首,而GPT-5.2达到94.2%,Claude达到90.2%。两个专业临床系统在此项测试中仅分别获得89.6%(OpenEvidence)和88.4%(UpToDate AI)的准确率。

在HealthBench测试中,通用LLMs也表现更好。GPT-5.2获得100分中的88.0分,Gemini获得79.3分,Claude获得77.0分。OpenEvidence和UpToDate Expert AI分别仅获得62.6分和61.3分,明显落后。

在RCQ基准测试中,医生们提出的真实匿名问题,通用LLMs也能更好地回答。它们在四分制评分标准中平均获得3.62分(Gemini)、3.54分(GPT-5.2)和3.52分(Claude),而OpenEvidence获得3.24分,UpToDate Expert AI获得3.17分。Google AI Overview(即Google的带AI回答的通用搜索功能)以3.27分的成绩大致处于医学系统水平。

这些结果与人们直观的预期相悖,即经过医学优化的AI在医学问题上应该优于领先科技公司的通用系统。作者推测,领先通用LLMs更丰富的训练数据和更快的开发周期可能在许多任务中比后续针对医学数据的专业化更重要。

完整性、结构和遗漏方面的问题

在医生对回答的评估中,各系统在安全性方面没有统计学上的显著差异。但这并不意味着专业系统的回答同样好。在医生评估者的自由文本注释中,OpenEvidence和Google AI Overview特别频繁地被指出存在不完整的临床内容和与安全相关的遗漏。OpenEvidence还因回答相对混乱或难以理解而受到批评。

此外,UpToDate Expert AI拒绝回答的频率明显高于其他系统。在RCQ测试中,UpToDate Expert AI拒绝回答了19%的查询。而通用LLMs的这一比例仅为1%至3%。

为什么专业化并不自动带来优势

研究人员强调,由于系统的专有架构,他们无法确切解释为什么临床系统表现较差。一种可能的解释是,规模更大、更通用的LLMs在需要结合医学知识、推理和清晰沟通的任务中,从其规模和广泛知识中获益。该研究不应被视为对所有方法的最终排名。作者明确指出,高度专业化的细分领域、复杂的本地工作流程或机构自有模型可能会产生不同的结果。

对医疗机构和监管的意义

这些结果对医院和诊所很重要,因为专业医学AI产品通常具有机构可信度。但研究表明,一个AI系统并不会仅仅因为是专门为医学开发的就自动更好。至少在所研究的任务中,OpenAI、Google和Anthropic的通用模型明显优于临床AI系统。

对于医疗健康AI的采购、报销和监管,这带来了重要影响。关键应该是一个系统在独立测试和实际任务中的表现如何,而不是它是否被营销为临床专业产品。因此,作者建议在将AI系统广泛整合到临床工作流程之前,应进行更严格的独立评估。

【全文结束】