ChatGPT、Gemini、Claude在临床AI工具比较中表现优于专业医疗AI工具:研究显示ChatGPT, Gemini, Claude beat clinical AI tools: Study

环球医讯 / AI与医疗健康来源:www.beckershospitalreview.com美国 - 英语2026-07-25 14:16:53 - 阅读时长4分钟 - 1524字
一项发表在《自然医学》期刊上的研究显示,OpenAI的ChatGPT-5.2、Google的Gemini 3.1 Pro和Anthropic的Claude Opus 4.6等通用大语言模型在所有医疗基准测试中全面超越了专业临床AI工具OpenEvidence和Wolters Kluwer的UpToDate Expert AI,研究涵盖500个MedQA知识问题、500个HealthBench项目和100个真实临床查询,尽管相关企业质疑研究方法并要求撤稿,但研究团队坚持认为该结果对医疗AI的采购、报销和监管具有重要影响,强调临床AI工具在投入实际应用前应经过独立、真实世界评估。
临床AI工具通用大型语言模型医疗基准测试MedQAHealthBench真实临床查询临床决策支持医疗AI评估
ChatGPT、Gemini、Claude在临床AI工具比较中表现优于专业医疗AI工具:研究显示

OpenAI、Google和Anthropic的通用大型语言模型在一项发表于《自然医学》的研究中,在每一项医疗基准测试中都超过了专业临床AI工具。

研究人员测试了OpenEvidence和Wolters Kluwer的UpToDate Expert AI与GPT-5.2、Gemini 3.1 Pro和Claude Opus 4.6,分三个阶段进行:500个MedQA知识问题、500个测量临床医生对齐度的HealthBench项目,以及从纽约市NYU Langone Health基于HIPAA合规的GPT实例中提取的100个真实临床查询。

根据6月12日发表的研究,前沿模型在所有三项测试中均获胜。在MedQA测试中,Gemini得分为97.4%,而OpenEvidence为89.6%,UpToDate为88.4%。在真实查询基准测试中——由12名临床医生进行盲审并生成1,800个注释——三个前沿模型形成了最高层级,而临床工具的表现不优于Google自动启用的Search AI Overview。

UpToDate的AI拒绝了19%的查询,超过任何其他模型。OpenEvidence在清晰度方面得分最低,作者将其归因于沟通问题而非知识差距。没有任何模型产生的有害内容或幻觉比其他模型更多。

高级作者Eric Oermann博士及其同事认为,这些结果对采购、报销和监管监督具有影响,并呼吁在临床AI工具投入实践前进行独立、真实世界的评估。

OpenEvidence已要求《自然医学》撤回该研究。在6月15日致该期刊的一封信中(Becker's获得),该公司还寻求公开道歉和独立审查,称该论文依赖有缺陷的方法。

该公司表示,由于公开可用的MedQA和HealthBench基准可能已出现在前沿模型的训练数据中,该研究容易受到"污染效应"的影响。同行评审者提出了同样的担忧,作者在论文中承认这些模型"可能在训练期间接触过MedQA或HealthBench"。作者将第三个基准(由真实临床医生查询构建,不存在该风险)指定为研究的主要证据;前沿模型在该指标上也领先。

"我们继续支持我们的研究及其结果,"Oermann博士告诉Becker's。

OpenEvidence还提到了其他评估,包括罗切斯特(明尼苏达州)梅奥诊所的一项研究,称该工具准确且符合指南。

Wolters Kluwer也对研究结果提出异议。Wolters Kluwer Health首席医疗官Peter Bonis博士告诉Becker's,该研究"混淆了临床质量和听起来完整的答案",并依赖于衡量应试能力而非证据评估或临床工作流程中安全使用的基准。

Bonis博士特别反驳了拒绝率问题,称论文将UpToDate Expert AI拒绝回答视为缺陷,而没有确定这些拒绝是否适当。他说,在临床决策支持中,拒绝回答不明确或有风险的提示"可能是更安全的行为"。

他补充说,UpToDate Expert AI最近在涵盖超过15,000个标准的1,669个临床查询上进行了测试,公司称其对99.9%的评估标准提供了符合临床的信息。

《自然医学》拒绝直接回应撤回要求。在给Becker's的声明中,主编João Monteiro博士表示该期刊"欢迎科学辩论",并指出其正式的"Matters Arising"流程用于对已发表论文提交反驳,他表示这允许关注点"通过期刊的编辑流程正式评估",同时原始作者也会做出回应。

【全文结束】