AI模型在临床推理测试中表现超过医生AI model outperforms doctors in clinical reasoning tests

环球医讯 / AI与医疗健康来源:www.news-medical.net美国 - 英语2026-08-17 18:21:42 - 阅读时长5分钟 - 2252字
一项发表在《科学》杂志的最新研究显示,OpenAI o1大型语言模型在临床推理测试中表现超过医生,在NEJM CPC挑战中准确率达到78.3%,在管理推理任务中得分89%,远超医生的34%。研究涵盖五个实验基准和真实急诊科场景,表明AI可能提供可靠临床第二意见,但也指出文本输入限制和多模态医学现实的差距,强调需要进一步临床试验验证其实际应用价值,同时提醒不能将AI视为完全替代医生的解决方案,而应探索人机协作的最佳模式。
临床推理AI诊断医生大型语言模型急诊科临床决策诊断准确性临床第二意见医学难题急诊分诊临床护理患者护理
AI模型在临床推理测试中表现超过医生

AI模型在临床推理测试中表现超过医生

一项新研究表明,AI可以在具有挑战性的诊断任务上匹配或超越医生。然而,关于这些系统在实际临床护理和决策中的表现,关键问题仍然存在。

研究:《大型语言模型在医生推理任务上的表现》。图片来源:MUNGKHOOD STUDIO/Shutterstock.com

在最近发表在《科学》杂志上的一项研究中,研究人员对OpenAI o1大型语言模型(LLM)与数百名医生进行了全面评估,以测试其在复杂任务上的临床推理表现。该研究包括五个实验基准和一项真实的急诊科研究的数据收集,涵盖"黄金标准"医学难题和真实世界急诊室场景。

研究结果表明,人工智能(AI)模型在多项任务中普遍超过人类医生基线,表明先进模型可能已经超过了现有的许多临床推理基准测试。这项研究表明,在不久的将来,AI可能超越信息检索,提供复杂可靠的临床第二意见。

早期AI在应对现实世界患者复杂性方面存在困难

历史记录显示,自1950年代以来,医学界一直在寻求能够进行诊断复杂疾病所需细微逻辑的计算系统。65多年来,随着旨在实现这一要求的系统的发展,《新英格兰医学杂志》(NEJM)临床病理病例讨论会(CPC)系列——复杂的现实医学难题——一直作为它们的最终测试。

现代人工智能(AI)时代的到来,为这些具备临床推理能力的计算系统带来了新一代的希望。然而,相关综述显示,早期AI尝试依赖于僵硬的符号规则,难以应对患者护理的"混乱"现实。

此外,尽管之前几代大型语言模型(LLM)——在大量文本上训练以预测和生成类人语言的AI系统——显示出潜力,但它们往往缺乏与人类水平的比较基准。然而,随着新型LLM开始表现出"基准饱和",研究人员现在旨在确定它们是否真能通过临床不确定性进行推理,还是仅仅默认复述记忆的事实。

大规模比较AI与医生表现

本研究旨在调查最新一代AI模型(特别是OpenAI的o1-preview模型)是否能够在多个不同的临床诊断和管理挑战中匹配或超过人类专家的表现。该研究方法多样的测试环境包括利用143个案例(NEJM CPC)的医学数据的传统难题,评估诊断准确性。

同样,来自NEJM Healer课程的20个案例——一个用于评估临床逻辑的数字平台——被用来评估模型的推理过程。在一项基于波士顿的双盲研究中测量了真实世界表现,该研究使用直接从主要学术急诊科(ED)收集的76份非结构化患者记录,将o1与两位专家主治医生进行测试。

值得注意的是,该模型的表现与包括住院医师(培训中的医生)和主治医师(高级专家)在内的数百名从业者的数据集进行了比较。统计分析包括Bond量表来测量诊断准确性,以及修订版IDEA(R-IDEA)评分——一个10分的验证量表,用于评估临床医生记录其临床推理的质量,以评估模型思维过程的质量。

AI在多样化临床任务中超越医生基准

该研究对NEJM评估数据的统计分析显示了基本一致的结果:AI反复超过人类基线。例如,在NEJM CPC挑战中,o1-preview被发现在78.3%的情况下在其列表中包含正确诊断。当特别比较包含在训练数据集中的相同70个案例时,o1-preview达到了88.6%的准确率,显著高于GPT-4的72.9%(P = 0.015)。

AI的管理推理——决定患者下一步最佳步骤的能力——被观察到特别令人印象深刻。在一组五个复杂案例中,o1-preview取得了89%的中位数分数。相比之下,使用搜索引擎和医学数据库等常规资源的医生仅获得34%的中位数分数(P < 0.001)。

在真实世界急诊科(ER)实验中,o1 AI模型与其人类专家竞争对手之间的差距在"初始分诊"阶段最为明显。这一阶段在临床上被认为是一个高风险时刻,因为它发生在患者首次到达、信息稀缺且需要快速决策时。

在这里,o1模型识别出正确诊断的比例为67.1%,而两位专家医生分别达到55.3%和50.0%。此外,在NEJM Healer案例中,AI在80个实例中的78个实现了完美的R-IDEA评分,优于住院医师和主治医师(P < 0.0001)。

然而,并非所有比较都显示出统计学上的显著改进,在某些任务中,表现与先前模型或医生相当。作者还指出,随着更多临床信息的可用,人类和AI的表现都有所提高,并且模型输出仍然表现出不确定性。

AI在临床推理基准上达到高水平表现

本研究可能是第一个得出结论,即LLM现在已经达到了计算和推理进步的水平,使它们能够在基准任务上提供高级诊断支持。

然而,作者指出重要限制:该研究仅关注文本输入,而现实世界医学是"多模态"的,涉及视觉线索、体格检查和患者声音。此外,测试集中在内科和急诊医学上,不能推广或指示模型在外科等领域的表现。作者还强调,一些评估依赖于精选或教育案例,与真实世界临床工作流程相比,可能会高估性能。

尽管有这些注意事项,研究人员争辩说,这些工具的快速改进突显了迫切需要进行前瞻性临床试验,以测试它们在真实世界患者护理环境中的临床适用性,并更好地理解临床医生和AI系统如何协同工作。

期刊参考:

Brodeur, P. G., 等. (2026). 大型语言模型在医生推理任务上的表现. 《科学》, 392(6797), 524–527. DOI: 10.1126/science.adz4433.

【全文结束】