AgentClinic让医疗AI接受更真实的诊断测试AgentClinic puts medical AI through a more realistic diagnostic test

环球医讯 / AI与医疗健康来源:www.news-medical.net美国 - 英语2026-08-17 17:06:18 - 阅读时长6分钟 - 2674字
这项研究介绍了AgentClinic,一个用于评估临床AI代理的多模态基准测试系统,通过模拟真实诊疗环境考察AI在信息收集、不确定性处理、工具使用、图像解读和应对偏见等方面的综合能力,研究表明AI模型在模拟临床环境中的表现与在静态医学考试中存在显著差异,Claude 3.5 Sonnet在多项测试中表现最佳,但所有模型的诊断准确率均受到交互次数、工具使用和语言等多种因素影响,提示AI在医疗领域的应用仍需更接近真实场景的评估方法。
医疗AIAgentClinic临床诊断测试临床诊疗模拟医学AI评估诊断准确率医学影像解读临床偏见医学大语言模型电子健康记录
AgentClinic让医疗AI接受更真实的诊断测试

一项新基准测试表明,仅通过医学考试是不够的;临床AI代理必须在模拟患者诊疗过程中收集信息、处理不确定性、使用工具、解读图像并应对偏见。

最近发表在《npj Digital Medicine》期刊上的一项研究介绍了一个多模态代理基准测试AgentClinic,用于在模拟临床环境中评估临床人工智能(AI)代理。

构建能够解决广泛问题的交互式系统是AI的主要目标之一。最近的许多大型语言模型(LLMs)已经解决了困难问题,有些甚至是人类难以应对的,并且在医师资格考试中超过了人类的平均分数。然而,几个限制因素阻碍了它们在实际临床环境中的应用。

临床工作是多层面的,涉及顺序决策,需要在有限资源和有限信息的情况下处理不确定性。这种能力在当前的评估中并未得到体现,因为在当前的评估中,所有必要数据都呈现在病例摘要中,而LLMs的任务是回答问题或选择最可能的选项。

作者指出,在静态医学问答任务上的出色表现对在交互式AgentClinic环境中的表现只有微弱的预测性。在某些情况下,当静态病例转换为AgentClinic的顺序格式时,诊断准确性急剧下降。

AgentClinic研究设计与基准结构

在本研究中,研究人员提出了AgentClinic,这是一个用于在模拟临床环境中评估LLM的多模态代理基准测试。该基准测试包含四个语言代理:测量代理、医生代理、患者代理和协调员代理。每个代理都有特定的指令,并提供其他代理无法获取的独特信息。医生代理是其性能由其他代理评估的模型。

研究人员使用基于美国医师执照考试题型的MedQA数据集问题、《新英格兰医学杂志》(NEJM)病例挑战以及匿名的MIMIC-IV电子健康记录来构建基于医学相关场景的代理。这些问题涉及基于症状的诊断,用于构建提示模板。对于AgentClinic-MIMIC-IV和AgentClinic-MedQA,问题分别从MIMIC-IV和MedQA数据集中选取。

使用GPT-4生成包含病例信息的结构化输入文件,并对病例场景进行了人工验证。通常,医生代理被赋予目标;患者代理接收患者的症状和病史;测量代理接收体格检查结果;协调员代理接收正确诊断。在AgentClinic-MedQA上评估了11个LLM的准确性,每个模型都作为医生代理通过对话诊断患者代理(GPT-4)。

在做出诊断前,允许医生代理与患者和测量代理进行20次交互。此外,使用相同的约束条件和指令评估了三名人类医生的表现,尽管这个小的临床医生样本应谨慎解释。Claude 3.5 Sonnet表现出最高的准确率62.1%,其次是OpenBioLLM-70B(58.3%)和医生(54%)。

AgentClinic在不同模型、工具和模态中的表现

此外,在AgentClinic-MIMIC-IV上,Claude 3.5 Sonnet的准确率最高(42.9%),其次是GPT-4(34%)和GPT-3.5(27.5%)。将交互次数减少到10次会显著降低准确率至25%,而将交互次数增加到30次也会降低准确率。医生代理的准确率因患者代理而异;GPT-4患者代理比Mixtral-8x7B或GPT-3.5患者代理获得更高的准确率。

接下来,研究人员评估了六种代理工具对诊断准确率的影响:反思思维链(CoT)、笔记本、零样本CoT、使用教科书资源的自适应检索增强生成、使用网络资源的自适应检索增强生成以及单样本CoT。Claude 3.5 Sonnet使用笔记本工具表现出最佳性能,平均准确率和峰值准确率分别为51.3%和56.1%。GPT-4o和GPT-4在大多数工具上获得了适度的改进,但工具的使用并非对所有模型都有益。

此外,提示中包含了隐性偏见(受文化和社交规范影响的无意识关联,例如性别偏见)和认知偏见(判断中偏离理性和规范的系统性模式,例如近因偏见),以评估它们对诊断准确率的影响。对于GPT-4,患者和医生认知偏见的准确率分别降至48%和50.3%,患者和医生隐性偏见的准确率分别降至51.3%和50.5%。该基准测试还评估了模拟患者的信心、治疗依从性以及再次咨询同一位医生的意愿,但这些评分来自LLM模拟的患者,而非真实患者。

接下来,研究团队使用来自MedMCQA数据集涵盖九个医学专科的病例报告问题检查了专科病例。Claude 3.5 Sonnet始终是表现最佳的模型,平均诊断准确率为66.7%,在内科、耳鼻喉科和妇科表现出色。表现因专科而异,这表明基于对话的诊断可能与静态多项选择医学测试不同。接下来,研究团队评估了四个多模态LLM在诊断环境中的表现,该环境还需要理解图像解读。

研究人员还在七种语言上评估了多语言病例:英语、中文、法语、西班牙语、印地语、波斯语和韩语。大多数模型在英语中表现最佳,在其他语言上表现出显著差异,而Claude 3.5 Sonnet保持了最强的整体多语言性能。

为此,研究使用了来自NEJM病例挑战的120个问题。当图像最初提供给医生代理时,Claude 3.5 Sonnet的诊断准确率为37.2%,其次是GPT-4(27.7%)、GPT-4o(21.4%)和GPT-4o-mini(8%)。当图像由代理请求提供时,Claude 3.5 Sonnet、GPT-4、GPT-4o和GPT-4o-mini的准确率分别为35.4%、25.4%、19.1%和6.1%。

AgentClinic对临床AI评估的意义

总体而言,LLM需要通过超越静态问答基准的新策略进行评估。AgentClinic提供了一个简化的临床环境,包括代表协调员、患者、医生和测量的代理,代表了构建对话驱动、更具交互性的基准测试的一步,该测试评估LLM在不同、多模态和挑战性环境中的顺序决策能力。然而,作者警告说,AgentClinic仍然是临床护理的简化模拟,使用基于LLM的患者、测量和协调员代理。他们还指出专有模型可能存在数据泄露风险,并强调人类比较数据仅来自三名临床医生。

因此,这些发现应被解释为基准测试性能,而非任何模型已准备好进行自主临床诊断。

期刊参考:Schmidgall S, Ziaei R, Harris C, 等. (2026). AgentClinic: a multimodal benchmark for tool-using clinical AI agents. npj Digital Medicine. DOI: 10.1038/s41746-026-02674-7

【全文结束】