虽然大型语言模型(LLMs)在诊断对话中已显示出潜力1,但其在有效管理推理方面的能力——包括疾病进展、治疗反应和安全药物处方——仍未得到充分探索。我们通过一种基于LLM的新代理系统,将Articulate Medical Intelligence Explorer (AMIE)1−3之前已证明的诊断能力扩展到多访次临床管理和对话优化领域。为了使AMIE的推理建立在权威临床知识基础上,它利用Gemini的长上下文能力4,将上下文检索与结构化推理相结合,使其输出与最新的临床实践指南和药物处方集保持一致。
在一项随机、双盲的虚拟客观结构化临床考试(OSCE)研究中,AMIE与21名初级保健医生(PCPs)在100个多访次病例场景中进行了比较,这些场景旨在反映英国NICE指南和BMJ最佳实践指南。经专家评估,AMIE在管理推理方面不劣于PCPs,并且在治疗和检查的精确性以及与临床指南的一致性和基础性方面得分更高。
为了评估药物推理能力,我们开发了RxQA,这是一个源自两个国家药物处方集(美国、英国)并由认证药剂师验证的多选题基准。尽管AMIE和PCPs都能从访问外部药物信息的能力中受益,但AMIE在更高难度的问题上表现优于PCPs。
虽然在实际应用前还需要进一步研究,但AMIE在各项评估中的出色表现标志着对话式AI作为疾病管理工具的重要一步。
【全文结束】

