核心要点
- 大多数测试大语言模型(LLM)医疗推理能力的研究缺乏医生基准对照。
- 在六项有人类基准对照的实验中,一种复杂的大语言模型表现与医生和其他人工智能工具相当甚至更优。
- 作者强调,人工智能不会取代医生,但需要通过临床试验测试这些工具。
一项新研究表明,在六项实验中,一种大语言模型(LLM)在诊断和管理推理任务方面的表现达到或超过了数百名专家医生。
哈佛医学院生物医学信息学系的阿俊·K·马奈(Manrai)博士及其同事在《科学》杂志上报告称,该大语言模型的优势在急诊科早期分诊中最为明显,它能够准确识别出67.1%病例的确切诊断或非常接近的诊断,而两位医生的准确率分别为55.3%和50%。
在这项实验中,研究人员将未经数据整理的患者电子健康记录直接复制粘贴到大语言模型中,以模拟其在现实世界中的实用性。但该大语言模型在鉴别诊断、诊断测试选择和其他任务的评估中也表现出色。
作者写道:"总体而言,我们的研究结果显示,大语言模型现在在鉴别诊断、临床推理和管理推理方面表现出显著的性能,并且在多个领域超越了先前的模型代际甚至人类临床医生。"
马奈告诉《今日医学页面》:"这篇论文不断给我带来惊喜。"
他表示,他认为研究结果并不意味着人工智能(AI)将取代医生,但"我们正见证一项将重塑医学的真正深刻的技术变革,现在我们需要通过严格进行的前瞻性临床试验来评估这项技术。"
在一篇随刊社论中,澳大利亚阿德莱德弗林德斯大学的阿什利·霍普金斯(Hopkins)博士和埃里克·科内利斯(Cornelisse)认同,人工智能在临床实践中的应用需要通过随机试验来证明其在现实应用中的益处。
他们指出:"尽管评估方法正在进步,但人工智能系统的部署速度已超过评估速度。在经过验证的任务上准确并不保证部署的系统会局限于该任务。" 例如,面向患者的ChatGPT Health宣称每天能够处理超过4000万个与健康相关的问题,但它并非专为临床分诊而设计。然而,它仍会执行分诊任务而不会拒绝。
他们写道,虽然这项研究表明人工智能在某些诊断任务上的表现与医生相当甚至更好,但在医疗保健中,人工智能预计将与临床医生协作——"临床医生提供监督、情境判断和问责",而非取代医生。
研究详情
马奈指出,计算机是否能像医生一样思考或推理是一个存在数十年的问题,但近年来,人工智能已变得极为复杂。关于大语言模型诊断和管理能力的现有文献大多缺乏人类医生的基准对照,且集中在狭窄的诊断任务和经过整理的临床病例上。
为解决这一差距,研究团队系统地评估了OpenAI o1预览版(一种推理模型大语言模型)的医疗推理能力,并将其与先前研究中的医生基准进行对比。
研究人员首先使用《新英格兰医学杂志》(NEJM)发表的143个临床病理讨论案例评估o1-preview,由两名医生评估其鉴别诊断的质量。大语言模型在78.3%的病例中包含了正确诊断,在52%的病例中其首先建议的诊断是正确的。当扩展到包括可能有帮助或非常接近的诊断时,o1-preview在97.9%的病例中是准确的。
对于136个病例的子集,他们测试了o1-preview选择下一个诊断测试的能力。在87.5%的病例中,所选的测试计划被认为是正确的,在11%的病例中会有帮助,在1.5%的病例中选择了无益的测试。
研究团队还使用《新英格兰医学杂志》Healer课程中的20个临床推理案例评估o1-preview,这些案例在先前研究中曾用GPT-4进行过评估。在80个案例中的78个,o1-preview获得了完美的Revised-IDEA评分——这是一种评估记录临床推理四个核心领域的有效10分制量表。这显著优于GPT-4(80个案例中有47个)、主治医师(80个案例中有28个)和住院医师(72个案例中有16个)(所有P<0.0001)。
o1-preview的下一个测试是先前研究中的五个临床病例,这些病例呈现后会有一系列关于管理下一步的问题。o1-preview的病例平均得分为89%,再次优于GPT-4(中位数42%)、能够使用GPT-4的医生(中位数41%)和使用常规资源的医生(中位数34%)。
OpenAI o1-preview还使用先前研究中的六个临床病例进行测试,这些病例比较了GPT-4与普通医生。大语言模型的病例平均得分为97%——再次高于GPT-4、能够使用GPT-4的医生和使用常规资源的医生。
最后,他们使用五个初级保健主题的病例测试o1-preview的诊断概率推理能力。大语言模型总体上略微优于GPT-4,而临床医生的估计值变异性明显大于任一AI系统。
作者指出,这项研究仅反映了OpenAI o1的预览版,更新的模型已经存在;仍需更多研究来比较这些更新的模型。此外,他们的研究集中在急诊医学和内科学,因此研究结果并不适用于所有专业领域。而且,这些实验纯粹基于文本,没有临床医生通常用来形成回应的听觉或视觉信息。
【全文结束】

