人工智能系统在临床推理任务方面正迅速提升,但研究人员表示,这项技术的发展速度已远远超过了实际医疗应用所需的安全监管框架。
弗林德斯大学专家在《科学》杂志上发表的一篇新评论警告称,尽管先进的人工智能模型在受控研究中已经达到——甚至在某些情况下超过了——医生级别的诊断水平,但这并不意味着它们已经准备好在医院或诊所中部署使用。
这篇评论附带了一项重大国际研究,该研究表明OpenAI的首款推理模型o1-preview能够逐步处理诊断场景,并达到与经验丰富的临床医生相当的准确率。
"医疗决策复杂、风险高且具有深刻的人文性,仅凭准确率——特别是仅基于文本案例的准确率——并不能保证系统对患者是安全的,"共同作者、博士生埃里克·科内利斯(Erik Cornelisse)表示。
科内利斯解释道,最新一代大型语言模型代表了从简单的问答工具向能够进行"看似人类临床推理"的算法转变,但他警告称,这种推理仍局限于狭窄的人工条件。
在一项实验中,该模型在88.6%的已发表临床病理会议案例中达到了精确或近乎精确的诊断,表现优于GPT-4,并在多项指标上超过了医生。在真实的急诊科案例中,该模型在分诊时的诊断准确率达到67.1%,高于两名主治医生。
但弗林德斯大学的研究人员表示,这些结果必须谨慎解读。
体格检查、视觉和听觉线索、患者病史、社会背景以及对结果的责任担当仍然是安全医疗的核心,而这些正是AI目前还无法独立操作的领域。即使GPT-5.3和Gemini 3.1 Pro等新型模型整合了图像、音频和视频等多模态输入,作者们重申,严格的评估必须跟上技术发展的步伐。
高级作者、副教授阿什·霍普金斯(Ash Hopkins)表示,AI的潜力是真实的,但风险也同样存在。
"AI系统已经证明它们能够通过类似医生的方式推理临床问题,特别是在用于培训临床医生本身的相同场景中。这为未来支持临床医生提供了真正的机会,"他说道。
"但临床护理中需要有意识、受控的整合。"
该评论强调了评估不足的系统所伴随的、有据可查的危险,包括偏见、不公平的医疗以及意外的患者伤害。
过去的例子包括加剧健康支出中种族差异的算法,以及对紧急情况分诊不足的面向消费者的AI工具。作者认为,独立评估必须严格、透明,并以人类临床医生为基准,以确保开发者承担相应责任。
他们还警告称,部署速度已超过监管速度。2026年1月,OpenAI推出了ChatGPT Health,这是一个作为个性化健康信息服务推广的消费者工具。
尽管该工具并非为分诊而设计,但在一项独立评估中,它尝试进行分诊任务,并对超过一半的紧急情况分诊不足。研究人员表示,如果没有明确的任务定义和人类对照,就无法确定此类系统是改善还是危及患者护理。
展望未来,弗林德斯大学的研究人员认为,对医疗AI的热情必须与强有力的治理、更清晰的评估标准以及对现实世界患者结果的关注相匹配,而不是仅仅关注基准性能。
"我们不允许医生在没有监督和评估的情况下执业,AI也应被要求达到类似的标准,"科内利斯先生说道。
霍普金斯教授表示,目标应该是改善护理的技术,而不是仅在研究中表现良好的工具。
"患者值得拥有能改善现实世界护理的技术,而不是仅在研究中看起来令人印象深刻的系统,"他说道。
他补充道,通过精心设计、强有力的监管和严格的测试,AI可以成为"一个强大的工具,为全球医疗系统提供更安全、更公平和更有效的护理。"
【全文结束】

