每天,数百万美国人使用ChatGPT等人工智能工具提出医疗问题。医生也在使用AI:三分之二的美国医生报告定期以某种形式使用大语言模型,约五分之一会就患者护理问题咨询AI。然而,一些关键问题仍然悬而未决:回答医疗问题的最佳AI是哪款?AI能错得多离谱?
斯坦福大学、哈佛大学等多个机构团队发布的最新研究——恰如其分地命名为《医疗风险的大量选项危害评估》(NOHARM)——给出了迄今为止最严谨的答案。所有测试AI工具的NOHARM评分完整列表见文末。
如何评判一个AI回答医疗问题的能力
历史上,大多数对医疗AI的评估都集中在知识测试上。例如,AI能否通过医疗执照考试的选择题,在教科书式的干净病例中正确命名诊断?
但问题在于:通过医学委员会考试与安全地管理真实患者是截然不同的技能。
为了评估AI在真实临床护理中的表现,研究团队构建了一个包含100个真实医生向专科医生咨询病例的数据库,这些病例来自斯坦福医疗保健系统的电子咨询系统。这些病例是初级保健医生提交的真实、微妙的临床问题。
每个病例中,29位经过委员会认证的专科和亚专科医生审查了AI可能建议的行动。每项行动根据临床适宜性以及推荐或不推荐该行动可能造成的危害进行评分。临床行动的例子包括安排特定检查、开具药物或建议患者前往急诊科。
值得注意的是,专家们在超过95%的情况下对适宜性达成一致,这意味着答案反映了临床共识。他们总共生成了12,747条专家标注,涵盖4,249个临床决策点。
回答医疗问题的最佳AI工具是哪些?
研究团队对31个工具针对临床判定病例进行了测试。测试的AI工具包括主要的商业AI程序、开源系统以及专门的医疗AI平台。结果公布在一个公共网站上,以实时排行榜形式呈现,团队计划随着新AI模型的出现进行更新。
在第一轮评估中,总体表现最佳的是AMBOSS LiSA 1.0,这是一个基于医学知识库的检索增强AI系统。其得分为62.3%,意味着AI模型推荐的行动与医生标注的正确行动匹配率为62.3%。
这个分数看起来较低。这是因为每个病例包含多个行动层面的决策,包括安全陷阱和对有害推荐的惩罚。这使得即使对于强大的AI模型来说,也具有挑战性。
紧随其后的是谷歌的Gemini 2.5 Pro(59.9%)、Glass Health 4.0(59.0%)、OpenAI的GPT-5(58.3%)和Anthropic的Claude Sonnet 4.5(58.2%)。排名垫底的是几个较小的“mini”模型变体——GPT-4o mini、o1 mini、o3 mini和o4 mini——得分在42%–49%范围内。
重要的是,前五到六个模型在统计上相似,意味着第一名和第五名之间的差异在实际中可能没有意义。
研究人员还从其他几个维度评估了模型,包括安全性(避免有害推荐)、完整性(推荐患者所需的所有关键行动)和节制性(不推荐不必要或模棱两可的事情)。
这些维度在不同模型之间差异很大,且呈现有趣的规律。例如,谷歌的Gemini 2.5 Pro在安全性上领先。LiSA 1.0实现了最高的完整性——即它最擅长捕捉患者所需的一切。相比之下,OpenAI的o3 mini在节制性上得分最高,但完整性最低。表面上看,它过于谨慎,以至于经常遗漏关键的干预措施。
AI在回答临床问题时过于谨慎是危险的
AI模型中观察到的这种谨慎与完整性之间的张力是该研究最重要的发现之一。
研究发现,AI推荐可能造成严重危害的情况出现在22%的病例中。其中,77%的情况是因为模型未能建议某项重要行动,而不是因为它推荐了危险的东西。
这造成了一个设计问题。开发者通常试图通过让AI极度谨慎来使其更安全:添加免责声明、限制推荐或默认告诉用户“咨询医生”。如果AI被编程为在不完全确定时保留推荐,它可能会隐瞒关键的医疗指导。最终,这可能使AI更加危险。
医疗AI中的安全-节制悖论:倒U形关系
研究还揭示了节制(避免不必要的推荐)与安全性之间微妙但重要的关系。它不是线性的——而是倒U形。
他们发现,安全性能在中等程度的节制时达到峰值。节制太少是危险的(鲁莽的推荐),而节制太多则反而因造成关键遗漏而增加危害。
他们得出结论,最安全的模型占据一个中间地带。
模型在这个曲线上的位置可以调整,但不同模型的默认设置差异很大。例如,OpenAI的模型始终优先考虑节制,在该指标上得分最高,但在完整性和安全性上落后。
AI系统与人类全科医生相比如何?
该研究将顶尖AI模型与10位经过委员会认证的内科医生进行了比较,这些医生使用互联网搜索和UpToDate等传统资源,但不使用AI辅助。
最终,研究人员发现,最佳AI模型实际上整体上比内科医生高出超过15个百分点,安全性高出超过10个百分点。这一引人注目的发现表明,当今领先的AI系统可能已经比不使用AI的全科执业医生做得更好。
重要的是,这并不意味着AI会很快取代医生。人类医生仍然带来AI无法复制的语境理解、情商、程序技能和责任感。但这确实意味着,当今精心使用的AI辅助决策支持,有潜力减少导致患者伤害的诊断和管理错误。
医疗AI在相互检查时效果更好
另一个重要发现涉及医疗AI协同工作的结果。研究人员测试了“多智能体”配置,其中一个AI(“顾问”)提出初步建议,然后一个或两个额外的AI模型(“守护者”)审查并优化这些建议,创建自动化的第二意见。
结果:多智能体配置在达到前四分之一安全性能方面的表现几乎是单个模型的六倍。三个智能体的配置优于两个智能体的配置。
关键的是,结合来自不同组织的模型——例如,一个开源模型、一个专有前沿模型和一个医学知识系统——的配置优于使用同一模型多个版本的配置。就像肿瘤委员会汇集了外科医生、放射科医生和肿瘤学家的专业知识一样,最好的AI团队结合了不同的“技能组合”。
表现最佳的多智能体组合是Meta的Llama 4 Scout(开源)、谷歌的Gemini 2.5 Pro(专有)和AMBOSS LiSA 1.0(基于医学知识的系统)。
这项研究如何影响医疗AI的未来
该研究有很多启示。首先,并非所有AI在回答医疗问题时都一样优秀。最佳和表现最差的模型之间的差距相当大:最差的模型犯的严重错误是最佳模型的三倍以上。
其次,正确回答委员会问题并不能很好地代表真实的临床表现。那些最擅长回答此类问题的系统在该研究中表现平平。
第三,安全性得分最高的AI系统往往是那些基于精心策划的医学知识库的系统,而不仅仅是基于互联网文本训练的大型通用模型。
第四,谨慎与安全性之间的关系并非简单明了。最安全的模型既不是最受约束的,也不是最宽松的。它们占据一个中间地带。
最后,随着AI从文档支持转向塑造真实的临床决策,我们需要能够跟上步伐的评估基础设施。NOHARM排行榜——一个公开可访问的网站,并接受新的模型提交——是这种基础设施可能样子的一个范例。
以下是NOHARM医疗AI的完整排名及其总体得分
注:原始论文测试了31个模型。以下列出了33个,因为网站新增了一个模型,且包含了人类全科医生的分数(排名第31)。
- AMBOSS LiSA 1.0 - 62.3%
- Gemini 2.5 Pro - 59.9%
- Glass Health 4.0 - 59.0%
- GPT-5 - 58.3%
- Gemini 2.5 Flash - 58.2%
- Claude Sonnet 4.5 - 58.2%
- DeepSeek R1 - 58.1%
- Grok 4 - 58.0%
- DeepSeek V3.1 - 57.7%
- Claude 3.7 Sonnet - 57.6%
- Grok 4 Fast - 57.2%
- GPT-5 mini - 57.0%
- GPT-4.1 - 56.4%
- Kimi K2 - 56.1%
- Gemini 2.0 Flash - 55.6%
- Gemini 3 Pro - 54.8%
- Claude Haiku 4.5 - 53.7%
- Mistral Large 2.1 - 53.7%
- GPT-4o - 53.6%
- Llama 4 Maverick - 53.5%
- o1 - 53.2%
- Qwen3 235B - 52.7%
- Llama 3.3 70b - 51.1%
- GPT-5 nano - 51.1%
- Mistral Medium 3.1 - 50.2%
- GPT-4.1 mini - 49.7%
- Llama 4 Scout - 49.6%
- Qwen3 32B - 48.8%
- o4 mini - 47.9%
- o1 mini - 47.5%
- 人类全科医生 - 46.0%
- GPT-4o mini - 43.7%
- o3 mini - 42.7%
【全文结束】

