新基准测试显示AI在心理健康护理中仍缺失人性化视角New benchmark shows AI still misses the human side of mental health care

环球医讯 / AI与医疗健康来源:www.news-medical.net国际 - 英语2026-08-03 01:05:12 - 阅读时长5分钟 - 2452字
一项名为PsyEval的新基准测试评估了11个先进大型语言模型在心理健康领域的表现,研究发现尽管AI模型在医学知识测试中表现良好,但在情感洞察、准确诊断和临床判断方面仍存在明显不足,特别是在处理紧急精神科场景和提供深度情感支持时,人类咨询师在提出探索性问题方面仍显著优于AI模型,研究揭示了AI在诊断中存在"反向缩放"现象,安全机制与诊断准确性之间存在权衡,小型模型可能过度诊断,而大型模型则倾向于回避诊断,研究强调未来AI开发需纳入文化多样数据并设计更智能的安全机制。
心理健康AIPsyEval基准测试情感支持诊断评估共情差距过度诊断精神疾病抑郁症自杀风险
新基准测试显示AI在心理健康护理中仍缺失人性化视角

一项新的心理健康基准测试表明,当今最先进的AI模型虽然听起来令人信服,但在需要情感洞察、谨慎诊断和真实临床判断的关键时刻仍然表现不足。

在最近发表在《npj Mental Health Research》期刊上的一项研究中,研究人员描述了"PsyEval"的开发过程,这是一个新颖、全面的基准测试,旨在评估大型语言模型(LLMs)在人类心理健康这一依赖上下文且主观性强的领域中的表现。

该基准测试随后被用于从三个主要维度评估十一个先进大型语言模型:1. 知识理解,2. 诊断与评估,3. 情感支持。PsyEval的研究结果表明,尽管一些大型语言模型能够模仿人类的流畅表达并展示出色的事实记忆能力,但它们仍然缺乏在复杂心理健康任务中可靠表现所需的深层情感洞察力和临床细微差别。

具体而言,PsyEval显示所评估的LLMs对提示词高度敏感,与人类咨询师相比存在"共情差距"。此外,研究结果表明,与安全相关的拒绝回答可能会降低某些大型基础模型的原始诊断分类分数,而防护较少的模型可能更积极地对患者进行分类,增加了过度诊断的风险。

精神疾病是当今人类社会最主要的慢性疾病之一,世界卫生组织(WHO)的数据显示,仅抑郁症就影响了全球3.8%的人口。雪上加霜的是,治疗率仍然非常低,在中低收入国家仅为13.7%,中高收入国家为22.0%,高收入国家为36.8%。论文指出,由于社会污名化和公众意识有限,这些数字可能被低估了。

在此背景下,研究人员 increasingly 探索人工智能(AI)和LLMs作为心理健康应用的潜在工具。虽然早期在基本情感分析方面的应用看起来很有前景,但全面评估这些系统一直具有挑战性。

与具有明确可验证结果的任务不同,精神科评估高度依赖于解释微妙、高度模糊且通常主观的言语线索,以及在寻求支持者与心理健康专业人士之间建立强有力的治疗关系。

不幸的是,此前缺乏一个统一框架来压力测试AI是否能在富有同理心的沟通中安全地平衡知识和诊断表现。

本研究旨在通过开发PsyEval来填补这一评估空白,PsyEval是一套专门设计的任务集,旨在从三个维度模拟真实世界精神科咨询的关键要素。该基准测试包含分别覆盖知识、诊断分类和情感支持任务的独立评估数据集。

首先,"知识任务"数据集包含了5,531道选择题,这些题目提取自美国和中国大陆医师执照考试(USMLE和MCMLE),用于测试核心医学事实和危机应对场景。

其次,"诊断任务"数据集是从自我报告心理健康检测(SMHD)数据集中选取的社交媒体帖子衍生出的1,000个用户级测试实例整理而成,用于评估单一病症分类和多病症或共病检测。同时,来自中国D4数据集的1,339个临床对话被用于评估抑郁和自杀风险水平。

最后,来自中国PsyQA平台的1,000个用户咨询和来自Counsel-Chat的939个英语咨询互动被纳入作为情感支持评估的数据集。

随后,研究人员应用PsyEval比较了十一个通用和领域专用LLMs在心理健康相关基准任务上的表现,包括GPT-4、Qwen2.5-72B和SoulChat,测试了三种提示策略:1. 正式指令,2. 逐步推理,3. 场景模拟。

情感支持回应使用自动指标和涉及人类标注者与DeepSeek-V3的混合人-AI投票过程进行评估。

研究结果显示,大型通用模型通常在事实知识任务上表现更好,尽管表现也高度依赖于语言对齐。在一般知识任务上,Qwen2.5-72B在中国MCMLE-mental数据集上达到了91.0%的准确率。同样,GPT-4-turbo在英语任务中领先,准确率约为76.0%。

尽管在事实知识方面表现出色,但模型在紧急精神科场景问题上的表现普遍下降。例如,在USMLE危机应对数据集上,GPT-4-turbo的准确率降至约73.0%。

研究进一步发现了模型原始诊断分类准确率中的"反向缩放"现象。像LLaMa-3-8B这样的小型模型在分类注意力缺陷多动障碍(ADHD)等疾病时达到了近乎完美的准确率,ADHD为100.0%,焦虑症为96.0%,远超GPT-4,后者在ADHD上的准确率仅为约25%。

作者推测,这些差异反映了基准测试准确率与谨慎模型行为之间的安全-效用权衡。旗舰级基础模型可能会实施护栏机制,阻止它们诊断患者或行医,导致拒绝回答或模糊回应,而这些在PsyEval中被计为错误答案。相反,小型模型可能更容易分配诊断标签,可能会增加过度诊断的风险。

在比较LLMs与人类咨询师的情感支持表现时,研究显示,尽管一些领先模型在语言流利度和连贯性方面与后者相当甚至更优,但人类在PsyQA上获得了1.85的"探索分数",在Counsel-Chat上获得了1.93的分数,在提出探索性问题以揭示更深层次问题方面,始终优于所评估的AI模型。

最后,提示词风格被发现显著影响LLM表现。指导模型采用心理健康专业人士角色的场景模拟提示通常产生最高的共情分数,而逐步提示往往产生更为机械的回应。

PsyEval表明,几个大型LLMs在选定的医学知识问题上取得了高准确率,尽管该研究并未直接将其知识或诊断表现与心理健康专业人士进行比较。然而,所评估的模型在英语和中文任务上的表现存在显著差异,对提示词措辞敏感,在处理共病情况和评估临床风险时表现不一致。

SoulChat的研究结果还表明,在某些模型中,高度专业化的对话微调可能与一般知识表现的损失相关,尽管这一观察不应推广到所有专业心理健康模型。

作为一项基准测试研究,该研究并未前瞻性地在患者身上测试模型,也未测量治疗结果,未在现实环境中评估诊断安全性,也未评估自主危机干预。

这些发现强调,未来的模型开发应着重于纳入文化多样的对齐数据,并设计更智能的安全机制,在保护用户的同时不会过度降低模型的潜在临床效用。

【全文结束】