一项基于人工智能的人类奖赏学习模型:混合方法可助力情绪障碍研究An AI-informed model of human reward-based learning: Hybrid approach could aid studies of mood disorders

环球医讯 / AI与医疗健康来源:medicalxpress.com英国 - 英语2026-09-12 15:42:28 - 阅读时长4分钟 - 1838字
研究人员开发了一种结合强化学习算法与神经网络的混合AI模型,用于更精确地模拟人类基于奖赏的学习过程。传统强化学习算法在预测人类决策时存在局限,而新模型通过引入记忆和心理表征等认知机制,显著提升了预测准确性,同时保持了可解释性。该研究基于大规模人类行为数据,揭示了人类学习与标准AI模型的关键差异,为理解情绪障碍等精神疾病的神经机制提供了新工具,有望推动临床研究和认知科学的进一步发展。
情绪障碍奖赏学习神经退行性疾病心理健康
一项基于人工智能的人类奖赏学习模型:混合方法可助力情绪障碍研究

人们的决策受到过往经历(包括先前选择的结果)的影响,这一点早已为人所知。一个多世纪以来,心理学家一直试图阐明人类决策和奖赏学习背后的过程。人工智能系统的出现,为奖赏学习的研究开辟了新的可能性。实际上,许多AI系统正是通过强化学习(RL)进行训练的,这种方法通过试错过程习得特定技能,正确反应或行为获得奖赏,错误行为则导致负面结果。

谷歌DeepMind和牛津大学的研究人员引入了一种新方法,通过结合AI算法与心理学理论来研究人类的奖赏学习。他们的论文发表在《自然·人类行为》上,指出传统的强化学习算法可能无法有效复制人类决策受既往经历影响的方式,从而凸显了更贴合人类内在表征的替代模型的必要性。

“人类如何学习和形成新记忆的问题,几乎与人类历史一样古老,”论文第一作者Maria K. Eckstein告诉Medical Xpress。“近年来,我们通过运用计算机科学技术并与AI合作,对此了解了很多。近期研究常用的‘配方’是:将一种在AI中表现良好的算法拿来,测试其对人类行为的解释程度,从而探究行为背后的机制。然而,我们发现这种方法常常无法给出令人满意的答案。”

将AI用于行为科学研究

虽然AI算法与人类一样可以通过RL学习,但两者存在根本差异。Eckstein及其同事一直在尝试调整AI算法,使其更像人类——这是一项既具挑战性又费力的任务。“我们必须想出哪里可能出了问题,然后手动实现每一个想法,并运行大量测试来验证其效果,”Eckstein解释道。“在这篇论文中,我们借助人工神经网络(ANN)实现了整个过程的自动化。逐一尝试每一种可能的模型调整方式实际上是不可能的,但ANN能够自动找到非常好的解决方案。然后我们可以检查这些解决方案,准确理解人类与初始模型的偏差。”

作为研究的一部分,研究人员收集了一个包含人类在奖赏学习任务中做出决策的大型数据集。然后,他们开发了将传统RL算法与灵活神经网络相结合的AI模型,创建了结构化的认知架构,并训练这些模型来表征人类的心理过程。最后,Eckstein及其同事比较了不同的计算模型,观察它们在预测任务中人类选择的准确性以及可解释性(即理解预测依据的难易程度)。总体而言,他们的发现表明,传统RL方法在预测人类决策方面不如那些同时表征人类记忆和心理过程(通过人工神经网络实例化)的模型有效。

“在人类学习研究中,我们通常依赖非常基础的、精简的强化学习算法,”Eckstein说。“RL在认知神经科学中很流行,因为它最初受到神经科学和心理学研究的启发。我们或多或少都知道这种算法过于简化了现实,很多研究也指出了这一点。然而,我们并不清楚它具体错在哪里,也不知道如何整合不同研究者发现的各种碎片。在这篇论文中,我们利用数学模型非常精确地展示了这些模型在哪些方面未能捕捉人类学习,同时也非常精确地展示了如何改进它们以更好地捕捉人类学习。”

一种新的混合建模方法

Eckstein及其同事成功地将AI系统(包括RL和神经网络)与植根于心理学的一些理念结合起来,引入了一个简单的数学模型,可用于研究人类奖赏学习。未来,该模型可以进一步改进,被其他研究团队采用,并应用于行为科学研究。

“我们进行研究的许多方式在无AI时代是对复杂问题的极好解决方案,但现在有了更好的方法,”Eckstein解释道。“简化来说,我们通常通过简单、定义明确的实验任务收集约20-50名参与者的数据集,然后预先定义具体假设,将其表述为是/否问题,并用统计方法检验这些假设。有了AI,我们不再局限于小规模数据集,可以轻松收集数百甚至数千名参与者,从而获得更强的信号。我们还可以使用代码程序化生成任务,而无需手动定义,利用数据驱动方法(如ANN)‘让数据自己说话’,而不是提前列出细微的假设——那些假设必然受限于我们作为研究者的创造力。”

该研究团队的最新工作有望很快启发更多研究,旨在开发能更好反映人类技能习得和决策过程的基于AI的RL模型。最终,这种混合建模方法可能有助于揭示人类决策的基础,以及以奖赏学习过程紊乱为特征的疾病。“我们现在除了经典统计学之外,还可以使用更强大的模型,”Eckstein补充道。“我希望我们的模型能用于临床研究,例如更好地理解神经退行性疾病和情绪障碍。过去几年,使用‘经典’计算模型(如RL)来理解这些疾病的研究激增,我希望我们这种能更好解释参与者行为的模型也能揭示其潜在机制,包括认知过程和受影响的神经基础。”

【全文结束】