由氨基酸链组成的蛋白质在人体中扮演着关键角色,无论是构建骨骼和肌肉还是支持免疫系统。虽然许多蛋白质具有保持其3D结构稳定的固定折叠模式,但其他蛋白质则更具可塑性。
在某些情况下,这些更具可塑性的蛋白质——称为内在无序蛋白质——会自行折叠以快速响应其环境,使它们能够在细胞中迅速转换角色。
然而,在某些条件下,这些蛋白质可以组装成类似固体的纤维或类似液体的液滴。尽管此类组装可以执行有用的细胞功能,但其形成过程的紊乱已被认为与阿尔茨海默病、帕金森病和肌萎缩侧索硬化症等疾病相关。
这些形状可变、容易聚集的蛋白质在分子水平上可能难以解析。现在,加州大学圣塔芭芭拉分校的研究人员开发了两种新的计算模型,利用人工智能预测这些不同形式的蛋白质组装,为研究神经退行性疾病的分子行为提供了一种新方法。
"在基于聚集的神经退行性疾病领域,一个挑战是我们没有可靠的模型系统可以在实验台上进行测试和表征,或用于筛选治疗药物,"加州大学圣塔芭芭拉分校Robert Mehrabian工程学院化学工程教授M. Scott Shell表示。
这些模型由最近获得化学工程博士学位的Sam Lobo与化学与生物化学教授Joan-Emma Shea合作设计,Shell表示,它们"在基本理解蛋白质组装以及快速识别可能值得未来治疗靶点的蛋白质或区域方面都是重大进展"。他们的研究发表在《美国国家科学院院刊》上。
预测蛋白质组装
当Lobo了解到基于词语的大型语言模型(LLMs)的工作原理后,他开始对将类似方法应用于蛋白质产生了兴趣。
像ChatGPT这样的大型语言模型经过训练,可以识别单词序列中的模式。
Lobo说:"蛋白质也是一种语言。与词语不同,它们是由氨基酸组合形成更大结构的。"
蛋白质语言模型以类似方式工作,但它们不是从书籍或网站学习,而是从庞大的蛋白质序列数据库中学习。
通过研究数亿种天然蛋白质,这些模型学习了氨基酸如何共同出现的模式——这些模式可能包含关于蛋白质功能和特性的线索,包括它们聚集的倾向。
Lobo将这些学习到的模式作为两个新预测器的起点。其中一个称为amyloid-predict,用于估计蛋白质序列形成淀粉样纤维的可能性,淀粉样纤维是与某些神经退行性疾病相关的有序聚集体。
另一个称为LLPS-predict,用于估计蛋白质序列经历液-液相分离的可能性,这一过程是指蛋白质在细胞内凝结成类似液体的液滴。
Shell将蛋白质语言模型生成的信息比作条形码,该条形码以紧凑的数字形式捕捉每个序列的重要特征,更易于分析。
"这些AI模型可以根据观察到的序列谱系和自然中发现的模式,将所有信息提炼成简洁的格式,"他说。"然后,Sam利用这些'条形码',找出了预测功能特性的方法。"
值得注意的是,底层语言模型最初并未针对识别淀粉样形成或液-液相分离进行训练。然而,它从天然蛋白质序列中学到的模式包含了足够的信息,使Lobo的模型能够预测这两种行为。
研究人员使用这些模型扫描了人类蛋白质组——人类基因代码可以产生的约两万个蛋白质的完整集合。通过这样做,他们了解到,内在无序蛋白质具有不同的倾向,具体取决于其序列。
有些蛋白质很可能同时形成淀粉样纤维和液滴。其他蛋白质可能形成淀粉样纤维或液滴,但不会同时形成两者。"这些模型的有趣之处在于,它们表明这两种组装类型并非内在关联,"Shell说。
这些模型还揭示了与朊病毒相似的蛋白质中的有趣模式,朊病毒是一种已知会导致牛海绵状脑病(俗称疯牛病)、库鲁病和克雅氏病等疾病的错误折叠蛋白质;这些类朊病毒蛋白质也与神经退行性疾病有关。
Lobo说:"我们注意到,许多类朊病毒蛋白质似乎包含两种不同类型的区域。一个区域在淀粉样聚集方面得分很高,而另一个区域在液滴形成方面得分很高。"
他说,这种组合可能有助于解释为什么朊病毒特别难以控制。"因此,我们认为,可能是在单个蛋白质中同时拥有这两个区域是使这些蛋白质如此擅长传播疾病的重要方面。"
虽然他们的模型目前允许研究人员了解特定蛋白质聚集的可能性,但它们尚未解释驱动每个预测的分子机制。研究人员的下一个目标是利用AI系统识别的模式来理解为什么蛋白质会以这种方式行为。
Shell说:"我们想要了解蛋白质语言模型输出的信号如何与分子水平的聚集物理学相关,以及周围条件(如pH值或温度)如何影响聚集倾向。"
建立这些联系最终可能帮助研究人员确定为什么某些蛋白质与疾病相关,以及在哪里进行干预可能最有效。
Lobo说:"人类蛋白质组包含数千种内在无序蛋白质,其聚集行为仍未得到充分表征。这些模型为研究人员提供了一种很好的方法,可以优先考虑哪些蛋白质以及其中哪些区域最可能导致疾病,以及最值得下一步靶向治疗。"
【全文结束】

