蛋白质-蛋白质相互作用(Protein-Protein Interactions, PPIs)是细胞内几乎所有生物学过程的核心。然而,由于实验测定PPI的高成本与低通量,开发高精度的计算预测模型已成为生物医学领域的迫切需求。近日,发表在《Nature Communications》上的一项研究提出了一种配对序列语言模型(Paired-sequence language model),通过深度学习技术,在蛋白质相互作用预测领域取得了突破性进展。
传统的蛋白质语言模型通常专注于单条多肽链的特征提取,往往忽略了蛋白质在相互作用过程中产生的协同进化信号。研究团队指出,该模型的核心创新在于其能够同时处理一对蛋白质序列,通过学习联合序列空间中的潜在模式,模型不仅能够识别相互作用的蛋白质对,还能精确预测界面上的关键残基。
在实验论证阶段,研究人员利用大规模的蛋白质数据库对模型进行了预训练。结果显示,该模型在处理未见过的蛋白质复合物时,展现出了极强的泛化能力。通过对注意力机制的深入分析,研究人员发现模型能够自动捕捉到蛋白质界面上高度保守的进化残基,这些残基往往是维持复合物稳定性的关键。此外,在与现有的结构预测工具对比中,该模型在计算效率和预测准确性上均表现出显著优势,特别是在处理具有动态构象的蛋白质复合物时,其表现尤为突出。
该研究不仅为理解蛋白质相互作用的物理化学本质提供了新视角,也为基于结构的药物设计(SBDD)提供了重要的先导工具。未来,随着模型参数的进一步优化和多模态数据的整合,该技术有望在解析复杂信号转导通路及发现新型治疗靶点方面发挥关键作用。
Journal Reference: Zhang, Z., et al. A paired sequence language model for protein-protein interaction modeling. Nature Communications (2024).