生物行移动版

主页 > 生物技术 > 基因组学

破译“非编码暗物质”:AlphaGenome模型以碱基分辨率预测百万碱基级变体效应

与人类性状和疾病相关的大多数遗传变体位于蛋白质编码区之外,通过调控元件影响基因表达。准确预测非编码变体的功能效应是遗传学的一个重大挑战,因为调控过程跨越从单碱基到长距离染色体相互作用的多个尺度。2026年4月8日发表于 Cell Research 的一篇研究亮点中,冷泉港实验室的Alan E. Murphy、Masayuki Nagai和Peter K. Koo评述了Avsec等人最新开发的AlphaGenome模型。该模型是一种序列到功能(sequence-to-function)的深度学习工具,能够利用兆碱基(megabase)级的基因组背景来预测多种调控活性和变体效应。AlphaGenome在预测染色质可及性、转录因子结合、RNA剪接和基因表达等任务上显著优于以往的模型。这一进展有望指导实验优先级排序,并为非编码变体的机制解读提供新的可能。


背景:非编码调控的“尺度困境”

已知挑战

  • 基因调控通过DNA序列特征在多尺度上编码,从单碱基对到远距离染色质相互作用。

  • 高通量测序虽能全基因组测量调控活性,但不可能通过实验测试所有可能的序列变体。

  • 深度学习模型可学习DNA序列模式与分子读数之间的关联,作为实验的可扩展补充。

两个基本矛盾

  1. 广度 vs. 专门化:整合多种分子模式(chromatin state, transcription, RNA processing)虽有望提供更完整的变体效应图谱,但针对单个检测任务训练的专门模型在特定任务上可能优于多模态模型。

  2. 尺度 vs. 分辨率:捕捉远距离调控相互作用需要长输入序列,但计算约束常将预测降至粗分辨率(如千碱基级窗口),可能遗漏剪接位点或短转录因子基序等对单碱基变化至关重要的窄序列特征。

AlphaGenome的解决方案:通过一系列工程创新,在单个框架中结合扩展的基因组上下文(兆碱基级序列)与单碱基级预测精度。


AlphaGenome的核心创新

 
 
特性 AlphaGenome的方法 优势
超长序列输入 处理高达1兆碱基的DNA序列 捕捉远距离调控相互作用
碱基级分辨率输出 通过序列分片(sharding) 和Transformer层实现 识别剪接位点、短转录因子基序等对单碱基变化敏感的特征
多模态预测 输出包括染色质状态、转录、接触图谱和详细剪接任务 提供比以往模型更直接、可机制解读的RNA加工读数
知识蒸馏 集成多个独立训练模型的知识,压缩到单一可部署模型 捕捉集成的准确性增益,同时保持下游用户的计算需求可管理
高质量训练数据 使用与自然语言处理中大型语言模型类似的“缩放法则” 更多高质量数据直接转化为更好的性能

性能评估

基准测试(单核苷酸变体效应):

  • 涵盖染色质可及性、转录因子结合、剪接和基因表达的多种检测。

  • AlphaGenome在这些基准上显著优于以往的序列到功能模型。

消融研究揭示设计选择的重要性:

  • 碱基级分辨率:对于依赖于精确序列特征的任务(剪接、染色质可及性)至关重要;对更广泛的信号(组蛋白修饰、接触图谱)则重要性较低。

  • 长序列(1 Mb)训练:提高了整体性能,特别是对基因表达和接触图谱的预测。

  • 多模态数据:基因表达和变体效应的预测显著受益于整合染色质状态信息与RNA测量;但添加更多数据类型带来的增益有限。


局限性与未来方向

 
 
局限性 未来方向
主要评估单核苷酸替换 需要对包括插入、缺失、结构变异在内的更多样化变体进行测试
组合/“个人基因组”效应预测能力仍然有限 独立评估表明需要改进(Tu et al., bioRxiv 2026)
对远距离顺式调控元件扰动的预测能力未经直接评估 需要针对大规模CRISPRi介导的增强子扰动检测进行基准测试
细胞环境依赖性:隐含假设固定的细胞状态,转录因子水平、染色质状态和信号环境被视为常数 需要微调或迁移学习来适应未见过的细胞类型;成功取决于底层调控程序的相似性
依赖观察性数据(关联而非因果关系) 需要系统扰动(CRISPR切割、合成基因组学)来更好地连接序列与因果调控机制
机制解释:模型学到了什么顺式调控逻辑? 应用大规模计算机模拟扰动(虚拟检测)来揭示模型捕获的调控规则

评述:通往可预测基因组学的又一步

  • 总结:AlphaGenome代表了整合调控模态和扩展现有序列到功能模型的重要进展,通过提高跨调控层的预测准确性,使大规模计算机模拟调控分析更加可靠。

  • 剩余挑战:对其他变体类型、组合效应、远距离调控的预测能力,以及对不同细胞环境的泛化能力,仍需进一步验证和开发。

  • 最终承诺:序列到功能模型提供了一个框架,可在规模上探测顺式调控逻辑,实现对组合变体、远距离相互作用和上下文特异性效应的分析——这些实验在实验室中以相当规模进行是不可行的。AlphaGenome使这类分析向可靠性迈出了有意义的一步。


核心术语定义

  • 序列到功能模型:从DNA序列预测分子功能读数(如染色质状态、转录、剪接)的深度学习模型。

  • 知识蒸馏:模型压缩技术,小型“学生”模型学习模拟大型“教师”集成模型的输出,在降低计算成本的同时保留精度。

  • 序列分片(Sharding):将兆碱基级序列分割成更小的块(例如512bp),在多个GPU上并行处理,随后由Transformer聚合以学习远程依赖。

  • 兆碱基(Megabase, Mb):一百万碱基对。AlphaGenome的上下文窗口为1 Mb。

  • 消融研究(Ablation study):系统移除模型组件以评估其对性能贡献的实验。


原始研究与评述信息

  • 被评述的原始研究:Avsec, Ž. et al. AlphaGenome. Nature 649, 1206–1218 (2026).

  • 评述标题:Predicting non-coding variant effects with AlphaGenome

  • 评述作者:Murphy, A.E., Nagai, M. & Koo, P.K.

  • 期刊:Cell Research (2026)

  • DOI:10.1038/s41422-026-01249-1

(责任编辑:泉水)