与人类性状和疾病相关的大多数遗传变体位于蛋白质编码区之外,通过调控元件影响基因表达。准确预测非编码变体的功能效应是遗传学的一个重大挑战,因为调控过程跨越从单碱基到长距离染色体相互作用的多个尺度。2026年4月8日发表于 Cell Research 的一篇研究亮点中,冷泉港实验室的Alan E. Murphy、Masayuki Nagai和Peter K. Koo评述了Avsec等人最新开发的AlphaGenome模型。该模型是一种序列到功能(sequence-to-function)的深度学习工具,能够利用兆碱基(megabase)级的基因组背景来预测多种调控活性和变体效应。AlphaGenome在预测染色质可及性、转录因子结合、RNA剪接和基因表达等任务上显著优于以往的模型。这一进展有望指导实验优先级排序,并为非编码变体的机制解读提供新的可能。
背景:非编码调控的“尺度困境”
已知挑战
-
基因调控通过DNA序列特征在多尺度上编码,从单碱基对到远距离染色质相互作用。
-
高通量测序虽能全基因组测量调控活性,但不可能通过实验测试所有可能的序列变体。
-
深度学习模型可学习DNA序列模式与分子读数之间的关联,作为实验的可扩展补充。
两个基本矛盾
-
广度 vs. 专门化:整合多种分子模式(chromatin state, transcription, RNA processing)虽有望提供更完整的变体效应图谱,但针对单个检测任务训练的专门模型在特定任务上可能优于多模态模型。
-
尺度 vs. 分辨率:捕捉远距离调控相互作用需要长输入序列,但计算约束常将预测降至粗分辨率(如千碱基级窗口),可能遗漏剪接位点或短转录因子基序等对单碱基变化至关重要的窄序列特征。
AlphaGenome的解决方案:通过一系列工程创新,在单个框架中结合扩展的基因组上下文(兆碱基级序列)与单碱基级预测精度。
AlphaGenome的核心创新
性能评估
基准测试(单核苷酸变体效应):
消融研究揭示设计选择的重要性:
-
碱基级分辨率:对于依赖于精确序列特征的任务(剪接、染色质可及性)至关重要;对更广泛的信号(组蛋白修饰、接触图谱)则重要性较低。
-
长序列(1 Mb)训练:提高了整体性能,特别是对基因表达和接触图谱的预测。
-
多模态数据:基因表达和变体效应的预测显著受益于整合染色质状态信息与RNA测量;但添加更多数据类型带来的增益有限。
局限性与未来方向
评述:通往可预测基因组学的又一步
-
总结:AlphaGenome代表了整合调控模态和扩展现有序列到功能模型的重要进展,通过提高跨调控层的预测准确性,使大规模计算机模拟调控分析更加可靠。
-
剩余挑战:对其他变体类型、组合效应、远距离调控的预测能力,以及对不同细胞环境的泛化能力,仍需进一步验证和开发。
-
最终承诺:序列到功能模型提供了一个框架,可在规模上探测顺式调控逻辑,实现对组合变体、远距离相互作用和上下文特异性效应的分析——这些实验在实验室中以相当规模进行是不可行的。AlphaGenome使这类分析向可靠性迈出了有意义的一步。
核心术语定义
-
序列到功能模型:从DNA序列预测分子功能读数(如染色质状态、转录、剪接)的深度学习模型。
-
知识蒸馏:模型压缩技术,小型“学生”模型学习模拟大型“教师”集成模型的输出,在降低计算成本的同时保留精度。
-
序列分片(Sharding):将兆碱基级序列分割成更小的块(例如512bp),在多个GPU上并行处理,随后由Transformer聚合以学习远程依赖。
-
兆碱基(Megabase, Mb):一百万碱基对。AlphaGenome的上下文窗口为1 Mb。
-
消融研究(Ablation study):系统移除模型组件以评估其对性能贡献的实验。
原始研究与评述信息
-
被评述的原始研究:Avsec, Ž. et al. AlphaGenome. Nature 649, 1206–1218 (2026).
-
评述标题:Predicting non-coding variant effects with AlphaGenome
-
评述作者:Murphy, A.E., Nagai, M. & Koo, P.K.
-
期刊:Cell Research (2026)
-
DOI:10.1038/s41422-026-01249-1
(责任编辑:泉水) |