
机器学习技术首次成功识别出DNA中可能导致疾病突变的“启动子”信号,为预测和理解基因调控失常提供了新工具。
在每个复杂的人体细胞中,数以万计的基因必须在精确的时间以恰当的量被“开启”或“关闭”,以维持生命活动的正常运行。这一精密的调控过程依赖于DNA中一些特殊的序列,它们协同作用,最终指导着酶、激素、蛋白质以及其他细胞结构和功能必需组分的生产。一旦基因调控出现偏差,细胞功能便可能紊乱,进而引发包括癌症在内的多种疾病。
为了深入理解调控基因表达的DNA序列,加州大学圣迭戈分校James T. Kadonaga教授实验室的研究人员将焦点集中在一个至关重要的区域——“启动子”(initiator)。这个DNA片段标志着基因中编码的信息开始被转化(即表达)为功能性产物的起始点。
在研究生研究员Torrey Rhyne-Carrigg的领导下,研究团队运用高通量DNA测序技术,对大约50万个不同版本的启动子进行了基因表达活性测量。随后,他们将这些实验结果输入到机器学习模型中。这些模型通过学习,成功识别出了与启动子相关的特征性DNA序列模式。一旦这种“签名”被识别出来,研究人员便在人类基因组中进行了搜索,结果发现大约60%的人类基因都含有启动子。
加州大学圣迭戈分校生物科学学院分子生物学系的Kadonaga教授指出:“这些AI模型首次为人类基因中启动子的存在与否提供了强有力的预测,从而成功解码了启动子的DNA碱基序列模式。”
解码启动子为研究人员提供了一种全新的方式,来预测影响该区域的DNA突变如何导致各种疾病。此外,这项研究的数据和模型还可以帮助科学家们创建合成启动子——这些DNA序列经过精心设计,能够以特定的定制功能开启或关闭基因。
Kadonaga教授进一步阐述:“从更宏观的视角来看,这项工作是结合实验室实验和人工智能来解读人类DNA碱基序列中嵌入信息的重要一步。最终,在我们每个细胞中包含的60亿个DNA碱基中,存在着一个基因表达密码,它精确规定了我们每个基因何时、何地以及在何种程度上应该被开启或关闭。如果我们拥有一个针对整个基因表达密码的AI模型,我们将能够预测不同人群中不同基因变体的活性。此次针对启动子的新AI模型,是这个基因表达密码中虽小但重要的一部分,我乐观地认为,在不远的将来,我们将能够扩展我们的人类基因表达密码AI模型。”