
KGCAK数据库中基本功能模块举例
在过去的几十年中,系统进化分析通常依赖于高度保守的基因家族,而全基因组序列的应用并不普遍。目前,分子系统发生树的构建方法主要分为两类:基于序列比对的方法和无需比对的方法。其中,无需比对的方法通过计算K-mer向量间的距离矩阵进行系统进化分析,大量研究证实该方法在蛋白编码序列等特定区域尤为有效。此外,K-mer算法在基因组组装、motif预测、重复序列识别和基因组复杂性评估等组学领域也受到广泛关注。鉴于K-mer算法在组学中的重要性,在大规模基因组数据快速积累的时代,构建一个基于K-mer算法、易于存储且支持大量基因组数据可视化处理的数据库显得尤为迫切。
为此,中国科学院北京基因组研究所基因组科学与信息重点实验室于军团队与英国伦敦大学学院(UCL)肿瘤研究所王大鹏合作,开发了基于K-mer算法的基因组组分分析数据库KGCAK。该研究成果近期发表于《Biology Direct》杂志。
该数据库整合了Ensembl、Phytozome和NCBI等主流基因组数据库中超过8000个核基因组或细胞器基因组,涵盖高等动植物、原生生物、真菌、细菌和病毒等物种。数据库包含基因组不同维度的序列,如DNA、cDNA、CDS、氨基酸和ncRNA序列,并分别计算和存储了核酸序列(K从2到10)和氨基酸序列(K从1到5)的K-mer向量,便于进行跨物种的系统发生树构建。此外,数据库提供了评估不同物种基因组复杂度的交互工具,包括基因组基本特征参数、K-mer向量的数学参数统计、频率分布、唯一性比率,以及二维和三维空间可视化分析基因组参数与K-mer参数的交互关系。
总之,该数据库通过捕获基因组序列特征,将基因组转化为易于理解和可视化的数字K-mer向量,旨在构建一个基于K-mer算法的比较基因组学平台,为系统发生树构建和物种关系研究提供重要参考和指引。