2012年7月,华大基因与生物医学中心(BioMed Central)联合创办的《GigaScience》期刊正式发行,开创了生物学大数据开放获取的新纪元。该期刊采用标准全文文献、数据库信息与信息分析工具相结合的崭新模式,致力于发表大规模生物学研究成果,并提供免费公开的有效数据与生物学发现资源。这一创举标志着传统期刊出版业向数据全面公开与共享迈出关键一步,有助于提升数据密集型科研项目的可再现性。
与《GigaScience》相伴的GigaDB数据库(http://GigaDB.org)采用数字对象唯一标识符(DOI)对所有数据进行标识,实现数据的永久保存、可追踪、可检索、可链接与可引用,使数据分享者获得应有的学术认可。随着时间推移,该平台持续扩展:截至2024年,GigaDB已托管超过5000个数据集,总数据量突破10PB,覆盖基因组学、转录组学、蛋白质组学等多个领域。
《GigaScience》的出版模式有效解决了科研成果可重复性危机。研究论文不仅呈现结论,还提供完整支撑数据与重现所需软件工具,例如首期发表的DNA甲基化全基因组分析论文(原始链接已失效,数据可通过GigaDB检索获取),共84GB数据均可免费获取。依托华大基因强大的数据存储与计算能力,《GigaScience》能管理远超传统期刊容量的海量数据。2018年,期刊转为由牛津大学出版社出版,并引入云计算资源,使全球研究人员可在线直接分析数据,无需本地高性能计算设施。
核心学术观点:数据的透明、公开与可重复性是现代科学的关键基石。 《GigaScience》通过将数据、工具与论文深度绑定,显著提升了研究结果的可靠性。其影响因子连续多年稳居分类前列,2023年达9.2,反映出学术界对大数据共享模式的认可。
此外,期刊定期发表综述与评论,探讨大数据面临的挑战(如数据标准化、隐私保护、计算成本等),并提出解决方案。例如,2024年专题讨论了AI在基因组大数据挖掘中的应用,强调机器学习对提高数据利用效率的作用。
总之,《GigaScience》不仅是一本期刊,更是一个推动数据开放与科学协作的生态系统。它的成功为其他学科树立了标杆,证明了数据共享能加速发现并增强研究公信力。