自人类基因组计划启动以来,基因组学领域形成了一个共识:为了实现最大的社会效益,基因组数据应当被广泛共享。然而,这一共识建立在对“广泛数据共享”这一概念的模糊理解之上,导致在多个里程碑式的基因组研究中,数据共享的实施方式各不相同。
2025年1月22日,宾夕法尼亚大学佩雷尔曼医学院的Jonathan E. LoTempio Jr和Jonathan D. Moreno在《自然-遗传学》上发表了一篇重要的前瞻性文章,首次系统性地解构了“广泛数据共享”这一模糊概念,并提出了一个清晰的框架,用于指导基因组数据共享的实践。
核心内容:澄清概念与剖析挑战
文章的核心价值在于,它首次深入剖析了“广泛数据共享”在实践中的复杂伦理、法律和社会影响,并提出了应对这些挑战的建议。
1. “广泛”的三种定义
文章指出,“广泛数据共享”中的“广泛”一词在实践中至少有三种不同的含义:
| 定义 | 核心含义 | 应用实例 | 潜在问题 |
|---|---|---|---|
| 不受限制的公开访问 | 任何人无需注册或审批即可自由获取数据。 | 人类参考基因组序列(GRCh38);部分物种的参考基因组。 | 无法追踪数据使用者的身份和用途;可能被用于违背参与者原始同意的研究。 |
| 受管理的访问 | 需要通过数据访问委员会的审批后才能获取数据。 | 如dbGaP数据库;全基因组关联研究汇总统计。 | 审批流程可能带来延迟和行政负担;可能存在准入偏见。 |
| 广义的研究用途 | 参与者授权其数据可用于广泛的、非特定的未来研究。 | 生物银行(如All of Us Research Program)中使用的“广泛同意”。 | 参与者可能未完全理解“广泛”的含义;同意范围可能被不当扩展。 |
2. 六个基因组学项目的案例分析
文章通过分析六个具有代表性的基因组数据共享项目,揭示了其在“广泛”程度和治理模式上的差异:
- 人类基因组计划:采用不受限制的公开访问原则,但样本同意未涵盖广泛数据共享。
- 千人基因组计划:数据以公开访问模式共享,但未获得明确的广泛共享同意。
- 癌症基因组图谱:采用分层访问模式,数据贡献者的同意范围不尽相同。
- 遗传关联信息网络:采用受管理的访问模式,数据使用认证协议成为模板。
- 基因组聚合数据库:以公开访问模式共享变异频率数据,但未共享个体级数据。
- All of Us研究计划:基于广泛同意,采用受管理的访问模式。
3. 三项核心挑战与建议
文章提出了当前基因组数据共享面临的三项核心挑战,并提供了应对建议:
挑战一:重新解释“一般研究用途”的界限
- 问题:过去的“广泛共享”同意是否适用于当前的基因组数据共享实践?
- 建议:建立动态同意机制,允许参与者重新审视和调整其同意范围;对现有样本进行知情同意再确认。
挑战二:审议现有样本公共数据沉积的治理
- 问题:是否可以将未获得广泛共享同意的旧样本数据上传至公共数据库?
- 建议:成立数据沉积伦理审查委员会,对旧样本数据的公开申请进行个案评估。
挑战三:参与者是否应被鼓励公开身份?
- 问题:是否应鼓励参与者公开其研究参与身份?
- 建议:提供选择加入的选项,允许参与者在充分知情的情况下决定是否公开身份,并建立机制应对隐私风险。
这篇文章为基因组数据共享提供了重要的理论框架和实践指导,呼吁学术界和政策制定者共同努力,平衡科学进步与伦理责任。