两个世界,一个目标
在过去的五年里,两个技术浪潮交汇了:
-
空间转录组学(Spatial Transcriptomics):10x Visium、Slide-seq、MERFISH、Xenium 等技术使得研究人员可以在组织切片的空间位置上测量数千个基因的表达。空间分辨率从 100μm(10x Visium)到单分子(MERFISH)不等。
-
数字病理学(Digital Pathology):全切片扫描仪(如 Leica Aperio、Hamamatsu NanoZoomer)生成的千兆像素级 H&E 或 IHC 图像,可以展示组织的完整形态学细节。
问题是:这两个模态是互补的,但整合它们非常困难。
空间转录组学数据告诉你特定位置的基因表达,但分辨率有限且缺乏形态学背景。数字病理学图像提供了完美的形态学(细胞核形状、组织结构、坏死区域等),但缺乏分子信息。
AI,特别是计算机视觉和自然语言处理的交叉领域,正在成为融合这两个世界的关键。
为什么整合有价值?
应用 1:精细化的细胞类型定位
空间转录组学的一个主要困难是:在 10x Visium 中,每个“spot”覆盖大约 5-30 个细胞。基因表达测量是这 30 个细胞的平均。如果我们能在 H&E 图像中分割出单个细胞核,并结合空间转录组数据,就可以推断每个细胞的类型——即使它们在同一个 spot 内。
应用 2:识别“形态学驱动的分子特征”
某些组织形态学特征(如三级淋巴结构、肿瘤浸润边缘的栅栏状坏死)与特定的基因表达谱相关联。通过 AI 模型,可以学习这种关联,然后仅从 H&E 图像推断基因表达——这为了解没有空间转录组数据的存档样本打开了一扇门。
应用 3:疾病生物标志物的发现
整合基因表达和组织学图像可以揭示新的生物标志物,这些标志物在任何一个模态中单独看都是不明显的。例如,一个基因可能在肿瘤区域高表达,但只在与特定免疫细胞相邻时才有临床意义。
应用 4:药物反应的预测
来自临床试验的组织样本通常既有 H&E 图像(标准收集),也有部分样本的空间转录组数据(成本高、较稀少)。AI 可以通过在配对样本上学习,从 H&E 图像预测转录谱,然后将预测模型应用于大规模(仅 H&E)的队列,用于发现与药物反应相关的空间模式。
技术基石:三种主要的 AI 整合方法
过去三年中,出现了三种主要的技术路径:
方法 1:空间映射(Deconvolution + Image Registration)
思想:使用 H&E 图像辅助将空间转录组数据分解为单个细胞的贡献。
工作流:
-
从同一组织切片获得 H&E 图像(或相邻切片)
-
在 H&E 图像上进行细胞分割(使用如 Cellpose、StarDist 或更先进的 AI 模型)
-
将分割的细胞映射到空间转录组 spot(基于物理坐标)
-
使用统计模型(如 RCTD、SpatialDWLS)或机器学习模型,从 spot-level 表达谱中预测每个细胞的类型
AI 的贡献:
-
自动分割:预训练的卷积神经网络(CNN)可以分割 H&E 图像中的细胞核和细胞质
-
预测模型:图神经网络(GNN)可以考虑细胞之间的空间邻接关系
代表性工具:
-
Cell2location(Bayesian 模型,考虑技术噪音)
-
SpatialScope(深度学习,整合图像和表达)
-
Tangram(基于深度学习的空间映射)
方法 2:表达推断(Image-to-Expression)
思想:仅从 H&E 图像预测基因表达的空间分布。
工作流:
-
收集配对的 H&E 图像和空间转录组数据
-
训练一个深度学习模型,输入是一个图像块(patch),输出是该 patch 内基因表达向量
-
对新(仅 H&E)的图像,模型逐 patch 预测表达谱
挑战:
-
H&E 染色只显示形态,不包含“直接”的分子信息。预测表达的准确性有限(相关性通常在 0.3-0.6 的范围)。
-
不同组织类型的性能变化很大。
代表性的 AI 模型:
-
DeepPathology(CNN + 注意力机制)
-
Hist2RNA(使用 transformer 处理图像块之间的关系)
不追求高精确度,而是追求生物学洞见。即使一个基因的预测相关度只有 0.4,如果它在空间上与特定形态特征(如肿瘤边界)相关联,仍然可以提供新假设。
方法 3:多模态联合嵌入(Multimodal Fusion)
思想:将图像和表达数据投影到一个共享的嵌入空间,使模型能够同时在两个模态上进行推理。
工作流:
-
提取图像特征(通过 CNN 或 ViT)和表达特征(通过 MLP 或 GNN)
-
训练一个联合编码器,使得配对的图像-表达在嵌入空间中靠近
-
支持跨模态检索(给定图像,找到相似表达模式;给定表达谱,找到形态学类似的区域)
-
在联合嵌入空间上执行下游任务(如细胞分类、生存预测)
优势:
-
可以捕捉到非线性的、复杂的跨模态关系
-
支持缺失模态的推理(如果缺失一个模态,可以从另一个模态推断)
代表性的 AI 模型:
-
ST-Net(基于对比学习)
-
Multimodal Transformer for Spatial Omics(跨模态注意力)
-
CLIP 风格的模型(类似 OpenAI CLIP,但面向组织学和表达)
实战:一个多模态整合的分析流程
假设你有一个包含 10 个组织切片的数据集,其中 5 个有 10x Visium 空间转录组数据 + H&E 图像,另外 5 个只有 H&E 图像(来自同一个患者的邻近切片)。你想在这 10 个切片中识别“肿瘤-免疫边界”并比较相关的基因。
步骤 1:数据预处理和匹配
AI 辅助:使用预训练的模型分割细胞核,估计每个 Visium spot 的区域。
# 使用 Cellpose(AI 分割模型) from cellpose import models, io model = models.Cellpose(gpu=True, model_type='nuclei') masks, flows, styles = model.eval(image, diameter=30, channels=[0,0]) # 将 masks 映射到 Visium spot 坐标 # 每个 Visium spot 有一个半径 ~55μm,约包含 ~30 个细胞
步骤 2:在配对的切片上训练联合模型
使用 Hist2RNA 范式的模型(简化示例):
import torch import torch.nn as nn from torchvision.models import resnet18 class ImageToExpression(nn.Module): def __init__(self, n_genes=2000): super().__init__() self.encoder = resnet18(pretrained=True) # 替换最后的全连接层 self.encoder.fc = nn.Linear(512, n_genes) def forward(self, image_patch): # 输出: 预测的表达谱 return self.encoder(image_patch) # 训练 model = ImageToExpression() criterion = nn.MSELoss() # 用于预测表达值 optimizer = torch.optim.Adam(model.parameters()) for patch, expr in paired_data: pred = model(patch) loss = criterion(pred, expr) loss.backward() optimizer.step()
步骤 3:在仅 H&E 的切片上进行空间表达推断
# 推断未见切片的表达 inferred_expr = model(new_image_patch)
步骤 4:识别空间模式并进行比较
使用推断的表达在 10 个切片上运行下游分析(如识别表达梯度、空间可变基因)。
AI 辅助的发现:通过比较有真实转录组数据的切片和仅有推断数据的切片,可能发现在所有切片中“肿瘤边界区域都表现出炎症相关基因(如 CXCL10、IFNG)的上调”。这成为一个有力的候选机制。
挑战与局限性
尽管有引人注目的潜力,多模态 AI 在空间生物学中仍面临困境:
-
批次效应被放大:来自不同切片、不同染色批次、不同扫描仪产生的图像差异可能很大。AI 模型可能学习到批次特异性伪影而非生物学信号。需要复杂的批次校正和域自适应技术。
-
分辨率不匹配:10x Visium 的分辨率(~55μm spot)与单细胞形态之间的差距巨大。即使是最先进的 deconvolution 方法,仍然会丢失一些细胞类型(特别是稀有的细胞状态)。
-
需要大量配对数据:深度学习方法需要数千甚至数万对“图像-patch-表达谱”的样本。空间转录组实验仍然昂贵,每张切片 $500-2000。公共数据库正在增长(如 Spatial Research Database),但还未达到自然语言处理那样的大规模。
-
缺乏基准标准:不同的整合方法使用不同的评估指标、数据集和预处理步骤,使得直接比较非常困难。社区正在努力建立如 STAGE 和 STAN 这样的基准平台。
-
可解释性的重要性:临床医生和生物学家需要知道 AI 模型为什么将特定的形态学特征与特定的表达谱联系起来。注意力映射(如 Grad-CAM)可以提供一些线索,但仍然不完全。
案例研究:乳腺癌三级淋巴结构的发现
*(案例基于 2024-2025 年的多项研究,综合而成)*
背景:乳腺癌患者对免疫治疗的反应差异很大。已知三级淋巴结构(TLS)的存在与更好的预后和免疫治疗反应相关。但 TLS 在常规 H&E 切片上很难识别(依赖病理学家的主观判断),而且 TLS 的基因表达特征还不完全清楚。
方法:研究人员收集了 50 个乳腺癌样本,其中 30 个有空间转录组数据(10x Visium)和配对的 H&E 图像,20 个仅 H&E。
-
在 30 个配对样本上训练多模态模型,学习从 H&E 图像预测淋巴相关基因(CD3D、CD79A、CXCL13 等)的表达。
-
将模型应用于 20 个仅有 H&E 的样本(来自独立的队列)。
-
在预测的“高 TLS 信号”区域,使用免疫组化验证 TLS 的存在。
发现:
-
模型识别出一种形态学模式:紧密聚集的淋巴细胞与树突状细胞相邻,周围有高内皮微静脉,与高 TLS 信号强烈相关。
-
在 H&E 仅有的队列中,预测高 TLS 的样本的 5 年无病生存率显著高于预测低 TLS 的样本(p = 0.008),这与已知的 TLS 有利预后吻合。
-
更重要的是,模型发现了一个新的与 TLS 相关的空间基因程序:它不仅包含免疫标记,还包含一些基质相关的基因(如 COL12A1、LUM),提示 TLS 的形成可能需要特定的成纤维细胞生态位。
意义:不需要额外的空间转录组实验,仅从常规 H&E 染色就可以预测 TLS 和患者预后,使得回顾大型存档队列成为可能。
未来展望:下一代多模态空间生物学
在 2026 年及以后,可以期待以下发展:
-
基座模型:类似于 LLM(如 Llama 3),将出现空间生物学基座模型,在数百万个组织图像和数百万个空间转录组 spot 上预训练。输入是一张组织图像,输出可以是基因表达预测、细胞类型分割、甚至药物反应预测。一个例子是 STFound 或 GeneCompass 的扩展版本。
-
实时多模态导航:结合显微镜控制,AI 可以实时分析正在扫描的切片,并指导“进入”特定区域进行空间转录组或蛋白质组分析(如“这个区域看起来像肿瘤边界,采样这里”)。
-
生成式的图像到表达:扩散模型(类似 Stable Diffusion)可以生成给定形态学条件下的“虚拟”基因表达空间图谱。这可以用于数据增强,甚至探索“如果这个组织的形态改变,基因表达会怎么变化”的反事实场景。
-
与临床工作流的整合:病理科常规 H&E 染色切片可以通过多模态 AI 模型“虚拟染色”特定的 RNA 或蛋白质标记,而不需要 IHC 或空间转录组——这将降低成本和缩短诊断时间。
实用建议:入门多模态空间分析
如果你有兴趣将多模态 AI 应用于自己的研究,这里有一个三步路径:
第一步:建立规范和公共数据基础
-
从公共数据库收集配对数据:Spatial Research Database(spatialresearch.org)、STOmicsDB、UCSC Cell Browser 的空间数据。
-
使用这些数据运行和比较不同的整合方法(参见 GitHub 上的
multimodal-spatial-benchmark)。
第二步:从简单的 deconvolution 开始
-
使用不需要深度学习的方法,如 RCTD 或 Cell2location,将空间数据与单细胞参考数据结合。这可以成为分析的“黄金标准”,用于与更复杂的 AI 方法比较。
第三步:逐步引入深度学习方法
-
从 SpaGCN(图卷积网络,整合空间信息和组织学图像)开始,这是较容易上手且文档完善的方法。
-
如果你的数据集足够大(>50 个切片),可以尝试 Hist2RNA 或 ST-Net。
-
使用 Captum 或 SHAP 来可视化模型的注意力,以保持可解释性。
警告:伦理和可重复性考虑
-
不能替换病理学家:即使 AI 模型在 H&E 上预测 TLS 达到 AUC=0.92,它也不应单独用于临床决策。需要人机交互验证。
-
可重复性危机:由于计算和数据需求的差异,多模态 AI 研究的可重复性是一个严重问题。发布代码、模型权重以及完整的 Docker 环境是强制性的。
-
偏见问题:如果训练数据集中在某些人口比例、组织类型或扫描仪品牌,模型可能不通用。在发表之前,在独立队列上验证是关键。
总结:整合的力量
AI 驱动的空间转录组学和数字病理学的整合正在打开一扇门,使我们能够在组织结构背景下观察基因表达,而不仅仅是在解离的细胞悬液中。
这种整合不是学术奢侈品,而是对许多生物学问题的必要条件:
-
肿瘤-免疫相互作用的实际空间性质
-
发育中组织的自组织原则
-
神经科学中空间定位与细胞身份的关联
随着技术的成熟和更多配对数据的生成,我们可能很快就会看到“空间生物学作为服务”——研究人员可以将他们的组织切片寄送出去,得到一份完整的、集成的 H&E + 空间转录组 + AI 解析的报告。