Multi-omics single-cell data integration and regulatory inference with graph-linked embedding¶
Cao, Zhi-Jie; Gao, Ge · 2022 · Nature Biotechnology
Metadata
Authors: Cao, Zhi-Jie; Gao, Ge
DOI: 10.1038/s41587-022-01284-4
Tags: #single-cell-multiomics #variational-autoencoder #regulatory-inference
概述(Overview)¶
摘要概述¶
本文提出 GLUE(graph-linked unified embedding),一个用于整合 unpaired 单细胞多组学数据并推断调控关系的计算框架。核心思路是为每个组学层(如 scRNA-seq、scATAC-seq、snmC-seq)配备独立的 variational autoencoder 学习低维 cell embedding,再用一个基于先验生物知识的"guidance graph"显式建模跨层调控交互(如有向边连接 ATAC peak 与下游基因),通过 graph variational autoencoder 学习 feature embedding,并以对抗学习对齐不同组学层的 cell embedding。在 SNARE-seq、SHARE-seq、10X Multiome 三个 gold-standard 数据集上的系统 benchmark 表明,GLUE 在 biology conservation、omics mixing 和单细胞对齐误差(FOSCTTM)上均优于 UnionCom、Pamona、MMD-MA、Online iNMF、LIGER、Harmony、bindSC、Seurat v3 等方法,且对先验知识损坏(高达 90%)、数据下采样和超参数变化均表现出强鲁棒性。GLUE 还可扩展到 triple-omics 整合(mouse cortex 的 RNA + ATAC + DNA methylation)并支持百万级细胞的 scalable 对齐,用于人类细胞图谱构建时甚至纠正了既有注释。
研究问题与假设¶
- 研究问题:如何整合 unpaired 单细胞多组学数据(不同组学层有不同 feature space 且细胞不配对),同时推断跨层调控关系?
- 研究动机:同时测量多组学的实验方法(SNARE-seq、SHARE-seq等)仍受限于低通量和低数据质量,大多数单细胞数据仍是 unpaired 的单组学;现有整合方法要么依赖 feature conversion 导致信息损失,要么难以扩展到两层以上或百万级细胞
- 可检验假设:通过 guidance graph 显式建模跨层调控交互,可以在不依赖 feature conversion 的前提下桥接不同组学层的 feature space,同时实现准确的 cell 对齐和调控推断
- 未研究的范围:paired 多组学数据的 mosaic integration 仅作为扩展提出未实现;跨物种整合仅作为概念框架未验证
研究设计与方法¶
- 对象、样本与对照:三个 gold-standard paired 数据集(SNARE-seq、SHARE-seq、10X Multiome,§Results PDF p.2)+ 两个 unpaired 数据集(Nephron、MOp);对照方法 9 种(UnionCom、Pamona、MMD-MA、Online iNMF、LIGER、Harmony、bindSC、Seurat v3、Cicero),Fig.2(PDF p.3)
- 测量与变量:输入为各组学层的 count matrix(如 scRNA-seq 的 gene×cell、scATAC-seq 的 peak×cell);输出为 aligned cell embedding 和 feature embedding(regulatory score);评价指标为 biology conservation score、omics mixing score、FOSCTTM(fraction of samples closer than true match),§Methods(PDF p.10-11)
- 分析流程与统计方法:每个组学层用独立 VAE 学习 cell embedding → guidance graph 用 GVAE 学习 feature embedding → data decoder 用 cell×feature 内积重建数据 → 对抗 discriminator 对齐不同层 cell embedding;训练用 RMSprop(无 momentum 保证对抗稳定),§Methods Eq.(1-20)(PDF p.10-11)
- 关键材料、参数与单位:embedding 维度 m 共享;guidance graph 边权 w∈(0,1] 表示可信度、符号 s∈{−1,1} 表示调控方向;λD 和 λG 控制对抗对齐和 graph 贡献
核心结果与证据¶
主要发现 1:GLUE 在三个 gold-standard 数据集上全面优于 9 种对照方法¶
- 结论:GLUE 在 biology conservation、omics mixing 和 FOSCTTM 三个维度上均为最佳方法;FOSCTTM 比 second-best 降低 1.5-3.6 倍
- 证据定位:Fig.2a-c(PDF p.3),§Results(PDF p.2-3)
- 关键数据:SNARE-seq FOSCTTM 降低 3.6 倍;SHARE-seq 1.7 倍;10X Multiome 1.5 倍;n=8 repeats with different random seeds
- 作者解释:GLUE 的优势来自 deep generative model 设计——相比 coupled matrix factorization [20,21] 有更强的非线性编码能力,相比 feature conversion [15-18] 避免了信息损失
- 我的判断:benchmark 设计全面(3 数据集 × 9 方法 × 3 指标),但所有数据集都是 paired 数据被人为拆分为 unpaired——真实 unpaired 场景下缺少 ground truth 无法计算 FOSCTTM
主要发现 2:GLUE 对先验知识损坏 90% 仍保持鲁棒¶
- 结论:即使 guidance graph 中 90% 的边被替换为错误边,GLUE 的 FOSCTTM 变化仍为所有方法中最小
- 证据定位:Fig.2d(PDF p.3),§Results(PDF p.2)
- 关键数据:90% corruption rate 下 GLUE 的 FOSCTTM 增幅 <0.1,而 conversion-based 方法大幅退化
- 作者解释:GLUE 的 guidance graph 仅用于初始化 feature embedding 的语义方向,对抗对齐和数据重建的信号足以纠正先验知识的不准确
- 我的判断:这是 GLUE 最有说服力的结果——实际应用中先验知识(如 peak-gene linking)确实不完整且有误。但"鲁棒"不等于"不受影响"——90% 损坏下 FOSCTTM 仍有可测量的增加
主要发现 3:GLUE 实现 triple-omics 整合并量化表观调控贡献¶
- 结论:GLUE 成功整合 mouse cortex 的 scRNA-seq + scATAC-seq + snmC-seq 三层组学,并发现 mCH(非 mCG)对神经元基因表达有最高预测力(R²=0.187),三层组合进一步提升(R²=0.236)
- 证据定位:Fig.3a-f(PDF p.4),§Results(PDF p.3-4)
- 关键数据:mCH R²=0.187 > mCG > ATAC;三层组合 R²=0.236;14 个 cell type 中 12 个 marker overlap FDR<5×10⁻¹⁷
- 作者解释:mCH 对长基因预测力更高,chromatin accessibility 对高变异基因贡献更大——非冗余的表观调控贡献
- 我的判断:triple-omics 整合是 GLUE modular 设计的展示——通过简单添加第三个 VAE 和 guidance graph 负边即可扩展。R²=0.236 表明仍有大量变异未被解释
次要结果与负结果¶
GLUE 在 <1000 cells 时对齐误差急剧增加(Fig.2e, PDF p.3)——神经网络在小数据集上 undertraining 问题。snmC-seq 的 mIn-1 细胞未正确对齐(Fig.3e, PDF p.4)。
关键图表¶
- 图表定位:Figure 1
- 展示内容:GLUE 架构图——K 个组学层各有 VAE(encoder+decoder),guidance graph 用 GVAE 学习 feature embedding,data decoder 用 cell×feature 内积重建数据,对抗 discriminator 对齐不同层
- 支持的结论:清晰展示了 modular 设计和跨层桥接机制
- 阅读注意:graph decoder 无可训练参数(θG=∅),graph likelihood 由 inner product + sigmoid 定义
局限、不确定性与可复现性¶
作者承认的局限¶
- guidance graph 限于 multipartite graph(仅跨层边,无同层交互),§Discussion(PDF p.7)
- 数据 decoder 的线性性(inner product)限制了 decoder capacity——但非线性 encoder 补偿了这一点
- 推断的调控关系是全数据集聚合的,可能是多个 spatiotemporal-specific 电路的混合,§Discussion(PDF p.7)
- cross imputation 功能可能导致 artifact [55],需进一步研究,§Discussion(PDF p.7)
我识别的局限¶
- benchmark 数据集都是 paired 数据人为拆分——真实 unpaired 场景缺少 ground truth,FOSCTTM 无法计算
- guidance graph 的 edge weight 和 sign 来自先验知识但未量化不确定性——不同 edge可信度差异未传递到 feature embedding
- 对抗训练的稳定性依赖 RMSprop 无 momentum 和超参数 λD/λG——对超参数的敏感性虽测试但未给出 failure mode
数据、代码与复现条件¶
- 数据:SNARE-seq、SHARE-seq、10X Multiome、Nephron、MOp 公开数据集;mouse cortex 三组学数据来自 [3,37,38]
- 代码:https://github.com/gao-lab/GLUE,Python,公开可用
- 关键复现条件:GLUE Python 包;GPU 训练(百万级细胞需要)
- 可复现性判断:可复现——代码公开、数据公开、超参数文档完整
个人批注¶
与我的工作的关系¶
作为计算生物力学研究者,本文与我当前血管 G&R 课题的直接关联有限——它聚焦单细胞多组学整合的计算方法。但 GLUE 的 guidance graph 思路(用先验知识图桥接不同 feature space)可迁移到多模态生物数据的整合:如将血管影像数据(几何/力学)与分子数据(基因/蛋白)通过力学-生物学 coupling graph 桥接。feature embedding 的 cosine similarity 作为"调控 score"的思路也可用于推断 G&R 参数间的耦合关系。
可复用点¶
- guidance graph + GVAE 框架——用先验知识图桥接不同 modality 的 feature space
- 对抗对齐 + weighted discriminator 解决 cell type composition 不均衡问题
- modular 设计——每个 modality 独立 VAE 可按需扩展
疑问与后续动作¶
- guidance graph 的 edge weight 如何量化不同先验知识的可信度?文中 w∈(0,1] 但未给出具体赋值方法
- 后续了解 GLUE 是否可用于整合血管力学数据(如 FEM 仿真输出)与转录组数据
与上下文的关系¶
本文建立在¶
建立在 VAE for single-cell data(scVI, Lopez et al. [30])、graph variational autoencoder(Kipf & Welling [32])和对抗对齐(MMD-MA, UnionCom [22-25])之上。Cell BLAST [31] 是同一团队的前驱工作。
已核实的后续引用¶
本次未检索。
同类工作对比¶
与 Online iNMF [16]:Online iNMF 是唯一能处理 triple-omics 和百万级细胞的对照方法,但在 cell type 分辨率和表观调控相关性上远不如 GLUE(Supplementary Fig.11, 22)。与 Seurat v3 [15]:Seurat v3 依赖 feature conversion,在百万级 metacell 整合上失败(Supplementary Fig.22c,d)。
与本地论文队列的关系¶
2023-SingleCellAthero-deWinther:单细胞转录组在动脉粥样硬化中的应用——GLUE 可用于整合该领域的 scRNA-seq + scATAC-seq 数据2021-ReproducibleML-NatComputSci:GLUE 的 benchmark 设计(多数据集、多方法、多指标)体现了可复现 ML 研究的标准2019-ML-Multiscale-Alber:ML 与 multiscale modeling 的互补——GLUE 的 guidance graph 可视为连接分子层与宏观层的"knowledge bridge"
逐章节笔记(Section-by-Section Notes)¶
Introduction¶
段落 1:单细胞多组学的挑战¶
- 核心论点:单细胞测序技术可以探测多组学层(染色质开放性、DNA 甲基化、转录组),但不同组学通常独立测量产生 unpaired 数据,需要有效的计算整合方法
- 支撑论据:
- scATAC-seq(Cusanovich et al. 2015;Chen et al. 2018)测量染色质开放性,feature 为 accessible chromatin regions
- snmC-seq(Luo et al. 2017)和 sci-MET(Mulqueen et al. 2018)测量 DNA 甲基化,feature 为 methylation sites
- scRNA-seq(Picelli et al. 2013;Zheng et al. 2017)测量转录组,feature 为 genes
- 不同组学的 feature space 各异(accessible regions vs genes vs methylation sites),且通常独立测量,产生 unpaired 数据
-
同时测量多组学的实验方法(SNARE-seq、SHARE-seq、scNMT-seq 等)虽已出现,但仍未普及
-
我的分析:unpaired multi-omics integration 是"diagonal integration"——最难的整合场景因为没有共享 feature 也没有共享 cell。作者准确识别了核心障碍
段落 2:现有方法的局限¶
- 核心论点:现有方法要么依赖 feature conversion 导致信息损失 [19],要么限于两层 [20,21],要么只在小数据集上验证 [22-25]
- 支撑论据:
- feature conversion(将 ATAC peak 映射到基因 activity score)被 Chen et al. 2019 报道存在信息损失
- coupled matrix factorization(Duren et al. 2018;Zeng et al. 2019)可绕过显式转换,但难以处理超过两层组学
- nonlinear manifold alignment(SCOT, Demetci et al. 2022;Pamona, Cao et al. 2021;MMD-MA, Singh et al. 2020)无需先验知识,但多在小数据集和有限 cell type 上验证
-
数据规模持续增长:Svensson et al. 2018 指出 scRNA-seq 通量呈指数增长,近期已产生百万级细胞数据集(Kozareva et al. 2021;Cao et al. 2020;Domcke et al. 2020),而现有整合方法仅在小数据集上验证
-
我的分析:文献定位清晰——GLUE 的定位是"不依赖 feature conversion + 可扩展到多层 + 可处理百万级数据"。这三个属性的组合是本文的核心贡献
段落 3:GLUE 框架介绍¶
- 核心论点:GLUE 用 guidance graph 显式建模跨层调控交互,桥接不同组学 feature space,同时支持整合和调控推断
- 支撑论据:
- 每个组学层配备独立的 variational autoencoder(受 scVI, Lopez et al. 2018;Cell BLAST, Cao et al. 2020 启发),用 probabilistic generative model 适配该层特有的 feature space
- 引入 guidance graph(知识图谱),其顶点为不同组学层的 features(如 genes、ATAC peaks),边为 signed regulatory interactions(如 ATAC peak 到下游基因的正向调控边)
- 通过 graph variational autoencoder(Kipf & Welling 2016)编码 feature embeddings,驱动对抗式多模态对齐
- 迭代优化收敛后,graph 可由对齐结果 refine 并用于数据驱动的调控推断
-
代码公开于 https://github.com/gao-lab/GLUE
-
我的分析:guidance graph 是 GLUE 与所有前驱方法的本质区别——它将先验生物学知识(peak-gene 关联)作为"软约束"而非"硬转换"使用
Methods¶
段落 1:GLUE 框架数学表述¶
- 核心论点:GLUE 假设各层细胞状态由共享低维 latent variable u 生成,各层有独立 VAE(encoder q(u|x_k;φ_k) + decoder p(x_k|u,V;θ_k)),feature embedding V 由 guidance graph G 通过 GVAE 学习
- 支撑论据:
- 生成模型假设:各层细胞状态由共享低维 latent variable u ∈ R^m 生成,p(x_k;θ_k) = ∫p(x_k|u;θ_k)p(u)du(Eq.1)
- 每层有独立 VAE:data encoder q(u|x_k;ϕ_k) 为 diagonal-covariance normal 分布的 MLP;data decoder p(x_k|u,V;θ_k) 用 cell×feature 内积重建数据(类似 PCA loading)
- guidance graph G=(V,E):V=∪V_k 为全部 features,边带符号 s_ij∈{−1,+1} 和权重 w_ij∈(0,1];边权可解释为交互可信度,符号指定调控方向(如 ATAC peak→基因为正边,DNA 甲基化→基因为负边)
- feature embeddings v_i ∈ R^m 由 graph variational autoencoder(GCN encoder, Kipf & Welling 2017)从 guidance graph 学习;graph decoder 用 inner product + sigmoid + negative sampling 定义(Eq.6),且 θ_G=∅(无可训练参数)
- 对 count-based scRNA-seq/scATAC-seq 使用 negative binomial 分布(Eq.7-9),μ_i = Softmax_i(α⊙V_k^T u + β)·Σx_kj 保证 library size 一致
- 变分后验因式分解:q(u,V|x_k,G;ϕ_k,ϕ_G) = q(u|x_k;ϕ_k)·q(V|G;ϕ_G)(Eq.10)
-
ELBO 分解为 K·L_G + Σ L_Xk(Eq.15-17):graph loss 训练 feature embedding,data loss 训练 cell embedding + decoder,两者通过 feature embedding 在 data decoder 中的 inner product 耦合
-
我的分析:ELBO 分解为 K·L_G + Σ L_Xk 是关键——graph loss 训练 feature embedding、data loss 训练 cell embedding + decoder,两者通过 feature embedding 在 data decoder 中的 inner product 耦合
段落 2:对抗对齐与训练¶
- 核心论点:K-class discriminator 对齐不同层 cell embedding;weighted discriminator 解决 cell type composition 不均衡;RMSprop 无 momentum 保证对抗稳定
- 支撑论据:
- K-class discriminator D(softmax 输出)预测 cell embedding 的组学层归属,用 cross-entropy 训练(Eq.18)
- data encoders 反向训练以欺骗 discriminator,等价于最小化 generalized Jensen-Shannon divergence(Eq.21),收敛到 q_i(u)=q_j(u), ∀i≠j
- weighted adversarial alignment:引入 cell-specific weight w^(n) 归一化各层贡献(Eq.22),通过 Leiden 聚类后用余弦相似度^4 计算平衡权重(Eq.23-24),解决 cell type composition 不均衡问题
- 两阶段训练:第一阶段 w^(n)=1 预训练并加噪声 ε~N(0,Σ)(Σ=1.5×batch 方差)获得粗对齐;第二阶段用估计权重 fine-tune,噪声线性退火至 0
- 两步迭代:先按 Eq.19 更新 discriminator,再按 Eq.20 更新 data/graph autoencoders;RMSprop 无 momentum 保证对抗稳定
-
超参数 λ_D、λ_G 控制对抗对齐和 graph 贡献;退火 epoch 数自动设置为 0.002 学习率下等价于 4,000 iterations
-
我的分析:weighted adversarial alignment 解决 atlas-scale 中 cell type 不均衡问题——这是百万级整合的关键。Jensen-Shannon divergence 的等价关系提供了理论保证
Results¶
段落 1:GLUE 架构概述¶
- 核心论点:GLUE 由三部分组成——(1) 各组学层独立 VAE 学习 cell embedding;(2) guidance graph 用 GVAE 学习 feature embedding;(3) 对抗 discriminator 对齐不同层 cell embedding
- 支撑论据:
- 三组件架构:各组学层独立 VAE 学习 cell embeddings U_1, U_2, U_3;guidance graph G=(V,E) 用 GVAE 学习 feature embeddings V;对抗 discriminator D 对齐不同层 cell embeddings
- 嵌入维度 m 在各层间共享,但数据维度 |V_k| 和 generative distribution 可不同
- data decoder 用 cell embedding 与 feature embedding 的内积重建数据(类似 PCA loading),feature embeddings 由 guidance graph 调制使语义跨层链接
- graph decoder 用 inner product + sigmoid 重建 graph 边,配合 negative sampling 训练
-
线性 decoder 虽限制 capacity,但非线性 encoder 补偿,实证显示高质量多组学对齐
-
我的分析:data decoder 的线性性(inner product)是有意的设计——它让 feature embedding 获得明确的语义(类似 PCA loading),同时由非线性 encoder 补偿表达能力。这是一个 principled 的 trade-off
段落 2:系统 benchmark——biology conservation 和 omics mixing¶
- 核心论点:GLUE 在 biology conservation(cell type 分离保持)和 omics mixing(同类型 cell 跨层混合)上同时达到最优,且 overall score 在所有三个数据集上均为最佳
- 支撑论据:
- 在三个 gold-standard paired 数据集(SNARE-seq, Chen et al. 2019;SHARE-seq, Ma et al. 2020;10X Multiome)和两个 unpaired 数据集(Nephron, Muto et al. 2021;MOp, Yao et al. 2021)上对比 9 种方法(UnionCom、Pamona、MMD-MA、Online iNMF、LIGER、Harmony、bindSC、Seurat v3)
- biology conservation 由三个子指标量化:mean average precision (MAP)、cell type ASW、neighbor consistency (NC)
- omics mixing 由三个子指标量化:Seurat alignment score (SAS)、omics layer ASW、graph connectivity (GC)
- overall integration score = 0.6×biology conservation + 0.4×omics mixing
- GLUE 在所有 benchmark 数据集上 overall score 均为最佳,同时达到高 biology conservation 和高 omics mixing
- n=8 repeats with different model random seeds(Harmony 和 bindSC 为确定性实现仅运行一次)
-
UMAP 可视化验证了 aligned cell embeddings 的一致性
-
我的分析:biology conservation 和 omics mixing 通常存在 trade-off——强行混合可能破坏 biology 结构。GLUE 同时优化两者说明 guidance graph 提供了正确的"锚定"
段落 3:FOSCTTM——单细胞级对齐精度¶
- 核心论点:GLUE 在三个 gold-standard 数据集上 FOSCTTM 最低,比 second-best 降低 1.5-3.6 倍
- 支撑论据:
- FOSCTTM(fraction of samples closer than the true match, Singh et al. 2020)在三个 gold-standard 数据集上评估单细胞级对齐精度,值越低越准确
- GLUE 在 SNARE-seq、SHARE-seq、10X Multiome 三个数据集上均取得最低 FOSCTTM
- 相比 second-best 方法,对齐误差降低幅度:SNARE-seq 3.6 倍、SHARE-seq 1.7 倍、10X Multiome 1.5 倍
-
n=8 repeats with different model random seeds
-
我的分析:SNARE-seq 上 3.6 倍的降低幅度非常大——可能是 SNARE-seq 数据质量较低使得其他方法表现差而 GLUE 鲁棒
段落 4:先验知识损坏鲁棒性¶
- 核心论点:GLUE 在 90% guidance graph 边被替换为错误边时仍保持最小性能变化
- 支撑论据:
- 通过随机替换 varying fractions 的 existing peak-gene interactions 为 nonexistent interactions 测试鲁棒性,corruption rate 从 0% 到 90%
- 在所有三个 gold-standard 数据集上,GLUE 即使在 90% corruption rate 下仍表现出最小的 FOSCTTM 变化
- 使用 alternative guidance graph(在更大 genomic window 内连接 peak-gene)对整合性能影响最小
-
corruption 程序重复 8 次不同 random seeds;feature conversion 同样使用 corrupted guidance graph 重复
-
我的分析:这是 GLUE 最强的卖点——实际应用中 peak-gene linking 的先验知识确实不完整(如 enhancer 可能距离基因 100kb+)。鲁棒性来自 guidance graph 仅初始化 feature embedding 方向,数据信号可纠正先验错误
段落 5:数据下采样和超参数鲁棒性¶
- 核心论点:GLUE 在 2000 cells 时仍为最佳方法,但 <1000 cells 时对齐误差急剧增加;超参数和 feature selection 设置对性能影响小
- 支撑论据:
- 使用 subsampled 数据集(250、500、1,000、2,000、4,000、8,000 cells)重复评估,GLUE 在少至 2,000 cells 时仍为 top-ranking 方法
- 当数据量降至 <1,000 cells 时,alignment error 陡增(神经网络 undertraining 问题)
- subsampling 重复 8 次不同 random seeds,scRNA-seq 和 scATAC-seq 成对下采样以保持 FOSCTTM 可计算
- 整合性能对广泛的 hyperparameter 和 feature selection 设置均稳健
-
feature embeddings 同样表现出对 hyperparameter 设置、先验知识损坏和数据下采样的鲁棒性
-
我的分析:<1000 cells 的退化是 VAE 的固有限制——undertraining。作者诚实报告了这一局限。实际应用中单细胞数据通常 >2000 cells,这一限制可接受
段落 6:batch correction 和 integration consistency¶
- 核心论点:GLUE 通过将 batch 作为 decoder covariate 实现 batch correction;integration consistency score 检测不一致整合(如不同组织的数据被强行整合)
- 支撑论据:
- batch correction 实现:将 batch 作为 data decoder 的 covariate,使 α、β、θ 等 learnable parameters 变为 batch-dependent(Eq.25-27)
- SHARE-seq 数据分 4 个 library 处理,其中 1 个在 scRNA-seq 中显示 batch effect;启用 batch correction 后 GLUE 有效校正,产生显著更好的 batch mixing
- Nephron 数据来自 4 个 donor,在 scRNA-seq 和 scATAC-seq 中均显示 substantial batch effect;GLUE 校正后混合理想
- integration consistency score:先用 k-means 联合聚类所有层 cells 形成 metacells,再计算 guidance graph 各边的 Spearman 相关,取按符号取反并按权重加权平均
-
不一致组织的数据被强行整合时 score 显著降低(接近 0),同组织内整合时 score 高,可作为整合质量可靠指标
-
我的分析:integration consistency score 是实用的安全机制——防止"过度校正"将不同组织的数据强行混合。这在大规模 atlas 整合中至关重要
段落 7:Triple-omics 整合¶
- 核心论点:GLUE 成功整合 mouse cortex 的 RNA + ATAC + DNA methylation 三层组学,支持正负调控边(DNA 甲基化为负边)
- 支撑论据:
- 整合 mouse cortex 的三层组学:gene expression(Saunders et al. 2018)、chromatin accessibility(10X Genomics 2019)、DNA methylation(snmC-seq, Luo et al. 2017)
- gene body DNA methylation 与基因表达呈负相关(Mo et al. 2015),GLUE 通过 guidance graph 的负边建模此调控效应,避免 data inversion(之前方法 Gao et al. 2021;Welch et al. 2019 需要翻转数据可能破坏 sparsity 和分布)
- 三层 guidance graph:mCH 和 mCG 水平通过负边连接到基因,ATAC peak 到基因保持正边
- GLUE 成功揭示三层组学间的 shared cell state manifold
- 14 个 mapped cell types 中 12 个具有高度显著的 marker overlap(three-way Fisher's exact test, Wang et al. 2015,FDR < 5×10⁻¹⁷)
- 标签转移改进 cell typing:scRNA-seq "MGE" 分为 Pvalb⁺(mPv)和 Sst⁺(mSst);"CGE" 和 scATAC-seq "Vip" 分为 Vip⁺(mVip)和 Ndnf⁺(mNdnf);识别 snmC-seq "mDL-3" 和部分 scATAC-seq "L6 IT" 为 claustrum cells
- mCH 对基因表达预测力最高(average R²=0.187),三层组合提升至 R²=0.236,提示非冗余表观调控贡献
- DNA methylation(尤其 mCH)对 deeper cortical layers 的基因表达预测力略高于 superficial layers
- mCH 对更长基因预测力更高(与 Welch et al. 2019;Gabel et al. 2015 一致),chromatin accessibility 对高变异基因贡献更大
-
online iNMF(唯一其他可三层同时整合的方法)产生更低的 cell type 分辨率和表观相关性
-
我的分析:DNA 甲基化作为负边的处理避免了 data inversion(之前方法需要翻转数据 [16,17] 可能破坏 sparsity)。mCH > mCG 的预测力与神经元中 mCH 的功能重要性一致 [39]。R²=0.236 提示大量变异未解释——可能需要更多调控层(如组蛋白修饰)
段落 8:整合调控推断¶
- 核心论点:feature embedding 的 cosine similarity 作为"调控 score"可推断 cis-regulatory interaction,且优于经验 peak-gene correlation 和 coaccessibility 方法
- 支撑论据:
- feature embeddings 的 cosine similarity 同时反映 guidance graph 先验和观测数据,被采用为"regulatory scores"
- 使用 10X Multiome PBMC 数据集作为 unpaired scRNA-seq + scATAC-seq 输入;为捕获远程 cis 调控,guidance graph 在 150-kb window 内连接 peak-gene,边权由模拟 chromatin contact probability 的 power-law 函数 w=(d+1)⁻⁰·⁷⁵ 加权(Dekker et al. 2013;Pliner et al. 2018)
- regulatory score 与 genomic distance 负相关,与 empirical peak-gene correlation(paired cells 计算)正相关,跨 random seeds 稳健
- 与外部证据对比:regulatory score 对 pcHi-C(Javierre et al. 2016)支持的 peak-gene pair 在所有 distance range 上更高;对 eQTL(GTEx, Aguet et al. 2017)同样成立
- GLUE 预测 pcHi-C 的 AUROC=0.631,优于 Cicero(0.548)、LASSO(0.547)、Spearman correlation(0.555)
- 可通过 composite guidance graph 整合 pcHi-C 和 eQTL 证据,multi-omics 对齐对 graph 变化不敏感但推断的调控交互显示更强 enrichment
- corrupted 的 interactions 即使在 guidance graph 中被损坏也能以 FDR<0.05 被恢复
- GLUE 推断的 TF-target 网络与 TRRUST v2 数据库(Han et al. 2018)的一致性优于单一证据网络
-
案例验证:SPI1(已知 NCF2 的调控因子)识别出 3 个 remote regulatory peaks(约 120kb 下游、25kb 下游、20kb 上游 of TSS),均被 SPI1 结合;CD83 识别出 3 个新调控 peaks 富集 BCL11A、PAX5、RELB 三种 TF 结合
-
我的分析:调控推断是 GLUE 的独特能力——其他整合方法不产生 feature embedding。Bayesian 解读(guidance graph 为先验、数据为似然、feature embedding 为后验)是理论优雅的。但 AUROC=0.631 仍有提升空间
段落 9:Atlas-scale 百万级细胞整合¶
- 核心论点:GLUE 成功整合人类细胞图谱的百万级 RNA + ATAC 数据,并纠正了既有注释错误(如"Astrocytes"实际为多能神经前体)
- 支撑论据:
- 整合人类胎儿 cell atlas:gene expression(Cao et al. 2020)和 chromatin accessibility(Domcke et al. 2020)两个百万级 cell 数据集
- GLUE 作为神经网络采用 minibatch 优化,实现 sublinear time cost(相对 cell 数量),保证 atlas-scale 可用性
- 采用 multistage training strategy:pretraining 阶段用 k-means(scRNA-seq k=100,000,scATAC-seq k=40,000)聚合 metacell 并加噪声粗对齐;fine-tune 阶段在全单细胞数据上用 weighted adversarial alignment,hidden layer 维度从默认 256 翻倍至 512
- 纠正注释错误:scATAC-seq 中原标注为"Astrocytes"的 cluster 实际对齐到 scRNA-seq 的"Excitatory neurons" cluster
- 进一步检查发现该 cluster 中 PAX6、HES1、HOPX(Thomsen et al. 2016;Pollen et al. 2015 报道的 radial glial markers)在 RNA 和 ATAC domain 均活跃转录,chromatin priming 在 neuronal 和 glial markers 均检测到,提示该 cluster 实为 multipotent neural progenitors(radial glial progenitors)而非原标注的 excitatory neurons 或 astrocytes
- 还解决了 scATAC-seq "Astrocytes/Oligodendrocytes" 模糊 cluster 的拆分,对齐到 scRNA-seq 的"Astrocytes"和"Oligodendrocytes"
-
对比方法:online iNMF 是唯一其他能 full-scale 整合的方法,但结果远非最优;Seurat v3 在 aggregated metacell 上也失败
-
我的分析:百万级整合是 GLUE scalability 的最强证明。注释纠正(Astrocytes→radial glial progenitors)展示了多组学整合的数据驱动价值——跨 modality 一致性比单一 modality 注释更可靠
Discussion¶
段落 1:GLUE 的设计哲学¶
- 核心论点:GLUE 结合 omics-specific autoencoder + graph-based coupling + adversarial alignment,通过显式建模调控交互实现 unique 的整合调控推断
- 支撑论据:
- 三组件设计:omics-specific autoencoders + graph-based coupling + adversarial alignment
- 通过显式建模跨层调控交互,GLUE 独特地支持 unpaired 多组学数据的 integrative regulatory inference
- Bayesian 解读:guidance graph 作为 prior、观测数据作为 likelihood、feature embedding 作为 posterior estimate,可在新数据到达时持续 refine
-
Graph decoder 无可训练参数(θ_G=∅),graph likelihood 由 inner product 定义——与完整 Bayesian 模型存在差距
-
我的分析:Bayesian 解读是理论框架的优雅包装——但实际实现中 graph decoder 无可训练参数(θG=∅),graph likelihood 由 inner product 定义,与完整 Bayesian 模型有差距
段落 2:与 batch correction 和其他方法的比较¶
- 核心论点:unpaired multi-omics 整合比 batch correction 更难(不同 feature space);feature conversion 有信息损失;supervised 方法依赖 cell type 标注不通用
- 支撑论据:
- unpaired multi-omics integration 与 batch effect correction(Tran et al. 2020)概念相似但更难,因为不同组学有 distinct、omics-specific feature spaces
- feature conversion 的信息损失(Chen et al. 2019)可能有害;Seurat v3(Stuart et al. 2019)和 bindSC(Dou et al. 2020)设计 heuristic 策略保留原始 feature 信息,性能优于不做转换的方法(Gao et al. 2021;Welch et al. 2019)
- supervised 方法(Stark et al. 2020;Yang et al. 2021)依赖 matched cell types 引导整合,但这类监督通常不可得——在许多场景下 cell type 标注本身就是整合的目的(Domcke et al. 2020)
- Yang et al. 2021 采用类似 autoencoder + adversarial alignment 架构,但依赖 matched cell types 或 clusters 确定对齐方向
-
GLUE 与 coupled matrix factorization(Duren et al. 2018;Zeng et al. 2019)概念更相似,但 deep generative model 设计带来更优性能
-
我的分析:作者准确定位了 GLUE 在方法谱系中的位置——介于"feature conversion + single-omics method"和"unsupervised manifold alignment"之间,但用 guidance graph 提供了第三条路径
段落 3:模块化与可扩展性¶
- 核心论点:GLUE 的 modular 设计允许灵活扩展——data autoencoder 可替换 generative distribution(如 protein abundance [56]、histone modification [57]);guidance graph 可支持更复杂结构(within-modality 交互、multi-relation、hypergraph [62,63])
- 支撑论据:
- data autoencoders 可替换 generative distribution 适配不同组学:当前使用 negative binomial for scRNA-seq 和 scATAC-seq,zero-inflated log-normal for snmC-seq
- generative distribution 可扩展到 protein abundance(mass cytometry, Bandura et al. 2009)、histone modification(CUT&Tag, Bartosovic et al. 2021),以及新数据建模技术(如 PeakVI, Ashuach et al. 2022)
- guidance graph 当前限于 multipartite graph(仅跨层边),但可支持更复杂结构:within-modality interactions、nonfeature vertices、multi-relations
- 可采用更先进的 GNN 架构(GraphSAGE, Hamilton et al. 2017;GAT, Veličković et al. 2018;CompGCN, Vashishth et al. 2020)替代 canonical GCN 提取更丰富信息
-
hypergraph modeling(Hyper-SAGNN, Zhang et al. 2020;Higashi, Zhang et al. 2021)可建模涉及多调控因子的复合调控,支持此类交互的调控推断
-
我的分析:modular 设计是 GLUE 最具前瞻性的贡献——它不仅是一个工具而是一个框架。hypergraph 建模 [62,63] 对涉及多调控因子的复合调控有潜力
段落 4:paired 数据利用与未来方向¶
- 核心论点:GLUE 可扩展利用 paired 数据(添加 embedding 距离惩罚项)实现 mosaic integration;还可用于 cross-species 整合
- 支撑论据:
- paired multi-omics 实验技术(SNARE-seq、SHARE-seq、scNMT-seq、10X Multiome 等)虽增加数据可得性,但当前 simultaneous protocols 在数据质量和通量上仍低于 single-omics 方法(Stuart & Satija 2019)
- paired cells 在 anchoring 不同组学层上高度 informative,应与 unpaired cells 联合使用
- GLUE 框架可扩展利用 pairing 信息:通过添加 loss terms 惩罚 paired cells 的 embedding 距离(Amodio & Krishnaswamy 2018),实现 mosaic integration(Argelaguet et al. 2021 定义的一般情形)
- 框架也可用于 cross-species integration,尤其当 distal species 缺乏 one-to-one orthologs 时:将 orthologs 编入 guidance graph 进行整合无需 explicit ortholog conversion,概念上与 SAMap(Tarashansky et al. 2021)相关
-
当前调控推断基于全数据集,可能是多个 spatiotemporal-specific 电路的聚合;可通过 step-wise refinement(在单一组织上训练 dedicated 模型,引入 spatiotemporal-specific 先验, Jung et al. 2019)识别 spatiotemporal-specific 调控电路和关键调控因子
-
我的分析:mosaic integration(部分 paired + 部分 unpaired)是实际应用中的常见场景——GLUE 的扩展方向正确但未实现。cross-species 整合的 guidance graph 思路与 SAMap [66] 的连接有趣但需验证
Conclusion¶
段落 1:总结与展望¶
- 核心论点:GLUE 作为 modular 和 generalizable 框架为大规模多组学整合和单细胞分辨率调控图谱绘制创造了前所未有的机会
- 支撑论据:
- 重申 GLUE 作为 modular 和 generalizable 框架,通过大规模多组学整合在单细胞分辨率下绘制 gene regulatory map
- 承认 spatiotemporal-specific 调控仍是未解决问题——当前推断为全数据集聚合,需 step-wise refinement 扩展
- 承认 mosaic integration(paired + unpaired 混合)尚未实现,仅作为框架扩展方向提出
-
完整 GLUE 包含 tutorials 和 demo cases,公开于 https://github.com/gao-lab/GLUE 供社区使用
-
我的分析:结论有节制——未过度声称解决了所有问题。承认了 spatiotemporal-specific 调控和 mosaic integration 的未解决性。代码公开是重要的社区贡献
摘要概述¶
本文提出 GLUE(graph-linked unified embedding),一个用于整合 unpaired 单细胞多组学数据并推断调控关系的计算框架。核心思路是为每个组学层(如 scRNA-seq、scATAC-seq、snmC-seq)配备独立的 variational autoencoder 学习低维 cell embedding,再用一个基于先验生物知识的 "guidance graph" 显式建模跨层调控交互(如有向边连接 ATAC peak 与下游基因),通过 graph variational autoencoder 学习 feature embedding,并以对抗学习对齐不同组学层的 cell embedding。在 SNARE-seq、SHARE-seq、10X Multiome 三个 gold-standard 数据集上的系统 benchmark 表明,GLUE 在 biology conservation、omics mixing 和单细胞对齐误差(FOSCTTM)上均优于 UnionCom、Pamona、MMD-MA、Online iNMF、LIGER、Harmony、bindSC、Seurat v3 等方法,且对先验知识损坏(高达 90%)、数据下采样和超参数变化均表现出强鲁棒性。GLUE 还可扩展到 triple-omics 整合(mouse cortex 的 RNA + ATAC + DNA methylation)并支持百万级细胞的 scalable 对齐,用于人类细胞图谱构建时甚至纠正了既有注释。
关键图表¶
- Fig. 1(GLUE 架构):三层组学各自 VAE 编码 cell embedding U₁/U₂/U₃,guidance graph G=(V,E) 经 graph VAE 产生 feature embedding V,decoder 通过 U·Vᵀ 内积重建数据从而桥接异质 feature space,omics discriminator D 通过对抗学习对齐各层 cell embedding——这是整个方法的核心机制图。
- Fig. 2b(overall integration score):在三个 gold-standard 数据集上 GLUE 始终排名第一,综合 score = 0.6×biology conservation + 0.4×omics mixing,显著优于其他 8 种主流方法。
- Fig. 2d(robustness to prior knowledge corruption):即使 90% 的 guidance graph 边被随机替换为不存在的交互,GLUE 的 FOSCTTM 上升幅度仍最小,说明其对先验知识不精确性的鲁棒性远超依赖 feature conversion 的方法。
与我的关联¶
虽与我的 vascular G&R 力学课题不直接相关,但 GLUE 的 "graph-linked embedding" 思路——用显式的领域知识图桥接异质 feature space 再做对抗对齐——对处理多模态、多尺度数据融合有方法论启发,尤其是当不同数据源 feature space 不一致时如何引入先验结构而非简单投影。