Cao, Zhi-Jie, Gao, Ge · 2022 · Nature Biotechnology
#single-cell-multiomics #variational-autoencoder #regulatory-inference
??? info "Metadata" DOI: 10.1038/s41587-022-01284-4
📄 Quick Note¶
摘要概述¶
本文提出 GLUE(graph-linked unified embedding),一个用于整合 unpaired 单细胞多组学数据并推断调控关系的计算框架。核心思路是为每个组学层(如 scRNA-seq、scATAC-seq、snmC-seq)配备独立的 variational autoencoder 学习低维 cell embedding,再用一个基于先验生物知识的 "guidance graph" 显式建模跨层调控交互(如有向边连接 ATAC peak 与下游基因),通过 graph variational autoencoder 学习 feature embedding,并以对抗学习对齐不同组学层的 cell embedding。在 SNARE-seq、SHARE-seq、10X Multiome 三个 gold-standard 数据集上的系统 benchmark 表明,GLUE 在 biology conservation、omics mixing 和单细胞对齐误差(FOSCTTM)上均优于 UnionCom、Pamona、MMD-MA、Online iNMF、LIGER、Harmony、bindSC、Seurat v3 等方法,且对先验知识损坏(高达 90%)、数据下采样和超参数变化均表现出强鲁棒性。GLUE 还可扩展到 triple-omics 整合(mouse cortex 的 RNA + ATAC + DNA methylation)并支持百万级细胞的 scalable 对齐,用于人类细胞图谱构建时甚至纠正了既有注释。
关键图表¶
- Fig. 1(GLUE 架构):三层组学各自 VAE 编码 cell embedding U₁/U₂/U₃,guidance graph G=(V,E) 经 graph VAE 产生 feature embedding V,decoder 通过 U·Vᵀ 内积重建数据从而桥接异质 feature space,omics discriminator D 通过对抗学习对齐各层 cell embedding——这是整个方法的核心机制图。
- Fig. 2b(overall integration score):在三个 gold-standard 数据集上 GLUE 始终排名第一,综合 score = 0.6×biology conservation + 0.4×omics mixing,显著优于其他 8 种主流方法。
- Fig. 2d(robustness to prior knowledge corruption):即使 90% 的 guidance graph 边被随机替换为不存在的交互,GLUE 的 FOSCTTM 上升幅度仍最小,说明其对先验知识不精确性的鲁棒性远超依赖 feature conversion 的方法。
与我的关联¶
虽与我的 vascular G&R 力学课题不直接相关,但 GLUE 的 "graph-linked embedding" 思路——用显式的领域知识图桥接异质 feature space 再做对抗对齐——对处理多模态、多尺度数据融合有方法论启发,尤其是当不同数据源 feature space 不一致时如何引入先验结构而非简单投影。