Skip to content

Towards multimodal foundation models in molecular cell biology

Cui, Haotian; Tejada-Lapuerta, Alejandro; Brbić, Maria et al. · 2025 · Nature

Metadata

Authors: Cui, Haotian; Tejada-Lapuerta, Alejandro; Brbić, Maria; Saez-Rodriguez, Julio; Cristea, Simona; Goodarzi, Hani; Lotfollahi, Mohammad; Theis, Fabian J.; Wang, Bo

DOI: 10.1038/s41586-025-08710-y

Tags: #deep-learning #machine-learning #single-cell-multiomics

概述(Overview)

摘要概述

本 Perspective 提出在分子细胞生物学中构建多模态基础模型 (multimodal foundation models, MFMs) 的愿景。文章回顾了从早期全细胞模型 (如 M. genitalium 28 个 ODE 系统) 到当前 scGPT (3300 万单细胞预训练)、Geneformer (3000 万转录组预训练) 和 scBERT 等单细胞基础模型的发展,指出预训练在多模态组学数据 (基因组、转录组、表观基因组、蛋白质组、代谢组、空间组学) 上的基础模型有望实现细胞状态的连续表征和下游应用 (细胞类型识别、生物标志物发现、基因调控推断、in silico 扰动)。提出了统一 token 化、混合多级注意力机制、跨模态训练任务和 lab-in-the-loop 工作流的架构设想,并讨论了数据资源、评估方法、可解释性、幻觉风险和开放科学等挑战。最大限制是作为 Perspective 文体,核心为愿景而非原创实验,多模态预训练的技术可行性尚未验证。

综述问题、范围与选择标准

  • 要回答的问题:如何构建多模态基础模型来整合分子细胞生物学中的多组学数据,以实现细胞状态的全局表征和预测?
  • 覆盖范围:从全细胞建模历史 (2012 年 Karr et al.) 到 2025 年当前基础模型 (scGPT, Geneformer, scBERT, AlphaFold, ESM2/3, Enformer),覆盖基因组、转录组、表观基因组、蛋白质组、代谢组和空间组学数据模态,以及 tissue heterogeneity、gene regulation、in silico perturbation 等应用
  • 文章性质:perspective
  • 文献选择方法:未报告 (非 systematic review,作者基于专业判断选取代表性文献)

主题综合

主题 1:从全细胞模型到基础模型 — 范式转变

  • 核心论点:早期全细胞模型基于 ODE 和规则子模块,受限于简化假设和数学不稳定性;基础模型通过自监督预训练在大规模多模态数据上学习表示,可超越传统方法
  • 代表证据定位:文献 ref 10 (Karr et al. 2012 Cell) M. genitalium 全细胞模型;文献 ref 45 (Cui et al. 2024 Nat Methods) scGPT 3300 万单细胞预训练;文献 ref 46 (Theodoris et al. 2023 Nature) Geneformer 3000 万转录组预训练;Table 1 传统 ML vs MFM 对比
  • 共识程度:有限 — 单模态基础模型已有初步成功 (scGPT, Geneformer),多模态整合仍属愿景
  • 分歧或限制:早期全细胞模型受限于细菌生物体和 ODE 不稳定性 (ref 9);当前基础模型尚未实现真正的多模态预训练

主题 2:MFM 架构设计 — 统一 token 化与混合多级注意力

  • 核心论点:MFM 应采用统一 token 化 (跨模态共享 token 空间) 和混合多级注意力 (intra-modal + inter-modal) 架构来处理多尺度分子数据
  • 代表证据定位:Fig. 3 (PDF p. 6) 统一 token 化和混合多级注意力架构图;文献 ref 22 (Vaswani et al. 2017) Transformer 基础架构;文献 ref 91 (Liu et al. 2021 SwinTransformer) 多级注意力先例;文献 ref 90 (Barnum et al. 2020) early fusion 理论
  • 共识程度:有限 — 架构为作者提出的设想,在生物基础模型领域尚未实现,但 CV 领域有先例
  • 分歧或限制:统一 token 化需处理从核苷酸到蛋白质的多尺度分辨率差异;多级注意力在生物基础模型中尚未探索

主题 3:数据、训练与评估挑战

  • 核心论点:MFM 面临配对多组学数据稀缺、评估指标限制 (人工标注不可靠) 和幻觉风险等挑战
  • 代表证据定位:Fig. 4b (PDF p. 7) 挑战框架图;文献 ref 86 (CellxGENE) 单细胞数据从 3000 万到 9300 万增长但 ATAC-seq 仅 20 万;文献 ref 111 (Luecken et al. 2022 Nat Methods) atlas 级数据整合基准;文献 ref 117 (Ji et al. 2022) 幻觉综述
  • 共识程度:稳固 — 数据不平衡和评估困难是领域公认挑战
  • 分歧或限制:人工标注基于标记基因和线性方法可能限制 MFM 发现新细胞类型;合成数据可能引入偏差

主题 4:lab-in-the-loop 与知识整合

  • 核心论点:MFM 可通过 lab-in-the-loop 迭代工作流 (模型预测 → 实验验证 → 数据更新) 和外部知识整合 (通路、基因本体、蛋白质互作网络) 增强性能
  • 代表证据定位:Fig. 2b (PDF p. 4) lab-in-the-loop 迭代框架;文献 ref 50 (Szymanski et al. 2023 Nature) 自主实验室;文献 ref 52 (Rainforth et al. 2024) 贝叶斯实验设计;文献 ref 99 (Gene Ontology) 和 ref 100 (Reactome) 结构化知识
  • 共识程度:有限 — 概念来自 AI 领域,在生物学中仅有初步探索
  • 分歧或限制:lab-in-the-loop 需要实验和计算实验室的深度整合,实践中成本和效率挑战大

关键图表、Box 与分类框架

  • 定位:Fig. 1 (PDF p. 2)、Fig. 2 (PDF p. 4)、Fig. 3 (PDF p. 6)、Fig. 4 (PDF p. 7)、Table 1 (PDF p. 3)
  • 内容:Fig. 1 展示多模态分析技术 (CITE-seq, scATAC-seq, scRNA-seq, Perturb-seq) 和应用场景 (细胞动态重建、in silico 扰动)。Fig. 2 对比 context-specific vs foundational knowledge 范式和 lab-in-the-loop 迭代。Fig. 3 展示统一 token 空间和多级注意力 transformer 架构。Fig. 4 展示训练任务 (缺失 token 重建、跨模态生成、条件生成) 和挑战 (数据/计算资源、评估、可解释性、伦理)。Table 1 对比传统 ML 和 MFM 在预训练、适用性、学习范式、泛化性方面的差异。
  • 价值:提供了 MFM 从数据到架构到应用的完整技术路线图,Fig. 3 的统一 token 化方案和混合注意力机制是最核心的技术贡献
  • 局限:所有架构图均为设想,无实验验证;Table 1 的对比偏向 MFM 优势,未充分讨论 MFM 在小数据集上的潜在劣势

共识、争议与研究空白

相对稳固的共识

Transformer 架构在生物分子建模中有效 — AlphaFold2 (ref 40)、ESM2/3 (refs 42-43)、scGPT (ref 45) 和 Geneformer (ref 46) 的成功验证了这一点。

尚存争议

多模态整合是否真正优于单模态专用模型?文章提出 MFMs 可"超越传统方法"(Table 1),但未提供直接对比证据。在数据不平衡条件下 (如 ATAC-seq 仅 20 万细胞 vs RNA-seq 9300 万),多模态预训练是否能有效学习低资源模态的表示尚不确定。

作者提出的研究空白

配对多组学数据稀缺 (同一细胞同时测量多种模态) 是 MFM 训练的核心瓶颈;缺乏"客观"的、不依赖人工标注的评估指标。

我识别的遗漏

文章未讨论力学数据 (如细胞力学性能、组织力学微环境) 作为 MFM 的潜在模态。对于计算生物力学研究者,力学-化学耦合数据的整合是理解细胞行为的关键,但被排除在当前 MFM 框架之外。此外,文章未讨论 MFM 的碳足迹和环境成本与数据规模的权衡。

个人批注

与我的工作的关系

MFM 的"预训练 + 迁移学习"范式可启发力学-生物学耦合数据的学习。当前 SMC G&R 模型使用 ODE/PDE 描述细胞行为,而 MFM 范式提出了一种数据驱动的替代路径 — 用 Transformer 学习力学信号通路的多尺度表示,再通过 in silico 扰动预测力学响应。

可复用框架

Fig. 3 的统一 token 化 + 多级注意力架构可迁移到力学-化学多尺度数据:低层 token = 力学信号 (拉伸/剪切),中层 token = 信号通路 (eNOS/NO, RhoA/ROCK),高层 token = 细胞表型 (SMC 表型转换)。Table 1 的传统 ML vs MFM 对比可作为论证数据驱动方法价值的参考。

疑问与后续动作

scGPT 和 Geneformer 在力学相关基因集上是否有预训练表示?需检索 scGPT 在血管壁 SMC 数据上的迁移学习表现。in silico 扰动是否可用于预测力学刺激 (如 cyclic stretch) 对基因表达的响应?

与上下文的关系

本文建立在

文献 ref 21 (Bommasani et al. 2021) 基础模型概念;文献 ref 22 (Vaswani et al. 2017) Transformer 架构;文献 ref 45 (Cui et al. 2024) scGPT;文献 ref 46 (Theodoris et al. 2023) Geneformer。

已核实的后续引用

本次未检索

同类综述对比

本文与 NicheCompass (Birk et al. 2025, 本地论文队列) 互补 — NicheCompass 展示了图深度学习在空间 niche 识别中的具体实现,本文则提出更宏观的多模态基础模型愿景。两者均以 Theis 和 Lotfollahi 为共同作者。

与本地论文队列的关系

../2025-NicheCompass-Birk/deep_note.md — NicheCompass 的图深度学习方法可视为 MFM 框架在空间组学上的一个具体实例。

逐章节笔记(Section-by-Section Notes)

Introduction

段落 1:分子细胞生物学的核心挑战与历史回顾

  • 核心论点:分子细胞生物学的核心挑战是发现和表征生物分子间的动态互作与调控,历史上的全细胞模型受限于 ODE 的简化和不稳定性
  • 支撑论据:
  • 分子细胞生物学的中心任务是理解 DNA、RNA、蛋白质和代谢物间的动态互作
  • 历史上围绕全细胞建模和虚拟细胞概念展开数十年努力
  • 第一个全细胞模型用 28 个 ODE 捕获 M. genitalium 细胞过程 (ref 10)
  • ODE 方法的局限:过度简化动力学和数学不稳定性,仅限于细菌生物体
  • 在组织和细胞状态的多样化上下文中难以捕获大规模非线性互作
  • 我的分析:该段建立了从 ODE 到基础模型的范式跳跃动机。Karr et al. 2012 的 M. genitalium 模型是关键参照点 — 它标志着全细胞建模的计算起点,也暴露了 ODE 范式的局限。此段为后续提出"数据驱动 + Transformer"替代路径做了铺垫。

段落 2:技术进步与数据增长

  • 核心论点:高通量组学技术产生了指数级增长的生物数据,全球联盟 (HCA, HuBMAP, HTAN) 积累了跨模态数据,为 MFM 提供了数据基础
  • 支撑论据:
  • 分析技术突破:下一代测序、单细胞测序、冷冻电镜、质谱蛋白组学 (Fig. 1a)
  • 过去十年高通量测序覆盖了中心法则 (DNA→RNA→蛋白质, Fig. 1b)
  • HCA, HuBMAP, HTAN 等联盟积累了数百万细胞的异构数据
  • 大规模并行多组学可在同一细胞中测量 2-3 种模态 (refs 15-19)
  • 大型机器学习模型预训练突破为整合"模态"数据提供新机遇
  • 我的分析:该段将技术进步和 AI 突破并列作为 MFM 的两大驱动力。CellxGENe 数据量从 3000 万到 9300 万的快速增长 (后文提到) 是核心论据。此段的逻辑是"数据有了 → 方法有了 → 所以 MFM 可行",但未直接论证为何多模态优于单模态。

Overview of multimodal foundation models

段落 1:基础模型概念

  • 核心论点:基础模型在大规模数据上自监督预训练,通过迁移学习适配多种下游任务,在 NLP 和 CV 中已获成功,生物基础模型可统一理解多样生物过程
  • 支撑论据:
  • GPT 和 LLaMA 系列在 NLP 中展示了强大的下游迁移能力
  • 基础模型已扩展到自然图像和视频,并获得跨模态生成能力
  • 生物基础模型的优势在于学习和表示细胞系统复杂互联性的能力
  • 在多样组学数据上训练可发现单模态分析中不明显的模式
  • 我的分析:此段从 NLP/CV 的成功推导到生物学的适用性。论证合理但存在跳跃 — 生物数据的异构性 (不同模态、不同分辨率、不同物种) 远超 NLP 中的文本数据。"可能揭示被忽略的通用生物学原理"是强主张但缺乏具体例证。Table 1 为此段的对比提供了系统支撑。

段落 2:期望的架构特性

  • 核心论点:MFM 应接受多样数据类型和模态,在统一自监督学习框架下预训练,再通过迁移学习支持多样生物分析
  • 支撑论据:
  • 应能处理 bulk 和单细胞测序数据,覆盖转录组、蛋白组、代谢组、表观组等多模态
  • 预训练阶段学习基因、转录本、蛋白质、通路等的表示
  • 迁移学习 (fine-tuning, in-context learning) 适配下游任务:时间细胞态映射、新细胞类型表征、扰动响应预测 (Fig. 1c)
  • Transformer 的注意力机制可建模生物分子间互作
  • AlphaFold2, RoseTTAFold, ESM2/3, Enformer, scGPT, Geneformer, scBERT 验证了 Transformer 在生命科学中的可行性
  • 我的分析:此段是全文的技术核心。将 AlphaFold (蛋白质结构) 和 scGPT (单细胞) 并列为 Transformer 在生物学中的验证案例,但两者的任务性质截然不同 (结构预测 vs 表示学习)。scGPT 和 Geneformer 在单细胞 RNA-seq 上的成功是 MFM 愿景最重要的证据,但它们是单模态的 — 多模态扩展仍是未验证的假设。

段落 3:data-centric 工作流与 lab-in-the-loop

  • 核心论点:MFM 提供了从假设驱动到数据驱动的工作流转变,通过 lab-in-the-loop 迭代整合实验和计算
  • 支撑论据:
  • 传统假设驱动方法"学科特异性"强 (研究癌症细胞理解癌症,研究心肌细胞理解心脏),忽略了跨组织共享的生化规则
  • 数据驱动方法在大型异构数据上预训练,学习共享基础知识
  • lab-in-the-loop: 模型选择高信息量实验 → 实验验证 → 结果整合入训练数据 → 迭代
  • 模型可预测未见细胞系的药物效力,指导高不确定性实验
  • 最终模型成为分子细胞生物学的"模拟器"
  • 我的分析:Fig. 2a 的 context-specific vs foundational knowledge 对比是核心论证。从"癌症和心脏病分别研究"到"共享基础知识"的范式跳跃有说服力,但缺乏具体例证说明哪些跨领域知识被 MFM 捕获。lab-in-the-loop 概念来自 AI (active learning, Bayesian experimental design),在生物学中仅有自主实验室 (ref 50) 的初步探索,实践中成本极高。

Opportunities of MFMs

段落 1:组织异质性表征

  • 核心论点:MFMs 可通过 contextualize (将细胞嵌入连续状态空间)、compare (跨数据集和模态整合) 和 complete (生成缺失模态) 三种能力超越现有离散细胞类型定义
  • 支撑论据:
  • scRNA-seq 揭示胶质母细胞瘤转录异质性 (ref 54);表观基因组分析区分肿瘤亚克隆 (ref 55);蛋白组方法解析功能变异 (ref 56)
  • Seurat v4 (ref 58) 和 scArches (ref 59) 开创了参考映射
  • 代谢标记 RNA/蛋白质 (refs 60-63) 可测量动力学但不适用于临床样本 — MFM 可通过生成能力填补缺失模态
  • 多组学整合可解决传统整合困难
  • 我的分析:三种能力 (contextualize, compare, complete) 的框架清晰且有价值。"complete"能力 — 通过生成式模型填补临床样本中不可测的模态 — 是最具创新性的设想,但也是最难验证的。代谢标记到临床样本的迁移如果成功,将是一个重要突破。

段落 2:基因功能与调控预测

  • 核心论点:MFMs 可从基因组序列和细胞图谱学习基因功能,并通过多组学上下文重建条件特异性基因调控网络 (GRNs)
  • 支撑论据:
  • DNABERT (ref 64) 和 DNABERT-2 (ref 65) 从基因组序列预测基因功能
  • Geneformer (ref 46) 从单细胞图谱学习基因功能
  • GRN 重建需要跨中心法则的多组学数据 (DNA 结合、RNA 剪接、蛋白质修饰)
  • 染色质可及性 + 表达可推断调控因子 (refs 71-72)
  • MFM 在预训练中学习默认 GRN,通过迁移学习适配特定上下文
  • 我的分析:该段建立了"多组学 → 更准确 GRN"的逻辑。当前 GRN 推断主要基于转录组共表达 (refs 68-69),确实有限。加入染色质可及性和表观信息是自然的扩展。但 MFM 如何"学习默认 GRN 再适配"的机制尚不清楚 — 这更像是愿景而非已验证的方法。

段落 3:in silico 扰动

  • 核心论点:MFMs 可预测基因或化学扰动对细胞状态的影响,超越当前单模态扰动模型
  • 支撑论据:
  • scGPT, CellOracle, Geneformer, CellOT, CPA, chemCPA, GEARS 已展示初步扰动预测成功
  • 多组学整合可构建完整细胞表示,条件化于细胞类型和扰动状态进行细致分析
  • k 基因敲除有 2^k - 1 种组合,实验不可穷尽 — in silico 预测可大幅加速
  • Perturb-seq (ref 79) 等大规模 CRISPR 扰动 + 单细胞测序数据可训练 MFM
  • 我的分析:该段最具实践价值。2^k - 1 的组合爆炸论证有力地说明了 in silico 扰动的必要性。当前模型 (GEARS, scGPT) 在转录组扰动预测上有初步成功,但 MFM 扩展到多模态扰动 (如同时预测转录+蛋白变化) 的可行性尚需验证。Perturb-seq 数据的增长为 MFM 训练提供了关键基础。

Towards building MFMs for molecular cell biology

段落 1:训练数据需求

  • 核心论点:MFM 训练需要大量多样化多组学数据,但当前配对数据稀缺,非 RNA-seq 模态数据量不足
  • 支撑论据:
  • HuBMAP, ENCODE, IHEC, HCA 等数据仓库存在但配对测量有限 (ref 83)
  • 10X Multiome, CITE-seq, ASAP-seq 可捕获同细胞多模态但数据量少
  • CellxGENe RNA-seq 从 3000 万增至 9300 万,但 ATAC-seq 仅 20 万 (人) 和 88 万 (鼠)
  • 数据聚合和策展 (harmonizing meta labels, QC, normalization) 同样关键
  • MFM 本身可帮助解决数据策展问题
  • 我的分析:该段量化了数据不平衡问题 — RNA-seq vs ATAC-seq 的 100:1 比例是 MFM 多模态预训练的核心障碍。合成数据 (后文提到) 作为解决方案的潜力有限,因为合成数据的质量取决于生成模型,而生成模型本身需要训练数据。跨物种数据提供进化上下文 (refs 84-85) 是有价值的补充。

段落 2:统一 token 化

  • 核心论点:应构建跨模态统一 token 空间,在 token 化阶段实现早期融合
  • 支撑论据:
  • 统一 token 表示在 LLM for vision+language 中已有先例 (ref 31, 87)
  • 低层 token = 核苷酸 k-mers;中层 token = 序列 motifs;高层 token = 基因/蛋白质
  • subword tokenization (BPE) 可编码原始核苷酸/氨基酸为离散词汇 (DNABERT-2, ref 65)
  • 高层 token 可表示基因/蛋白质 (scGPT, Geneformer)
  • 我的分析:Fig. 3a 的多级 token 化方案是全文最具技术深度的贡献。将 NLP 的 BPE 迁移到生物序列是合理的,但生物数据的"语义"比语言更复杂 — 同一基因在不同细胞类型/条件下的功能不同。early fusion (ref 90) vs late fusion 的选择需要实验验证。

段落 3:混合多级注意力

  • 核心论点:Transformer 应使用分离的 intra-modal (同层 token 间) 和 inter-modal (跨层 token 间) 注意力来建模多尺度生物数据
  • 支撑论据:
  • 分子数据天然多尺度:从碱基对到基因到通路
  • SwinTransformer (ref 91) 和 MultiScale ViT (ref 92) 在 CV 中有多级注意力先例
  • intra-modal attention 理解模态内关系 (gene-gene, nucleotide-nucleotide)
  • inter-modal (global) attention 连接模态间关系 (gene-protein)
  • 我的分析:Fig. 3b 的 intra/inter-modal attention 架构设计合理。CV 中的 SwinTransformer 先例增加了可行性论证。但生物数据的层级关系比图像更复杂 — 一个基因可属于多个通路,一个蛋白质可参与多个互作网络。注意力机制的灵活性既是优势 (可学习复杂关系) 也是风险 (可能学到虚假关联)。

段落 4:训练任务与 prompt tokens

  • 核心论点:所有训练任务可统一为 token 生成框架,通过 prompt tokens 控制任务类型
  • 支撑论据:
  • intramodal 任务:masked token 重建 (基因表达)、缺失蛋白质值填充、扰动响应预测
  • cross-modal 任务:对比学习 (同细胞不同模态正对)、跨模态预测 (mRNA→protein)
  • prompt tokens 控制任务类型:, , , , (Fig. 4a)
  • 元信息 (年龄、性别、疾病条件) 可作为监督信号 — MFM 独有特征
  • 我的分析:将所有任务统一为 token 生成是 elegant 的设计,与 GPT 的统一框架一致。prompt token 的设计允许灵活的任务指定而无需修改模型架构。元信息作为监督信号的观点很有洞察力 — 这区别于 NLP 中 LLM 的纯自监督训练。

段落 5:知识整合

  • 核心论点:将结构化知识 (通路、基因本体、蛋白质互作网络) 和非结构化知识 (文献) 整合到 MFM 预训练中可提供归纳偏置
  • 支撑论据:
  • 结构化知识:Gene Ontology (ref 99) 和 Reactome (ref 100) 可作为知识图谱,图嵌入初始化 gene token embeddings
  • 非结构化知识:BioGPT (ref 105) 和 Med-PaLM (ref 106) 将文献编码为向量,附加到 MFM 输入
  • ProLlama (ref 107) 多任务训练蛋白质序列数据的初步尝试
  • 我的分析:知识整合是纯数据驱动方法的重要补充。Gene Ontology 初始化 gene token 是一个具体可行的方案。但知识图谱本身可能不完整或有偏差,将其作为初始化可能引入偏见。文献整合 (BioGPT, Med-PaLM) 的效果取决于文献质量。

Challenges and limitations

段落 1:数据与计算资源

  • 核心论点:MFM 需要大量配对多组学数据和高端 GPU,限制了可及性
  • 支撑论据:
  • 配对多组学数据稀缺且分散在不同研究中
  • 大规模训练需要高能耗 GPU,限制可及性并增加碳排放
  • LoRA (ref 109) 和 adapter-transformer (ref 110) 等低资源技术可降低门槛
  • 合成数据可作为补充工具填补数据空白
  • 我的分析:LoRA 和 adapter 作为低资源技术迁移到生物学是合理的。合成数据方案的可行性取决于生成模型质量。碳排放问题虽提到但未深入讨论 — Debus et al. 2023 (ref 108) 指出报告电力消耗对可持续 AI 至关重要。

段落 2:评估方法

  • 核心论点:当前评估指标依赖人工标注,可能惩罚 MFM 发现新细胞类型的能力
  • 支撑论据:
  • 人工标注基于标记基因和线性方法,可能限制亚型和稀有细胞类型分类
  • MFM 预测的细胞聚类与人工标注的高对齐 (如 mutual information) 被奖励,但发现新亚型时对齐降低会被惩罚
  • 类似悖论出现在新基因互作或药物靶点预测中
  • 需要发展"客观"的、不依赖人工判断的评估指标
  • OpenProblems 和 DREAM 挑战赛 (refs 112-114) 提供社区基准
  • 我的分析:这是全文最有洞察力的段落之一。"评估指标悖论" — MFM 发现新生物学的能力恰被以人工标注为标准的评估所惩罚 — 是一个深刻的矛盾。OpenProblems 和 DREAM 作为社区解决方案是好的起点,但需要更多"human-agnostic"指标。

段落 3:可解释性与幻觉风险

  • 核心论点:MFM 面临可解释性挑战和幻觉风险 (生成看似合理但事实错误的输出)
  • 支撑论据:
  • 可解释性:解释为何某基因上调或为何预测的 gene-gene 网络准确很复杂
  • KAN (Kolmogorov-Arnold networks, ref 115) 可在梯度下降中提取符号函数,增强可解释性
  • 幻觉三要求:(1) 输出须基于训练数据;(2) 须与上下文一致;(3) 模型须能承认不确定
  • 不确定性量化 (refs 118-120) 可识别潜在幻觉
  • 我的分析:幻觉定义的三条要求 (grounded, consistent, self-aware) 对 MFM 适用。第三条 — 模型"承认不确定" — 是最难实现的,需要校准的不确定性估计。KAN 作为可解释性方向值得追踪,但尚处于早期。

段落 4:开放科学与伦理

  • 核心论点:MFM 应公开可及,需保障数据隐私、包容性和公平性
  • 支撑论据:
  • 预训练模型应开放,透明传达能力和限制
  • 患者数据需严格隐私保护
  • 数据须跨人群代表性以避免边缘化
  • 临床应用前须在临床队列上验证
  • 需开源基础设施维持透明度
  • 我的分析:伦理讨论作为 Perspective 的收尾是适当的但较为泛化。代表性、隐私和临床验证的呼吁是标准但重要的。未讨论 MFM 的双用途风险 — 如生成有害生物制剂的预测。与 NLP 中 LLM 的对齐问题类似,MFM 也需要安全护栏。

Conclusion

段落 1:集体创新的未来

  • 核心论点:MFM 有望通过整合多样组学数据革命性地改变分子生物学,需要跨学科协作
  • 支撑论据:
  • MFM 可驱动个性化治疗、疾病建模和药物发现创新
  • 类似 HCA 在医学研究中的变革性角色 (refs 123-124)
  • 需要生物学家、数据科学家、AI 研究者和伦理学家的协作
  • 我的分析:作为 Perspective 的收尾,此段以愿景收束。将 MFM 与 HCA 的变革性影响类比是合理的 — 两者都是数据驱动的、需要社区协作的大型项目。但 HCA 是数据生成项目,MFM 是模型训练项目,二者的挑战性质不同。全文从愿景到架构到挑战的系统论述使其成为该领域的重要参考,但需要更多实验验证来支撑其核心主张。

快速判断

  • 一句话结论:Nature Perspective,提出构建多模态基础模型 (multimodal foundation models) 用于分子细胞生物学的愿景,预训练覆盖基因组、转录组、表观基因组、蛋白质组、代谢组和空间组学数据,以实现细胞状态的全局表征和下游应用 (细胞类型识别、生物标志物发现、基因调控推断、in silico 扰动);值得升级 deep 以理解技术路线图和局限性。
  • 阅读范围:仅 metadata、first page、abstract、最多 3 个 figure/table captions 和 conclusion;未通读正文
  • 处理决定:升级 deep
  • 决定理由:该 perspective 系统性提出从单模态到多模态基础模型的路线图,且引用了 scGPT、Geneformer 等已有工作;需精读评估对力学-生物学交叉建模的启示。

摘要概述

本 Perspective 提出在分子细胞生物学中发展多模态基础模型 (multimodal foundation models) 的愿景。文章指出高通量组学技术的快速发展产生了指数级增长的生物数据,而大语言模型在 NLP 领域的成功表明可以将其整合为统一的预训练模型。设想中的基础模型将在基因组、转录组、表观基因组、蛋白质组、代谢组和空间组学等多样数据上预训练,有望实现对细胞分子状态的连续表征,构建细胞、基因和组织的整体图谱。通过上下文特定的迁移学习,可赋能从新细胞类型识别、生物标志物发现、基因调控推断到 in silico 扰动等多种应用。文章回顾了从早期全细胞模型 (如 Mycoplasma genitalium 的 28 个 ODE 系统) 到当前 scGPT、Geneformer 等单细胞基础模型的发展历程,指出多模态整合是下一步关键。最大限制是该愿景目前仍处于概念阶段,多模态预训练的技术可行性和数据整合挑战尚未充分论证。

关键证据

  • 证据 1(定位):First page
  • 展示或报告:回顾了全细胞建模的历史,从 M. genitalium 的 28 个 ODE 系统到当前 scGPT (基于 3300 万单细胞数据集的生成式预训练 Transformer) 和 Geneformer (3000 万单细胞转录组预训练) 等基础模型
  • 支持的结论:生物数据驱动的大规模预训练模型已具备初步基础,多模态扩展是自然延伸
  • 注意事项:现有单模态模型在多模态整合方面的实际效果和局限需精读正文

  • 证据 2(定位):First page

  • 展示或报告:提及全球联盟数据资源 (Human Cell Atlas, HuBMAP, HTAN) 积累了跨越数百万细胞的多模态数据,以及同一细胞中同时测量 2-3 种模态的大规模并行多组学技术
  • 支持的结论:多模态基础模型的数据基础已初步具备
  • 注意事项:数据质量、标准化和跨平台一致性问题需精读正文

局限与未核实项

  • 最大局限:作为 Perspective 文体,核心为愿景和路线图而非原创实验,多模态基础模型的技术可行性和实际性能尚未验证
  • 未核实项:Abstract、captions 和 conclusion 在 quick.txt 中 NOT DETECTED 或为参考文献列表;具体多模态整合架构、预训练策略和评估基准需精读正文

与我的关联

  • 可复用点:基础模型范式 (预训练 + 迁移学习) 可能适用于力学-生物学耦合数据的学习,尤其是空间-时间多尺度数据
  • 关联的当前问题:是否能将血管壁力感受器信号通路数据纳入多模态基础模型框架,实现细胞力学响应的预测
  • 下一步动作:升级 deep note,重点关注技术路线图 (Fig. 1-2)、现有基础模型对比 (scGPT/Geneformer/scBERT) 和 in silico 扰动应用部分