Skip to content

From reductionism to realism: Holistic mathematical modelling for complex biological systems

Nartallo-Kaluarachchi, Ramón; Lambiotte, Renaud; Goriely, Alain · 2025 · arXiv preprint (physics.bio-ph), Perspective

Metadata

Authors: Nartallo-Kaluarachchi, Ramón; Lambiotte, Renaud; Goriely, Alain

arXiv: 2503.20511

Tags: #agent-based-model #continuum-mechanics #deep-learning

概述(Overview)

摘要概述

本文是 Nartallo-Kaluarachchi 等人发表于 arXiv 的 Perspective,核心论点是:数学建模在生物学中应从还原论(reductionism)转向整体论(holistic),以应对生物系统的固有复杂性——异质性、多功能性和跨时空尺度相互作用。文章以神经科学为案例(特别是阿尔茨海默病的多尺度建模),论证了三个论点:(1) 传统的还原论方法(如 Hodgkin-Huxley 模型将神经元简化为电路)在物理学中成功但在生物学中不足,因生物元素异质且相互作用跨尺度;(2) 过去二十年的复杂系统理论虽有进展(scale-free 网络、small-world 网络)但过于理论化,未产生可操作的实证洞见;(3) 未来方向是"整体数学建模范式"——利用丰富表示结构(annotated/multilayer 网络、hypergraphs)、基于模拟的方法(agent-based models、digital twins)和逆问题框架(从数据推断动力学),同时保持对基础物理原理(自组织临界性、自由能原理、非平衡热力学)的追寻。文章展望了未来二十年数学生物学的发展方向。

综述问题、范围与选择标准

  • 要回答的问题:为什么还原论数学建模在生物学中不足,以及如何构建整体性建模范式以产生可操作、可预测的实证洞见?
  • 覆盖范围:2000–2025 年间的复杂系统科学、网络科学、计算生物学和数学生物学文献,以神经科学(特别是阿尔茨海默病)为主要案例领域。
  • 文章性质:perspective(观点文章),非 systematic review,无系统性检索式或纳入排除标准。
  • 文献选择方法:未报告(文献以作者团队相关研究和领域代表文献为主线,无系统性检索声明)。

主题综合

主题 1:还原论的两极有效性与生物复杂性的中间困境

  • 核心论点:还原论方法在物理系统的两极(规则对称的连续介质系统、全同随机的统计力学系统)有效,但生物系统处于中间——拓扑不规则、元素异质、过程多功能、跨时空尺度——使还原论失效。
  • 代表证据定位:Fig. 1(从规则到随机的相互作用结构谱系);文献 ref 5(Hodgkin-Huxley 模型, 还原论成功案例);文献 ref 8(Anderson 1972, "More is different")
  • 共识程度:稳固——还原论在生物学的局限性是复杂系统科学的共识(refs 7–10),Anderson 的"more is different"(ref 8)是经典论述。
  • 分歧或限制:作者将复杂系统理论"过于理论化"的判断("has yet to yield convincing and tangible results")可能过于严厉——网络科学在流行病学、脑连接组学等领域有实际应用。"未产生可操作洞见"的标准本身是主观的。

主题 2:丰富表示结构——annotated/multilayer 网络与跨尺度整合

  • 核心论点:传统网络抽象不足以表示生物系统的异质性和多过程耦合,需采用 annotated 网络(节点含元数据特征向量)、multilayer 网络(多过程同时演化)和 higher-order 结构(hypergraphs、simplicial complexes)来捕捉复杂性。
  • 代表证据定位:Fig. 2(六种丰富表示结构概览);文献 ref 35(biologically annotated connectomes, Bazinet et al. 2023);文献 ref 36(neuromaps 工具, Markello et al. 2022);Fig. 3(阿尔茨海默病的时空尺度图)
  • 共识程度:有限——higher-order 网络是活跃研究领域(refs 27–29)但其在生物学中的应用仍处于早期。annotated connectomes(ref 35)是近期发展,neuromaps 工具(ref 36)尚需广泛验证。
  • 分歧或限制:丰富表示结构增加了表达能力但也增加了参数维度和计算复杂度——"over-parametrised models"过去受限于数据和推断算法,作者认为大数据和 ML 已缓解这一问题,但未讨论过拟合风险和可解释性代价。

主题 3:基于模拟的方法与逆问题框架

  • 核心论点:复杂生物系统应采用基于模拟的方法(agent-based models、digital twins)和逆问题框架(从观测数据推断动力学机制),而非传统的"先写方程再拟合参数"的正向方法。
  • 代表证据定位:文献 ref 64(The Virtual Epileptic Patient, VEP 项目);文献 ref 77(SINDy, 稀疏识别非线性动力学);文献 ref 80(AI-Feynman, 从数据发现物理定律);Fig. 4(ABM 和 digital twin 示意图)
  • 共识程度:有限——VEP 项目的成功(ref 64)支持 simulation-based 方法的实证价值,但整体性框架尚未有完整的端到端验证。SINDy(ref 77)和 AI-Feynman(ref 80)在特定条件下有效但泛化性未充分验证。
  • 分歧或限制:ABM 的"ad-hoc 参数选择"和"视频游戏"风险(modeller 调整局部规则直到期望行为出现)是严重的方法论隐患——作者承认但提出的"Bayesian 机制更新"解决方案缺乏具体框架。

关键图表、Box 与分类框架

  • 定位:Fig. 1(相互作用结构谱系:规则→复杂→随机)
  • 内容:将物理系统按相互作用结构排列在从规则到随机的谱系上——规则端(晶体/金属,适用连续介质假设)、随机端(气体分子,适用统计力学/mean-field)、中间(复杂系统,拓扑不规则、异质、高维动力学)。
  • 价值:提供了还原论"为何在两极有效、在中间失效"的直观可视化框架,是全文核心论证的概念基础。
  • 局限:谱系是定性的,"规则""随机""复杂"之间缺乏量化边界。真实系统可能同时具有规则和复杂特征(如晶格上的异质动力学)。

  • 定位:Fig. 3(阿尔茨海默病的时空尺度图)

  • 内容:以对数-对数图展示 AD 涉及的跨尺度过程——从纳米级(蛋白-蛋白相互作用)到米级(整体脑),从毫秒级(神经元超活跃)到十年级(痴呆)。涵盖 tau/amyloid 病理扩散、网络蛋白传播、细胞死亡、认知衰退等过程。
  • 价值:具体展示了生物复杂性的核心挑战——跨尺度相互作用。为"单一尺度模型不足"的论点提供了直接证据。
  • 局限:各过程之间的耦合方向和强度未在图中标示——图中列出了尺度但未展示耦合机制。

  • 定位:Fig. 5(动力学系统的潜在表示)

  • 内容:(A) VAE 将高维时间序列投影到低维流形上的潜在动力学;(B) Koopman 算子将非线性动力学"提升"到高维空间使其近似线性。
  • 价值:提供了数据驱动动力学建模的两种互补策略——降维(VAE)和升维(Koopman),两者在不同场景下各有优势。
  • 局限:潜在维度与物理可观测量之间的映射不总是可解释的——作者承认"latent dimensions no longer correspond to physical measurements"但认为可保持可解释性。

共识、争议与研究空白

相对稳固的共识

生物系统的复杂性(异质性、多功能性、跨尺度耦合)使还原论建模不足——这一判断有 Anderson(ref 8, "More is different")、Schrödinger(ref 14, What is Life?)和 Brenner(ref 10)等经典论述支持,是复杂系统科学的基础共识。

尚存争议

复杂系统理论是否"尚未产生令人信服和有形的结果"(has yet to yield convincing and tangible results)。作者认为过去二十年的复杂系统方法"过于理论化",但网络科学在脑连接组学(ref 21, Bassett & Sporns 2017)、流行病学(ref 47, Axtell & Farmer 2025)和药物-靶点网络(ref 23, Barabási et al. 2011)中有可论证的应用成果。这一判断的标准(何为"tangible")是主观的。

作者提出的研究空白

  1. annotated 网络的动力学很少被研究——虽然 annotated 网络在图表示学习中普遍存在(ref 31),但其动力学分析几乎空白。
  2. ABM 缺乏透明框架——"hidden parameters"的 ad-hoc 选择导致建模过程类似"视频游戏"而非科学发现。
  3. 生物学缺乏"转化性基础原理"——物理有热力学、量子力学等转化性原理,生物学尚无等价物。
  4. 自动建模(automatic modelling, AM)框架尚未正式建立——"a posteriori reductionism"的理念与现有模型选择和正则化技术对齐但未形式化。

我识别的遗漏

文章对"整体性建模"的计算可行性缺乏讨论——annotated/multilayer 网络的维度随节点数和元数据维度指数增长,ABM 的模拟成本随 agent 数量超线性增长,digital twin 需要实时校准。这些计算挑战在 HPC 时代虽非不可逾越但绝非次要——作者仅以"HPC 将缓解"一笔带过,未量化计算需求。此外,"整体性模型"的可验证性问题未讨论——当模型包含数百个参数和多个耦合过程时,如何验证模型不是过拟合数据?缺乏独立的验证框架是整体性范式的核心风险。

个人批注

与我的工作的关系

作为计算生物力学研究者,本文的"还原论→整体论"转向对血管 G&R 建模有直接启示:传统 G&R 模型将血管壁简化为连续介质(还原论方法),但血管 G&R 涉及跨尺度耦合——从细胞信号(纳米/秒)到组织重塑(毫米/天)到器官功能(厘米/年)。annotated/multilayer 网络可用于表示血管壁不同层(内膜/中膜/外膜)中不同细胞类型的异质性和相互作用。逆问题框架(从 in vivo 影像数据推断 G&R 参数)与我使用 PIML 从 MRI 数据反演材料参数的思路一致。digital twin 概念对构建患者特异性血管模型有直接参考价值。但 ABM 在血管 G&R 中的适用性需谨慎评估——血管壁细胞(平滑肌/内皮/成纤维细胞)的 agent 行为规则尚不明确。

可复用框架

Fig. 1 的"规则→复杂→随机"谱系可用于定位 G&R 模型的复杂性等级——连续介质模型在规则端,多细胞 ABM 在复杂端,根据具体问题选择合适位置。Fig. 3 的时空尺度图方法可迁移到血管 G&R——绘制从分子(生长因子信号)到器官(血流动力学)的跨尺度耦合图,识别关键耦合界面。逆问题框架(dx/dt = f(x,t) + ξ(x,t) 的 f 推断)可用于从 G&R 时间序列数据推断未知的 constitutive 项。

疑问与后续动作

  1. 疑问:annotated 网络的动力学分析在 G&R 中的应用前景如何?血管壁不同细胞类型的元数据特征向量(基因表达、力学状态、表型)如何编码为 annotated 网络节点?
  2. 后续动作:精读 Goriely et al. 2020(ref 45, 神经振荡在演化网络上的多尺度模型)和 Alexandersen et al. 2023(ref 46, AD 的多尺度振荡减慢模型),评估其多尺度耦合方法论是否可迁移到血管 G&R 的跨尺度建模。

与上下文的关系

本文建立在

作者团队的前序工作建立了神经振荡在演化网络上的多尺度模型(ref 45, Goriely et al. 2020, PRL)和 AD 的多尺度振荡减慢模型(ref 46, Alexandersen et al. 2023)。复杂系统理论基础建立在 Anderson 1972(ref 8, "More is different")、Schrödinger 1944(ref 14, What is Life?)和 Watts & Strogatz 1998(ref 11, small-world networks)之上。higher-order 网络理论建立在 Lambiotte et al. 2019(ref 27, Nature Physics)和 Battiston et al. 2021(ref 29, Nature Physics)之上。逆问题方法建立在 SINDy(ref 77, Brunton et al.)和 AI-Feynman(ref 80, Udrescu & Tegmark)之上。

已核实的后续引用

本次未检索

同类综述对比

本次未核实

与本地论文队列的关系

与本地 2024-VirtualCell-Chen 互补:Chen 提出具体的 BAIE→MDE→CME 管线实现"分子到细胞"的跨尺度计算,Nartallo-Kaluarachchi 则提供"为何需要跨尺度以及应采用何种范式"的方法论论证。两者是"how"和"why"的关系。与 2021-PIML-Karniadakis 有方法论交叉:Karniadakis 的"物理嵌入 ML"可视为本文"逆问题框架"的一种具体实现——PINN 的 loss 函数中 PDE 残差项即为先验物理知识的嵌入。与 2024-ML-DrugDiscovery-Durant 的关联在于:Durant 指出数据是 ML 的瓶颈,Nartallo-Kaluarachchi 则指出还原论是建模的瓶颈——两者分别从数据和模型两个维度诊断了科学 ML 的局限。

逐章节笔记(Section-by-Section Notes)

I. INTRODUCTION

段落 1:数学建模在物理中的成功与在生物中的困境

  • 核心论点:数学建模在物理学中取得了无与伦比的成功(20 世纪是物理学的世纪),但生物系统对数学分析更为难以攻克,许多基础理论问题仍未解答。
  • 支撑论据:
  • 数学建模(MM)已成为抽象物理系统并描述其时空行为的主导和终极范式
  • MM 在物理和工程领域取得无与伦比的成功,深刻改变了人类社会
  • 新数学通过模型开发不断被发现——Poincaré 天体力学→动力系统/发散级数/共振(ref 1);Euler 柯尼斯堡桥→图/网络理论(ref 2);Lorenz 气候动力学→混沌吸引子(ref 3)
  • 20 世纪是物理学世纪,数学抽象导致领域显著成熟,许多基础问题被解决和理论被确认(ref 4)
  • 但生物系统(从生态系统到亚细胞过程)对数学分析更难以攻克
  • 生物学最初发展为描述性科学,后转向理论关注
  • 许多基础理论问题未解答:生命如何从无生命原子精确排列中涌现?进化如何塑造物种?认知和意识如何由大脑噪声电信号编排?如何利用生物学机制根除疾病?
  • 我的分析:这段以"物理成功 vs 生物困境"的对比设定全文基调。三个历史案例(Poincaré→Euler→Lorenz)展示了 MM 在物理中"现象→数学→新数学"的正反馈循环。四个关于生物学的"大问题"设定了建模的终极目标——但这些问题(生命起源、意识)的尺度远超当前可建模范围,暗示需要范式转变而非渐进改进。值得注意这些问题的选择带有哲学偏向——"如何根除疾病"是工程目标而非基础理论问题。

段落 2:Hodgkin-Huxley 模型——还原论的典型成功与局限

  • 核心论点:Hodgkin-Huxley 模型是数学生物学的里程碑,但其还原论方法(将神经元简化为电路)虽成功描述了动作电位,却仅将理解认知推进了微小一步。
  • 支撑论据:
  • HH 模型是数学生物学最重要突破之一(ref 5)
  • 枪乌贼"巨轴突"(直径达 1.5 mm)控制水推进(ref 6),Hodgkin 和 Huxley 在 1950s 插入电压钳电极并改变胞外离子浓度
  • 开发了完整 ODE 组描述电信号通过神经元轴突传播,首次完整描述了动作电位——所有神经通信的基础
  • 这是还原论的典型例子——假设复杂现象可用一系列更简单的基本过程描述
  • HH 模型关键假设:神经元活动可建模为电路,细胞每个组件由电路元件表示——这抽象掉了其他亚细胞和生化过程
  • 还原论在科学中极其成功,特别是在物理和化学——简单实验揭示基本原理,基本原理可像积木一样组装解释更复杂情况
  • 但在生物学中可能导致了理论成功不足(refs 7–10)
  • 物理系统只有少数基本单元(质子/中子/电子),生物系统有多种独特元素(免疫系统中不同淋巴细胞、蛋白集合、神经元和胶质细胞多样性)
  • HH 模型虽是理解神经放电亚细胞机制的关键突破,但对理解大脑认知或计算过程仅推进了微小一步
  • 我的分析:这段以 HH 模型为案例展示了还原论的双重性——成功(描述动作电位)与不足(无法解释认知)。"积木组装"的隐喻精准——物理中基本原理可像积木一样组合,但生物系统的"积木"(细胞类型、蛋白质)数量远超物理的基本粒子,且每个"积木"都有独特功能。HH 模型"仅推进微小一步"的判断将还原论的成功与局限并置——它在分子层面有效但无法跨尺度到系统层面。这一判断为后续"需要整体性方法"做了铺垫。

段落 3:相互作用结构谱系——还原论的两极有效性

  • 核心论点:物理系统可按相互作用结构排列在从规则到随机的谱系上,还原论在两极有效(连续介质假设/统计力学)但生物系统处于中间的"复杂"区域。
  • 支撑论据:
  • 物理系统可组织在规则→随机谱系上(Fig. 1, ref 11)
  • 还原论在谱系两极最有效——相互作用呈现特定对称性
  • 规则端(对称组织):原子在金属/晶体中,可通过连续介质假设抽象——如热流可用 PDE 建模无需建模单个原子(ref 12)
  • 随机端(大量噪声相互作用组件):如气体分子,发展统计力学框架(ref 13)——假设相互作用元素全同,描述概率分布而非单个元素,通过 mean-field 近似减少自由度
  • 中间(复杂系统):拓扑不规则相互作用、异质元素、多功能过程、跨时空尺度——在生物过程中特别普遍
  • 以大脑为例:大量互联神经元群体,准确模型需包含复杂连接、不同细胞类型异质性和神经化学过程
  • 建模需自由度极大的复杂模型,导致高维动力学
  • 生物复杂性概念不新(refs 14, 15),复杂系统科学很大程度上由生物系统研究驱动(refs 16, 17)
  • 尽管过去二十年持续关注,复杂系统方法在生物学中尚未产生令人信服和有形的结果
  • 我的分析:这段是全文的核心概念框架——Fig. 1 的谱系将还原论的有效性边界可视化。规则端的"连续介质假设"和随机端的"mean-field 近似"都是自由度缩减策略,其有效性依赖于系统的对称性。生物系统处于中间——既无足够对称性应用连续介质,也无足够全同性应用 mean-field。"尚未产生令人信服的结果"是作者的严厉判断——但这一判断可能忽略了网络科学在脑连接组学等领域的实际进展。不过,从"可操作洞见"的角度看(如直接改善患者治疗),复杂系统神经科学确实尚未实现端到端的临床转化,作者的判断有其合理性。

段落 4:文章路线图——整体性建模范式

  • 核心论点:文章主张通过整体性数学建模范式——整合多时空尺度、多模态数据和复杂表示结构——来克服还原论局限,利用现代数据采集、ML/AI 和 HPC 实现。
  • 支撑论据:
  • 还原论方法必须避免以构建整体性方法——整合不同时空尺度、使用多模态数据、考虑复杂表示结构
  • 整体性 MM 哲学超越孤立功能,在单一模型中整合多种生物物理过程
  • 过去二十年的理论方法不足以产生实证有用或可操作的洞见
  • 现代数据采集、ML/AI 和 HPC 不会替代建模而是以前所未有的规模促进它
  • 倡导整体性框架——拥抱复杂性和实证主义以回答最紧迫的科学挑战
  • 我的分析:这段的路线图明确界定了三个技术支柱(丰富表示、模拟方法、逆问题)和一个哲学立场(整体性>还原论)。"ML/AI 不会替代建模而是促进它"的定位是重要的——它将 ML 定位为建模的赋能工具而非替代品,这与 PIML(物理嵌入 ML)的理念一致。但"拥抱复杂性"的倡导需要与"可验证性"平衡——复杂模型更难验证且更易过拟合,这一风险未在此处讨论。

II. RICH AND REALISTIC REPRESENTATIONS FOR COMPLEX SYSTEMS

段落 1:网络科学的发展与局限

  • 核心论点:网络科学是抽象复杂系统元素和相互作用的主流方法,但其关注通用原理使其过于理论化,需要更高阶的表示结构来捕捉生物复杂性。
  • 支撑论据:
  • 网络研究成为表示元素和相互作用的流行方法(ref 18, Newman 2018)
  • 过去 20 年重要研究:scale-free 网络(ref 19)、small-world 网络(ref 11)、community-structured 网络(ref 20)
  • 复杂系统研究在很多人中等同于网络科学
  • 在生物系统建模中有用:大脑(ref 21)、生态系统(ref 22)、生物医学系统(ref 23)、蛋白相互作用(ref 24)、基因调控(ref 25)
  • 通过加权、有向、符号连接以及时间网络(连接随时间变化)扩展
  • 但复杂系统研究迄今为止主要停留在理论层面,关注超越特定系统的通用原理(ref 26)
  • 近期注意力转向 higher-order 表示(refs 27–29):hypergraphs、simplicial complexes、multilayer 网络(Fig. 2)
  • multilayer 网络为多个不同但耦合的过程同时演化的生物系统建模提供了新机会(ref 30)
  • 例子:大脑网络中神经活动由脑血管血流支撑,老化导致促进认知的网络结构变化——不同机制、动力学和时间尺度但内在耦合
  • 我的分析:这段将网络科学的发展分为两代——经典网络(scale-free/small-world)和 higher-order 网络(multilayer/hypergraph)。经典网络"过于理论化"的判断有合理性——scale-free 网络的幂律度分布虽普遍但其对预测的具体价值有限。multilayer 网络对血管 G&R 有直接启示:血管壁可视为 multilayer 网络——一层是力学网络(细胞-ECM 力学耦合),一层是信号网络(生长因子/化学信号),一层是结构网络(胶原/弹性蛋白排列),三层耦合演化。但 multilayer 网络的数学分析比单层网络复杂得多——特征值、同步、扩散等性质的行为会质变。

段落 2:Annotated networks——节点元数据的重要性

  • 核心论点:annotated 网络通过在节点上附加特征向量来编码元素异质性,是建模生物系统异质性的关键扩展,但其动力学很少被研究。
  • 支撑论据:
  • annotated 网络是很少被考虑动力学的 higher-order 表示(ref 32)
  • 与典型网络 G=(V,E) 不同,annotated 网络在每个顶点附加特征向量 d_i ∈ R^d(ref 33, 34)
  • 允许建模个体元素异质性,增加关键的表达能力层
  • 在神经科学中有用:biologically annotated connectomes(ref 35, Bazinet et al. 2023)——人脑网络中每个节点(区域)附带细胞类型密度、基因转录、受体密度和髓鞘化等信息
  • neuromaps 开源软件(ref 36)促进多模态数据整合为更丰富的结构表示
  • 这种异质性用于开发全脑动力学生物物理模型——通过基因表达变化(ref 37)或突触强度变化(ref 38)纳入区域异质性,更接近观测的神经动力学
  • 过去,这种过参数化模型受限于多模态数据不足和推断算法
  • 大数据时代——现代实验技术以前所未有规模记录多模态数据(refs 39, 40)
  • 计算统计和 ML 新技术可使用观测数据对复杂模型进行参数推断(refs 41, 42)
  • 通过实验数据准确校准和 HPC 高效模拟,详细的异质化模型可从描述性跨越到机制性和预测性
  • 我的分析:annotated 网络的概念对生物建模有根本性价值——它将"全同节点"假设(经典网络)扩展为"异质节点",更接近生物现实。biologically annotated connectomes(ref 35)是一个示范——脑区不再只是网络节点,而是带有基因表达、受体密度等多维特征的实体。"从描述性到机制性和预测性"的跨越是核心主张——但这一跨越需要三个条件同时满足:足够数据、高效推断、HPC 模拟能力。作者认为三者已具备,但"准确校准"对数百参数的模型仍是严峻挑战——可识别性问题(不同参数组合产生相同输出)未被讨论。

段落 3:Integrating many time- and length-scales——尺度分离的失效

  • 核心论点:物理系统中不同时空尺度通常可分离(如行星运动无需考虑大气动力学),但生物系统的尺度相互作用不可分离,需多尺度模型耦合。
  • 支撑论据:
  • rich 结构(multilayer/annotated/hyper)提供建模相互作用的生物过程所需的表达能力
  • 剩余挑战:许多过程跨多个时间-和长度尺度演化
  • 物理学中尺度常可分离——如行星运动不需考虑更小尺度大气动力学或更远恒星的引力场
  • 天体模型可假设恒星/行星质量固定,忽略更慢的恒星演化和碰撞事件——这些过程基本解耦
  • 生物系统完全不同——以交互时空尺度为特征(ref 43)
  • 聚焦单一尺度自然限制了解释某些现象的能力
  • 例子:阿尔茨海默病(AD)——毒性蛋白扩散多年→认知衰退源于 10^-3–10^0 秒的病理性神经活动
  • 仅建模神经活动或毒性蛋白扩散不足以理解 AD 机制
  • Fig. 3 展示 AD 涉及的多个过程及其时空尺度
  • 近期研究尝试整合时间尺度(refs 45, 46):先建模毒性蛋白扩散导致的网络退化,在不同快照冻结网络状态作为快神经活动模型的拓扑基础
  • 我的分析:这段以 AD 为案例展示了跨尺度耦合的必要性——"年"尺度的蛋白扩散与"毫秒"尺度的神经活动通过"网络拓扑冻结"策略耦合。这一策略(慢过程→快照→快过程)是跨尺度建模的经典方法(quasi-static approximation 的变体),但在血管 G&R 中可能更复杂——G&R 的时间尺度(天/周)与血流动力学(秒/毫秒)的耦合不仅是拓扑冻结,还涉及力学-生长反馈循环。AD 案例的价值在于展示了"仅建模单一尺度为何不足"——AD 不能仅从分子层面(蛋白折叠)或系统层面(脑网络)理解,需要跨尺度桥接。但多尺度耦合"complicates mathematical analysis and elegance in favour of greater biological realism"——这一权衡是整体性范式的核心代价。

III. TOWARDS SIMULATION-BASED SCIENCE

段落 1:Agent-based models——从分析到模拟的转变

  • 核心论点:ABM 通过模拟个体元素的行为和相互作用来建模复杂系统,其复杂性和对数据的需求过去限制了应用,但 HPC 进展使其变得可行。
  • 支撑论据:
  • 数学模型因优雅和简约被欣赏,常可解析处理获得洞见
  • 随模型复杂化失去解析可处理性,需数值方法——ABM 是基于直接模拟的框架
  • ABM 在经济研究中有应用(refs 47, 48),在数学生物学中也有使用(refs 49, 50)
  • ABM 典型结构:定义个体元素特征和相互作用的微观模型时间演化
  • 例子:疾病通过人群传播、生态动力学或集体运动(Panel A, Fig. 4)
  • 与传统模型不同,ABM 需通过穷举模拟和数据驱动校准实现——过去计算限制大
  • 科学计算进展使大规模 ABM 模拟变得可行和有吸引力(ref 51)
  • 我的分析:这段定位 ABM 为"从解析到模拟"的范式转变——从 ODE/PDE 的解析可处理性转向计算密集的个体模拟。"过去计算限制"的缓解是关键转折——HPC 使 ABM 从"理论上有吸引力但实践不可行"变为"可行"。但 ABM 的核心挑战不在计算而在验证——当 agent 行为规则是人为设定时,模型结果的可信度取决于规则的实证基础。

段落 2:ABM vs简约模型 vs ML——可解释性与复杂性的权衡

  • 核心论点:ABM 的采用需要从"简约即最佳"(Occam's razor)转向"复杂性即必要",但 ABM 的 hidden parameters 选择需要透明和有原则的框架。
  • 支撑论据:
  • ABM 采用需态度转变——复杂性系统需要纯模拟科学,附加特征和现实主义优于简约和优雅(ref 52)
  • 当前倾向最小模型常由 Occam's razor 论证——最简模型常最佳
  • 但最小模型在生物学中的失败+过参数化 ML 模型的成功质疑了这一长期观点(refs 53, 54)
  • ML 模型能发现大量有预测力的潜在特征,而简约建模者必须识别少数可能重要的
  • 更复杂模型通过允许在模型定义层面包含足够复杂性,减轻了建模者的某些选择负担
  • ABM 与 ML 模型的区别:两者都缺乏解析可处理性且依赖计算,但 ML 是"黑箱"(机制不透明),ABM 试图建模基本物理机制
  • ABM 额外优势:因可解释性可测试系统中的现实干预
  • 我的分析:这段的核心区分——ABM(机制可解释)vs ML(黑箱预测)——是方法论层面的重要论点。ABM 的可解释性使其能测试"如果改变 X 会怎样"的反事实问题,而 ML 模型因黑箱性质无法直接回答此类问题。但"Occam's razor 在生物学中失败"的判断需要 qualifier——最小模型失败不意味着所有最小模型都失败,可能只是特定最小模型的选择不当。ML 模型的"成功"也需要与"可解释性"权衡——2024-ML-DrugDiscovery-Durant 指出 ML 模型在分布外的泛化性差,这意味着其"成功"可能在分布内是过拟合。

段落 3:ABM 的方法论风险——"视频游戏"问题

  • 核心论点:ABM 需要指定许多局部相互作用规则,这可能导致 hidden parameters 的 ad-hoc 选择,使建模过程类似"视频游戏"——追求模拟现实而非理解涌现行为。
  • 支撑论据:
  • 指定许多局部相互作用规则可导致 hidden parameters 的 ad-hoc 选择
  • 参数通常由建模者自由裁量,选择与期望行为一致——偏向建模者假设
  • 建模者可能调整局部规则直到期望行为出现在屏幕上——建模过程类似视频游戏,目的为模拟现实而非理解涌现行为
  • 为寻求透明框架,建模者应最小化 hidden parameters 并以有原则、理性的方式选择先验,而非无止境手动调参
  • 先验可通过 Bayesian 机制更新,利用可用数据
  • 我的分析:"视频游戏"隐喻精准且有力——它揭示了 ABM 的核心风险:当模型可自由调整规则直到"看起来对"时,其科学价值存疑。这与 2024-ML-DrugDiscovery-Durant 中"ML 模型学习数据偏差而非物理"的发现有异曲同工之处——两者都指出了"模型可拟合但不一定理解"的风险。Bayesian 先验更新是合理的解决方案方向,但"有原则的先验选择"本身需要领域知识——对血管 G&R,先验来自力学守恒律和已知 G&R 法则,但如何将这些定性知识转化为定量先验分布是非平凡的。

段落 4:Digital twins——从工程到精准医学

  • 核心论点:digital twin 作为物理系统的自适应虚拟模拟,在工程中成熟后正应用于精准医学,其成功需要纳入特定复杂性而非完美重建整个系统。
  • 支撑论据:
  • DT 是设计为虚拟模拟物理系统行为的自适应模型(ref 58)
  • 在工程中有用——Apollo 任务航天器(ref 59)、机械和航空航天工程(ref 60)
  • DT 可由 ABM 组成(如城市模型)
  • DT 有数学公式但需穷举模拟和 HPC,常有 VR/AR 工程界面
  • 在生物学中 DT 在精准医学领域引发兴趣(ref 61)——个性化治疗考虑患者个体特征
  • 个性化 DT 使用生物医学数据校准特定患者系统的模拟以在 in-silico 中测试干预
  • 两个特别有前景的系统:心脏(ref 62)和大脑(ref 63)
  • The Virtual Brain (TVB)/The Virtual Epileptic Patient (VEP) 项目——利用详细生物物理模型和 HPC 预测个性化癫痫区域网络(ref 64)
  • VEP 的实证成功与主导的复杂系统神经科学(聚焦简单振荡模型, ref 65, 尚未实现具体医学应用, ref 66)形成对比
  • 但纯模拟系统既非充分也非必要来理解它——Human Brain Project 试图从单个神经元向上模拟全脑(ref 67),虽有微尺度成果(ref 68)但未能兑现原始承诺(ref 69)
  • DT 应纳入回答特定问题所需的复杂性,而非完美重建整个系统
  • 我的分析:VEP 的成功(ref 64)是 simulation-based 方法在医学中"可操作成功"的标杆案例——它与作者批评的"理论化复杂系统神经科学"形成直接对比,证明了整体性方法的实证价值。Human Brain Project 的失败(ref 69)是一个重要警示——"完美重建整个系统"的目标不现实且科学价值有限。DT 的关键设计原则——"纳入回答特定问题所需的复杂性"——是对整体性建模的精确定义:不是"越多越好"而是"恰够回答问题"。对血管 G&R 的启示是:DT 应聚焦特定临床问题(如支架后再狭窄预测)而非追求完整血管壁重建。

段落 5:Automatic modelling——a posteriori reductionism

  • 核心论点:automatic modelling 通过先构建包含所有已知复杂性的详细模型,再用 ML 和优化系统性地简化,实现客观的"a posteriori reductionism"。
  • 支撑论据:
  • simulation-based 科学为 automatic modelling (AM) 开门——数据驱动方法从高维复杂系统中提取少数重要潜在特征
  • AM 类似模型选择——利用模拟和 ML 执行 a posteriori reductionism
  • 框架:建模者先构建包含所有可用复杂性的详细模型→用计算统计和 ML 优化策略系统简化(拟合实验数据同时惩罚模型复杂性)→以稀疏方式提取最相关特征或基础物理原理
  • AM 与现有模型选择和正则化技术对齐,预计在未来几十年可行
  • 相关方法:Bayesian machine scientist(ref 72)——用 Monte-Carlo 和贝叶斯推断探索和选择候选模型,惩罚复杂性执行符号回归
  • AM 与传统模型简化/粗粒化(ref 73)和系统识别/数据驱动发现不同——不依赖主观决策或不透明非线性变换,客观识别本质特征
  • 透明地以可解释和物理有意义的方式揭示主导特征
  • 我的分析:AM 的理念——"先复杂后简化"——是与传统"先简化后拟合"相反的策略。这一理念的吸引力在于避免了建模者的主观简化选择,让数据驱动简化。但 AM 的"客观性"主张可能过于乐观——"所有可用复杂性"的选择本身是主观的(哪些过程纳入、哪些排除),且"惩罚模型复杂性"的正则化强度选择也是主观的。Bayesian machine scientist(ref 72)的符号回归是一个有前景的方向——它在模型空间中搜索而非假设模型形式。对血管 G&R 的启示是:可先构建包含所有已知 G&R 机制的详细模型(力学+生长+信号+ECM 重塑),再用 AM 从数据中识别哪些机制在特定条件下是主导的。

IV. MODELLING AS AN INVERSE-PROBLEM

段落 1:逆问题框架——从数据推断动力学

  • 核心论点:建模应从传统的"写方程→拟合参数"正向方法转向"从观测数据推断动力学 f"的逆问题方法,利用 SINDy、AI-Feynman 等数据驱动技术。
  • 支撑论据:
  • 传统方法:写描述系统行为的微分方程→找最佳拟合参数
  • 大规模复杂系统中写机制模型困难——如 Hodgkin/Huxley 可分离研究单神经元,但无法对人脑宏观区域如此
  • 现代数据驱动方法:多变量时间序列(MVTS){x_i(t_j)} → 推断 dx/dt = f(x,t) + ξ(x,t)(Eq. 1)中的 f
  • f 为机制动力学(drift),ξ 为加性噪声(diffusion)
  • 方法分两类:符号回归(推断 f 的精确数学项)和深度学习(用 NN 近似 f)
  • SINDy(ref 77):非线性确定性动力学的符号回归,扩展到 SDE(ref 78)和 PDE(ref 79)
  • AI-Feynman(ref 80):从观测数据直接发现物理定律的深度学习方法
  • SDE 方法:stochastic force inference(refs 81, 82)、InferenceMAP(ref 83)、maximum-likelihood estimation(ref 76)
  • 应用于软物质中的 Brownian 动力学(refs 84–86)
  • 扩展到高维网络系统(refs 87, 88)
  • 生成式 ML 近似 f:RNN 和 transformers 学习和预测动力学(refs 91–93)
  • 我的分析:这段将逆问题框架(Eq. 1 的 f 推断)定位为建模的"现代"方法——从"假设模型→验证"转向"数据→推断模型"。SINDy(ref 77)的核心洞见是"稀疏性"——真实物理系统的 f 通常是少数项的组合,可通过 L1 正则化从候选项库中稀疏选择。这与 2024-ML-DrugDiscovery-Durant 的"消融测试"理念一致——识别哪些组件真正贡献而非全部保留。对血管 G&R 的启示是:可从 G&R 时间序列数据(如连续 MRI 追踪的血管几何变化)用 SINDy 推断未知的 G&R 动力学项——如未知的生长率对应力变化的依赖关系。AI-Feynman(ref 80)从数据发现物理定律的思路更雄心勃勃,但其适用条件(足够干净的数据和正确的对称性假设)在生物系统中难以满足。

段落 2:Latent representations——流形假设与 Koopman 提升

  • 核心论点:高维生物数据通常聚类在低维流形上(manifold hypothesis),可通过 VAE 降维或 Koopman 算子升维来发现有效动力学,两者在不同场景下各有优势。
  • 支撑论据:
  • manifold hypothesis(ref 94):高维复杂系统数据通常聚集在低维流形附近(refs 95, 96)
  • 动力学在维度更少的潜在空间中演化——证明降维方法(PCA、t-SNE、UMAP, ref 97)的合理性
  • VAE 擅长将高维时间序列投影到低维空间——学习非线性变换(ref 98, Panel A Fig. 5)
  • 例子:从神经记录发现全脑动力学,开发异质脑区模型(ref 99)
  • 潜在维度虽不对应物理测量但可保持可解释性——如运动控制中的"neural manifolds"编码物理空间表示(ref 100),可用深度学习解码(ref 101)
  • 离散状态空间:hidden Markov models (HMMs),通过变分推断(ref 102)或 VAMPNets(ref 103)拟合——应用于基因组序列分析(ref 104)和神经记录(refs 105, 106)
  • 相反方向"提升"——将动力学投影到高维空间——Koopman 算子将非线性动力学提升到无穷维线性系统(ref 107)
  • Koopman 的有限近似:dynamic mode decomposition(ref 108)和深度学习(ref 109, Panel B Fig. 5)
  • 我的分析:这段展示了动力学建模的两种互补策略——降维(VAE/manifold learning)和升维(Koopman)。流形假设是降维的理论基础——如果高维数据确实在低维流形上,则降维不丢失信息。但"潜在维度可保持可解释性"的主张是最强的——它声称降维后的低维动力学仍有物理意义,这是从描述性(描述数据)到机制性(理解动力学)跨越的关键。Koopman 算子的思路巧妙——通过提升到高维空间使非线性动力学线性化,使 eigendecomposition 等线性工具可应用。对血管 G&R 的启示是:G&R 的高维参数空间(多个材料参数+初始条件+边界条件)可能在低维流形上演化——可从 G&R 仿真数据用 VAE 发现有效低维动力学,或用 Koopman 识别 G&R 的线性化表示以加速参数扫描。

V. A FUNDAMENTAL PHYSICS FOR BIOLOGY

段落 1:生物学的基础理论追寻——SOC、FEP、非平衡热力学、assembly theory

  • 核心论点:整体性建模不排斥基础原理追寻——生物学需要"生命系统的理论物理",多个方向(自组织临界性、自由能原理、随机热力学、assembly theory)有前景但仍处早期。
  • 支撑论据:
  • 整体性转变不否定基础理论原理的重要性——生物学仍缺乏转化性基础原理
  • 迫切需要发展"生命系统的理论物理"
  • 方向 1:自组织临界性(SOC)——Bak et al. 1987 假说:复杂系统可能自组织到临界点,相关长度和扰动敏感性最大化(refs 111, 112)
  • 生物学中 SOC 证据:神经元放电(ref 113)、基因表达(refs 114, 115)——更一般的临界动力学促进生物功能理论(refs 116, 117)
  • Griffith's phases——参数区域而非孤立点显示临界样动力学(ref 118),可能是生物系统的 governing principle
  • 方向 2:自由能原理(FEP)——生物体编码感官信息为概率世界模型,按 Bayesian 机制更新,最小化惊讶(ref 119)
  • FEP 从脑的计算理论扩展到更一般的决策理论,已用于模拟群体行为(ref 120)
  • 方向 3:非平衡热力学——长期被视为生物过程能量约束的核心(refs 14, 121)
  • 随机热力学形式化——描述微观波动过程的随机热力学(refs 122, 123)
  • 应用于生物活动分析(refs 81, 124–127),近期神经活动兴趣(refs 128–130)
  • 开放问题:复杂性和信息处理的热力学极限(ref 131)
  • 方向 4:assembly theory(AT)——量化结构复杂性(如氨基酸)所需的选择量(ref 132, Sharma et al.)
  • AT 为理解分子复杂性约束提供途径,对进化和外星生命检测有洞见(ref 133)
  • 我的分析:这段展示了生物学基础理论追寻的四个方向——它们代表了不同层面的"物理生物学":SOC(统计力学层面)、FEP(信息论/贝叶斯层面)、随机热力学(能量层面)、AT(结构复杂性层面)。这些方向之间是否统一(它们描述同一现象的不同方面)还是独立(各自针对不同问题)未讨论。Griffith's phases(ref 118)将 SOC 从"临界点"扩展到"临界区域",这一推广对生物学的适用性更强——生物系统不太可能精确处于临界点但可能在临界区域附近运作。FEP 的"惊讶最小化"原理与工程中的"最小能量原理"有形式类比——但 FEP 的"能量"不一定是物理能量(作者注明)。对血管 G&R 的启示有限——这些基础理论主要针对神经系统,G&R 的热力学约束(如质量/能量守恒)已在传统连续介质力学中体现,FEP 和 SOC 的适用性不直接。

段落 2:基础理论与实证模型的共生

  • 核心论点:数学生物学应优先发展实证预测模型,同时追寻基础理论原理——两者共生而非互斥,可促进跨学科融合。
  • 支撑论据:
  • 数学生物学和复杂系统应优先发展实证预测和实用模型,同时追寻基础理论原理
  • 此领域需要大胆理论——虽有争议但能推动领域前进
  • 建模者应倾向于可在现有数据上测试、根植于已建立和充分测试的物理原理的理论预测
  • 这些目标是共生的——当模型开始产生有用洞见时,实证生物科学对理论假设的抵触可能转变
  • 最终模糊领域边界,导向真正的跨学科方法
  • 我的分析:这段的"共生"论点——实证模型与基础理论并进——是对"整体性 vs 基础理论"二分法的消解。两者不是互斥的:整体性模型可从基础理论获得先验约束,基础理论可从整体性模型获得实证验证。"大胆理论"的倡导有其风险——但"可在现有数据上测试"的限定是重要的安全约束。对血管 G&R 而言,这一共生意味着:在发展 G&R 整体性模型(整合力学+生长+信号)的同时,继续追寻 G&R 的基础原理(如 homeostatic setpoint 理论、力-生长耦合的热力学约束)。

VI. BACK TO THE FUTURE

段落 1:三个方向的总结与展望

  • 核心论点:整体性建模框架需三个方向协同——丰富表示结构、基于模拟的方法和逆问题框架,同时保持基础理论追寻,以在未来数十年实现数学生物学的突破。
  • 支撑论据:
  • 发展解释实证数据并产生有用预测的整体性框架是跨学科科学中最艰巨且紧迫的挑战之一
  • 提出研究方向和必要概念转变的路线图
  • 三个有前景方向:(1) 丰富和精巧的建模框架(multilayer/annotated/temporal/hyper-networks);(2) 基于模拟的方法(ABM、digital twins)纳入详细机制和严格测试干预;(3) 数据驱动动力学建模强调逆问题
  • 重申基础理论原理识别应保持为生物学的终极目标
  • 近期关键进展提供转化性基础洞见
  • 成功应对这些挑战将极大改变数学和生物学的跨学科研究
  • 为合成生物学、人工生命和其他生物技术突破铺路
  • 我的分析:这段的展望宏大但路线图清晰——三个方向分别对应"表示"(如何编码复杂性)、"方法"(如何模拟复杂性)和"推断"(如何从数据学习复杂性)。"合成生物学、人工生命"的展望设定了长远目标——这些领域目前"仅存于科幻"但若整体性建模成功可能变为现实。展望的时间尺度("未来数十年")是诚实的——范式转变不是短期可实现。对血管 G&R 的启示是三个方向的具体应用:annotated/multilayer 网络表示血管壁异质性→ABM/digital twin 模拟 G&R 过程→SINDy/逆问题从 MRI 数据推断 G&R 参数。

摘要概述

本文是一篇 Perspective 性质的立场文章,以 neuroscience(尤其 Hodgkin-Huxley 模型与 whole-brain dynamics)为案例,论证传统的 reductionist 建模范式在 biology 中已显不足,既无法捕捉 biological systems 的 heterogeneity、poly-functionality 与跨尺度耦合,也未能产出可行动的预测性结论。作者主张转向一种 holistic mathematical modelling 范式:采用 annotated/multilayer networks、hypergraphs 等富有表达力的表征结构来编码节点元数据(如 cell-type density、gene transcription),借助 agent-based models (ABMs) 与 simulation-based inference 在高性能计算上整合多个 time- 与 length-scale(如 Alzheimer's disease 中 toxic-protein 扩散与 fast neural activity 的耦合),并聚焦从动力学观测反推系统性质的 inverse problem。文章强调该范式与寻找 biophysics 基本原理并不冲突,反而能在数据与算力充沛的当下推动 mathematical biology 的实质性进展。

关键图表

  • Fig. 1 (The spectrum of interaction structures):将物理与生物系统置于从 regular(对称、可用 continuum assumption 与 PDE 描述)到 random(统计力学/mean-field 近似)的谱系上,指出 biological complexity 处于两端之间,具有 topologically irregular interactions 与高维 dynamics,正是 reductionist 方法失效的根源。
  • Fig. 2 (Richer representations for complex systems):展示从普通 graph 扩展到 hypergraphs、simplicial complexes、temporal、multilayer 及 annotated networks 的表达力梯度,强调 annotated network 通过为每个 vertex 附带 feature vector \(d_i \in \mathbb{R}^d\) 来建模元素异质性(如 biologically annotated connectomes)。
  • Fig. 3 (Multi-scale processes in Alzheimer's disease):以 AD 为例,呈现 toxic-protein spread(年级别)与 pathological neural activity(\(10^{-3}\)–\(10^0\) 秒)等过程在 time- 与 length-scale 上的耦合关系,论证 single-scale 建模的局限与 multi-scale 耦合模型的必要性。

与我的关联

虽然本文以 neuroscience 为主线,其 holistic 建模哲学对我关注的 atherosclerosis 与 vascular growth & remodeling (G&R) 高度相关:血管病变同样涉及跨尺度(sub-cellular signaling → cell migration → tissue-level continuum mechanics)、多物理过程耦合与强异质性,作者倡导的 multilayer/annotated networks、simulation-based inference 与 multi-scale coupling 思路,正是构建可预测 vascular G&R 模型可借鉴的方法论框架。