Integrating machine learning and multiscale modeling—perspectives, challenges, and opportunities in the biological, biomedical, and behavioral sciences¶
Alber, Mark; Buganza Tepole, Adrian; Cannon, William R. et al. · 2019 · npj Digital Medicine
Metadata
Authors: Alber, Mark; Buganza Tepole, Adrian; Cannon, William R.; De, Suvranu; Dura-Bernal, Salvador; Garikipati, Krishna; Karniadakis, George; Lytton, William W.; Perdikaris, Paris; Petzold, Linda; Kuhl, Ellen
DOI: 10.1038/s41746-019-0193-y
Tags: #multiscale-modeling #machine-learning #physics-informed-neural-network #digital-twin
概述(Overview)¶
摘要概述¶
本综述由 11 位来自应用数学、计算生物学、生物力学、神经科学等领域的作者联合撰写,系统论证了 machine learning(ML)与 multiscale modeling 在生物、生物医学和行为科学中的互补关系。文章以 Digital Twin 为愿景,将整合方式归纳为四个方法象限:ODE-based、PDE-based、data-driven、theory-driven,并指出 physics-informed neural networks(PINNs)是连接 PDE 与深度学习的关键范式。核心共识是:ML 擅长从海量多保真度数据中挖掘 correlation,但忽视物理定律容易产生 ill-posed 问题或非物理解;multiscale modeling 能基于守恒律、本构关系揭示 mechanism 和 causality,但面对跨尺度大数据时效率不足;二者天然互补。文章围绕 managing ill-posed problems、identifying missing information、creating surrogate models、discretizing space and time、bridging scales、supplementing training data、quantifying uncertainty、exploring massive design spaces、elucidating mechanisms、understanding emergence of function、harnessing biologically inspired learning、preventing overfitting、minimizing data bias、increasing rigor and reproducibility 等方向提出十四个开放问题,最终凝练为五大挑战:sparse data 下的预测建模、ill-posed 问题处理、massive design space 探索、causality 识别、以及 ML 方法局限性的认知。主要争议或研究空白在于:如何在数据稀疏且物理不完全已知的情况下构建稳健的预测模型,以及如何将理论驱动的物理约束真正"baked-in"到 ML 架构中而非仅作为后验校正。
综述问题、范围与选择标准¶
- 要回答的问题:machine learning 与 multiscale modeling 如何在生物、生物医学和行为科学中自然互补,以创建整合底层物理的稳健预测模型,从而处理 ill-posed 问题并探索大规模设计空间?
- 覆盖范围:时间跨度未明确界定,但引用文献以 2014–2019 年为主,少量追溯至 2001 年;对象涵盖分子、细胞、组织、器官到群体水平的生物系统;尺度从 ODE(时间演化)到 PDE(时空演化);研究类型覆盖理论方法、计算模型、实验数据整合及临床转化应用。
- 文章性质:perspective(兼有 narrative review 特征,由多学科专家联合撰写,提出愿景与开放问题而非系统评价)。
- 文献选择方法:未报告。文章未说明检索数据库、检索式或纳入排除标准,引用文献以作者团队及相关合作者的工作为主,属于专家视角的选择性综述。
主题综合¶
主题 1:ODE 与系统辨识——从时间序列数据中学习动力学¶
- 核心论点:ODE 在生物医学中无处不在,用于刻画系统的积分响应(时间演化),但参数数量庞大(可达数千),核心挑战在于从数据中识别非线性耦合驱动项;system identification 方法(包括经典回归、stepwise regression、Bayesian inference)可用于参数辨识与不确定性量化,ML 则可减少动力学变量和参数数量同时保持生物学相关性。
- 代表证据定位:§ "Ordinary differential equations encode temporal evolution into machine learning"(PDF p.3-4);引用文献 24(Brunton et al., PNAS 2016)、26(Wang et al., 2019)、32-33(Yang et al., 2018)、35(Kennedy & O'Hagan, 2001)、37-40(Mangan, Rudy, Quade 等)。
- 共识程度:有限。系统辨识方法本身已被广泛验证,但将其与 ML 结合以减少变量维度同时保持生物学相关性这一方向仍处于早期探索阶段,具体成功案例数量有限。
- 分歧或限制:参数空间高维性、模型误差与测量误差的联合处理、以及生物系统特有的多速率动力学(multirate dynamics)对 32-bit GPU 精度的挑战,均未被充分解决(PDF p.9)。
主题 2:PDE 与 physics-informed neural networks——将物理约束嵌入深度学习¶
- 核心论点:PDE 描述生物系统的时空演化,先验物理信息(PDE、边界条件、约束)可正则化 ML 方法使其能从少量噪声数据中稳健学习;Gaussian process regression 将 PDE 编码为 informative function prior,深度神经网络则通过耦合一个由 PDE 决定结构的 residual network 实现物理约束;PINNs 是连接 PDE 与深度学习的关键范式。
- 代表证据定位:§ "Partial differential equations encode physics-based knowledge into machine learning"(PDF p.4);Fig. 3(PINNs 架构,PDF p.6);引用文献 22(Raissi, Perdikaris & Karniadakis, J. Comput. Phys. 2019)、43-45(Weinan et al. 2017; Raissi et al. 2017a,b)、46(Raissi & Karniadakis 2018)、55-59(Bayesian 本构模型标定与不确定性传播)。
- 共识程度:稳固。PINNs 框架已在多个领域(流体力学、心血管流场、量子力学 Schrödinger 方程)得到验证,是当前最成熟的物理约束深度学习方法之一。
- 分歧或限制:扩展到 stochastic PDE(需 GANs)、fractional PDE(含记忆效应系统)、耦合 multiscale multiphysics PDE 系统仍需新理论;PINNs 的 f-architecture 深度由 PDE 最高阶导数决定,当前优化依赖人工 trial-and-error(PDF p.6, Fig. 3 caption)。
主题 3:Data-driven ML 与 multiscale modeling 的互补——correlation 与 causality 的分工¶
- 核心论点:Data-driven ML 主要挖掘 correlation 而非 causality;少数方法(Granger causality、dynamic causal modeling)寻求 causality 但缺乏 mechanism;multiscale modeling 则同时提供 correlation、causality 和 underlying mechanism;因此 ML 揭示的 correlation 可由 multiscale modeling 验证是否为 causal,并向下 unpack 为低尺度机制链。
- 代表证据定位:§ "Data-driven machine learning seeks correlations in big data"(PDF p.4-5);Fig. 4(data-driven 整合框架,PDF p.7);引用文献 20(Hunt et al. 2018)、28(Lytton et al. 2017)、63(Duraisamy et al. 2019)、65(Tank et al. 2018)、66(Friston et al. 2019)、67-68(Dura-Bernal et al. 2019; Vu et al. 2018)。
- 共识程度:稳固。correlation-causality 分工是本综述的核心立论,多次在 Motivation、Challenges、Conclusions 中重申。
- 分歧或限制:在 personalized medicine 中,每个患者的疾病过程是独特变体,传统 evidence-based medicine 将其归入大群体统计——multiscale modeling 能否真正"split the variegated patient population apart"仍需大规模验证(PDF p.5)。
主题 4:Theory-driven ML——将物理"baked-in"到学习管道¶
- 核心论点:Theory-driven ML 的核心思想是将结构化物理定律作为 informative prior information 嵌入 ML pipeline;multifidelity 技术可结合粗粒度低代价模型与少量高分辨率仿真显著加速预测;probabilistic formulation 可指导新数据的审慎获取;直接将守恒、对称、不变性等物理原理 baked-in 到 ML 架构中可构建即使数据有限也稳健的预测模型。
- 代表证据定位:§ "Theory-driven machine learning seeks causality by integrating physics and big data"(PDF p.5-6);Fig. 5(theory-driven 整合框架,PDF p.8);引用文献 11(Kissas et al. 2019,非侵入性动脉血压推断)、27(Sahli Costabal et al. 2019, multifidelity Gaussian processes)、29(Perdikaris & Karniadakis 2016)、70(Sahli Costabal et al. 2019,药物 QT 间期效应)、71(Zhao et al. 2018,active learning 构成本构关系)、72(Costello & Martin 2018,代谢路径动力学)、73(Deist et al. 2019,simulation-assisted ML)。
- 共识程度:有限至稳固。multifidelity 方法在工程材料领域已有成熟应用,但向生物系统推广时面临数据稀疏、模型验证困难等问题。直接 baked-in 物理的方法(如仅用反应守恒律建模细胞代谢,文献 72)仍属个案。
- 分歧或限制:将理论直接嵌入 ML 实践是"recent efforts"(PDF p.6),尚缺乏系统性框架;个性化医学中 simulation-based kernel methods 优于 standard no-prior-knowledge ML 的结论仅基于小训练集研究(文献 73),外推性未验证。
关键图表、Box 与分类框架¶
- 定位:Fig. 1(PDF p.3)
- 内容:ML 与 multiscale modeling 的互补关系总览图。在 parameter level(约束参数空间、识别参数值、敏感性分析)和 system level(利用物理约束、约束设计空间、识别系统动力学)两个层面展示协同:ML 提供 supplementing training data、preventing overfitting、surrogate models、uncertainty quantification;multiscale modeling 提供 mechanism elucidation、scale bridging、emergence of function。
- 价值:本综述的核心概念框架图,将 ML(correlation)与 multiscale modeling(causality)的分工与协作可视化,为后续四个主题象限(ODE/PDE × data-driven/theory-driven)的讨论奠定基础。
-
局限:图为概念性示意图,未包含定量数据或具体案例映射;四象限划分(data-physics 空间)在实际应用中边界模糊。
-
定位:Fig. 2(PDF p.5)
- 内容:以心脏系统为案例展示整合框架。cellular electrophysiology 的 ODE 与 electro-mechanical coupling 的 PDE 提供 physics 约束,ML 用于识别 gating variables 参数值和 anisotropic signal propagation 系统动力学;从细胞水平实验/仿真到器官水平实验/仿真的 scale-bridging 示范。
- 价值:将抽象框架落地到具体生物系统(心脏),展示了 ODE→PDE→ML 的完整整合路径,是本综述最具转化价值的案例。
-
局限:仅展示框架,未给出具体数值结果或验证数据。
-
定位:Fig. 3(PDF p.6)
- 内容:PINNs 架构示意。左侧 unconstrained neural network 表示解 u(x,t),右侧 residual network f(x,t) 由 PDE 决定其结构,深度正比于 PDE 最高阶导数;以一维 Schrödinger 方程为例,未知参数 λ1、λ2 通过学习获得。
- 价值:PINNs 的技术核心图,清晰展示了如何将 PDE 残差作为 loss 约束嵌入神经网络,实现物理知识指导的数据驱动建模。
-
局限:仅以一维 Schrödinger 方程为示例,未展示在高维、耦合或 stochastic PDE 中的表现;f-architecture 不可显式可视化。
-
定位:Fig. 4(PDF p.7)
- 内容:Data-driven ML 框架图。整合 organ/cellular/molecular level 的 simulation 与 experiment,通过 clustering、regression、dimensionality reduction、reinforcement learning、deep learning 进行 ML 分析,目标为 identify parameters、generate hypotheses、optimize treatment。
- 价值:提供了 data-driven 整合的工作流蓝图。
-
局限:概念性框架,未包含具体 pipeline 参数或验证指标。
-
定位:Fig. 5(PDF p.8)
- 内容:Theory-driven ML 框架图。通过整合 theory-driven ML 与 multiscale modeling 加速 model- and data-driven discovery;probabilistic formulation 可量化预测不确定性并指导新数据获取。
- 价值:与 Fig. 4 对称,展示了 theory-driven 路径的工作流。
-
局限:同为概念性框架图。
-
定位:Box 1(PDF p.4)
- 内容:ML 术语与技术术语表,涵盖 active learning、Bayesian inference、classification、clustering、CNN、deep neural networks、domain randomization、dropout、dynamic programming、evolutionary algorithms、Gaussian process regression、genetic programming、generative models、multifidelity modeling、PINNs、RNN、reinforcement learning、regression、supervised learning、system identification、uncertainty quantification、unsupervised learning,每项均附 multiscale modeling 应用示例。
- 价值:为跨学科读者提供 ML 术语速查,且每个术语绑定具体生物医学应用案例,实用性强。
- 局限:术语定义为简短描述性,非严格教科书定义;部分示例来自预印本(如文献 23, 25, 30, 31),尚未经同行评审。
共识、争议与研究空白¶
相对稳固的共识¶
- ML 与 multiscale modeling 天然互补:ML 负责 correlation,multiscale modeling 负责 causality,二者在 parameter level 和 system level 均可协同(PDF p.2-3, Fig. 1;PDF p.9 Conclusions)。
- PINNs 是将 PDE 物理约束嵌入深度学习的有效范式,已在多个领域验证(PDF p.4, Fig. 3;文献 22, 46)。
- 逆问题在生物系统中普遍 ill-posed,需结合物理约束与正则化处理(PDF p.6, "Managing ill-posed problems";PDF p.9, 第二大挑战)。
尚存争议¶
- Digital Twin 的实现时间线:作者以设问形式提出"how long will it take",未给出明确判断,暗示存在不确定性(PDF p.1)。
- ML 能否真正从 correlation 中提取 causality:少数 ML 方法(Granger causality、dynamic causal modeling)寻求 causality but without mechanisms(PDF p.5),其与 multiscale modeling 的 mechanism-based causality 之间的关系尚未厘清。
- 神经网络能否处理 ill-posed inverse PDE without boundary/initial conditions:作者以开放问题形式提出"Does the inherent regularization in the loss function of neural networks allow us to deal with ill-posed inverse partial differential equations..."(PDF p.6),表明尚无定论。
作者提出的研究空白¶
- 将 PINNs 扩展到 stochastic PDE(需 GANs)、fractional PDE(含记忆系统)、耦合 multiscale multiphysics PDE 系统——作者明确指出需"new theory driven approaches"(PDF p.4)。
- 网格生成的自动化——"tyranny of grid generation"仍是瓶颈,PINNs 虽移除 mesh 概念但保留 basis functions(PDF p.7, "Discretizing space and time")。
- ML 的可解释性与机制发现——"Can theory-driven machine learning approaches enable the discovery of interpretable models that cannot only explain data, but also elucidate mechanisms..."(PDF p.8-9)。
- 64-bit 精度需求与 32-bit GPU 限制的矛盾——生物系统的 steep gradients 和 multirate dynamics 可能需要 64-bit 运算,但当前 GPU 技术下 64-bit 计算时间约为 32-bit 的 10 倍(PDF p.9, "Increasing rigor and reproducibility")。
我识别的遗漏¶
- 文献选择偏差:综述引用了大量作者团队自身的工作(Karniadakis/Perdikaris 的 PINNs 系列、Kuhl 的心脏建模系列、Buganza Tepole 的软组织力学系列),对其他团队的替代性方法(如 operator learning/DeepONet、neural operators/FNO)未涉及,可能导致对 PINNs 路径的偏好性呈现。这一遗漏影响了读者对 ML-multiscale 整合方法空间的全局判断。
- 缺乏定量基准或比较:综述未提供任何方法的定量性能比较(如精度、计算效率、数据效率的数值对比),所有论述均为定性,难以评估不同整合策略的相对优劣。
- 临床转化路径缺失:虽多次提及 personalized medicine 和 clinical decision-making,但未讨论从概念验证到临床审批的具体路径(如 FDA 认证框架、validation protocol),影响转化可行性判断。
个人批注¶
与我的工作的关系¶
当前 SMC G&R(vascular growth & remodeling)工作本质上就是 multiscale modeling:FEniCS 求解的 PDE(守恒律 + 本构关系)对应 ODE-based 的 G&R 动力学。本综述提出的整合框架直接相关——若能用 PINNs 或 Gaussian process surrogate 将 FEniCS PDE 求解与临床/实验数据驱动的参数识别结合,有望解决 vascular G&R 本构参数标定中的 ill-posed 逆问题并量化不确定性。文章中提到的 cardiac tissue 参数 Bayesian 推断思路(文献 55, 56, 59)与 vascular G&R 参数标定高度相关;Kissas et al.(文献 11)的非侵入性心血管流场推断方法对血管力学建模具有直接参考价值。第五大挑战("know the limitations")中关于 sensitivity analysis 和 uncertainty quantification 的论述,与 SMC G&R 中参数敏感性分析的工作方向一致。
可复用框架¶
- 四象限分类框架(ODE/PDE × data-driven/theory-driven)可用于分类 SMC G&R 中不同参数标定策略。
- Fig. 1 的 parameter level / system level 双层协同模型可作为设计 PINN-based G&R 参数辨识的架构蓝图。
- Box 1 的 ML 术语表可作为与 ML 社区协作时的沟通参考。
- 文献 57-59(Lee et al. 和 Sahli Costabal et al.)提供的 Gaussian process 不确定性传播 + Bayesian 本构模型选择方法可直接迁移到 vascular G&R 本构参数标定。
疑问与后续动作¶
- 疑问:PINNs 在处理 vascular G&R 这类具有强非线性本构(如 constrained mixture model)和长期记忆效应(growth history dependence)的系统时,是否需要 fractional PDE 扩展?综述指出这一扩展仍需新理论(PDF p.4),但未给出方向。
- 后续动作:检索文献 22(Raissi, Perdikaris & Karniadakis, J. Comput. Phys. 2019)和文献 11(Kissas et al. 2019),评估 PINNs 在血管力学逆问题中的适用性;检索文献 57(Lee et al. 2018)和文献 59(Sahli Costabal et al. 2019),学习 Gaussian process 不确定性传播在软组织力学中的具体实现。
与上下文的关系¶
本文建立在¶
本文建立在以下上游工作之上:Raissi, Perdikaris & Karniadakis 的 PINNs 理论框架(文献 21, 22, 25, 43-46, 51);Humphrey 的 mechanotransduction 与 extracellular matrix homeostasis 理论(文献 15);Ambrosi 等的 biological growth and remodeling 综述(文献 14);De, Wongmuk & Kuhl 的 Multiscale Modeling in Biomechanics and Mechanobiology 教材(文献 13);IMAG(Interagency Modeling and Analysis Group)的多尺度建模倡议(文献 5)。本次未核实这些上游工作的具体内容,仅基于本文引用判断。
已核实的后续引用¶
本次未检索。
同类综述对比¶
本次未核实。文章本身未与同类 ML-multiscale 整合综述进行系统对比,仅在 Box 1 中以术语表形式列举相关工作。
与本地论文队列的关系¶
不适用。本次未检索本地论文队列中与本文直接相关的工作。
逐章节笔记(Section-by-Section Notes)¶
MOTIVATION¶
段落 1:Digital Twin 愿景与四象限方法¶
- 核心论点:Digital Twin 是整合 ML 与 multiscale modeling 的终极愿景——一个持续学习、动态更新的个人虚拟副本;过去二十年 multiscale modeling 已成为构建器官模型的有力工具,其方法可分为 ODE-based 和 PDE-based 两大类,每类中又可区分 data-driven 和 theory-driven 的 ML 方法,由此形成四种向 Digital Twin 迈进的路径。
- 支撑论据:- Digital Twin 概念由 Madni, Madni & Lucero (2019) 在 systems engineering 语境下正式提出,定义为能够实时整合群体数据与个性化数据的数字化自我副本
- Bruynseels, Santoni de Sio & van den Hoven (2018) 讨论了 Digital Twin 在健康保健中的伦理意义;Liu et al. (2019) 提出基于云平台的老年健康服务 Digital Twin 框架;Topol (2019) 在 Deep Medicine 一书中阐述了 AI 如何使医疗更人性化
- 过去二十年 multiscale modeling 已系统整合组织、细胞和分子层级的知识来构建个体器官模型,部分由美国联邦跨机构 IMAG(Interagency Modeling and Analysis Group)倡议推动(White, Peng & Demir, 2009)
-
多尺度方法依据关注尺度分为两类:ODE-based(时间演化为主)和 PDE-based(时空演化为主);两类方法中均区分 data-driven 和 theory-driven 的 ML 路径,形成四象限框架
-
我的分析:本段是全文的导引,通过 Digital Twin 这一高远愿景将读者的注意力从"能不能做到"转向"如何开始"。关键设计是将方法空间划分为 2×2 矩阵(ODE/PDE × data/theory-driven),这一分类既是组织线索也是分析框架。但 Digital Twin 的提出更像是激励性叙事而非严格论证——作者以连续设问("how long"、"can we leverage"、"do we already have")替代了可行性评估,暗示这是一个愿景驱动的 perspective 而非实证 review。
段落 2:ODE 刻画生物系统的时间演化¶
- 核心论点:ODE 广泛用于模拟系统在发育、疾病、环境变化或药物干预期间的积分响应,应用跨越从分子到群体的所有尺度。
- 支撑论据:- 免疫学:ODE 用于关联蛋白-蛋白互作与免疫响应(Rhodes et al., 2019 研究新疫苗的免疫刺激/免疫动态建模与剂量确定)
- 微生物学:ODE 关联生长速率与细菌竞争
- 代谢网络:ODE 关联基因组与生理组(Cuperlovic-Culf, 2018 综述代谢数据的 ML 分析方法;Shaked et al., 2018 用代谢网络预测药物副作用)
- 神经科学:ODE 将蛋白质错误折叠关联到神经退行性生物标志物(Weickenmeier et al., 2019 提出解释 Alzheimer、Parkinson、ALS 中朊蛋白样神经退行的物理模型)
- 肿瘤学:ODE 关联扰动与肿瘤发生(Nazari et al., 2018 建立 IL-6 介导的干细胞驱动肿瘤生长数学模型)
- 流行病学:ODE 关联疾病传播与公共健康
-
所有应用共享同一特征:ODE 研究系统的 integral sense 动力学,不涉及底层特征的区域分布
-
我的分析:本段建立 ODE 的适用范围——时间维度、无空间异质性。列举的六个应用领域(免疫、微生物、代谢、神经、肿瘤、流行病)覆盖了生物医学的主要尺度,为后续 ODE-based ML 整合提供了问题域。但"integral sense"的表述暗示 ODE 无法处理空间异质性,这是其与 PDE 的根本分界,为下一段引出 PDE 做铺垫。论证逻辑是:ODE 适合"不关心区域分布"的问题。
段落 3:PDE 刻画生物系统的时空演化¶
- 核心论点:PDE 用于研究固有异质性、区域变化场的空间模式(如心血管血流、心脏弹性动力学收缩),通常是非线性且高度耦合的,需借助有限差分或有限元方法数值求解;有限元方法能将 ODE 和 PDE 结合以跨尺度传递知识。
- 支撑论据:- PDE 适用于研究固有异质性、区域变化场的空间模式——心血管血流(Kissas et al., 2019 用 physics-informed deep learning 从 4D MRI 非侵入性预测脉搏波传播)、心脏弹性动力学收缩(Baillargeon et al., 2014 的 Living Heart Project 提供人类心脏功能的稳健整合仿真器)
- 这些方程不可避免地是非线性且高度耦合的,通常需要有限差分或有限元方法数值近似求解
- 有限元方法有长期成功历史,能够将 ODE 和 PDE 结合以跨尺度传递知识(De, Wongmuk & Kuhl, 2014 编辑的 Multiscale Modeling in Biomechanics and Mechanobiology)
- FEM 的核心机制:小尺度行为通过本构律(ODE + 空间导数)局部表示,嵌入大尺度守恒律(PDE)中
-
前提条件是已知系统物理(运动学方程、质量/动量/能量守恒),且需要本构方程封闭方程组——本构方程须用实验数据或 multiscale modeling 生成的数据标定
-
我的分析:本段与上一段形成 ODE-PDE 对仗结构。关键论点是有限元方法作为 ODE-PDE 跨尺度整合的传统工具——小尺度行为通过本构律(ODE + 空间导数)局部表示,嵌入大尺度守恒律(PDE)中。但作者指出这一方法的前提是"知道系统物理",这一前提正是后续 ML 介入的动因——当物理不完全已知时,传统 FEM 方法受限。本构方程的标定问题直接关联到我的 SMC G&R 工作中的参数识别。
段落 4:Multiscale modeling 的目标——预测生物系统行为¶
- 核心论点:Multiscale modeling 的主要目标是识别 causality 并建立数据间的因果关系;生物材料因"活着"而比工程材料更复杂——能主动收缩、重排架构、生长或缩小,需要重新思考动力学、质量守恒和热力学定律,并纳入生物/化学/电场作为刺激;multiscale modeling 的核心假设是大尺度行为自然从小尺度集体作用中涌现,但代价是计算昂贵且引入大量未知物理和参数。
- 支撑论据:- 生物材料因"活着"而比弹性、粘弹性或弹塑性的传统工程材料更复杂:能主动产力、主动收缩、重排架构、生长或缩小(Ambrosi et al., 2011 关于生物生长与重塑的 perspective;Goriely, 2017 的 The Mathematics and Mechanics of Biological Growth)
- 生物材料持续与环境交互并适应,动态响应生物、化学或力学信号——Humphrey, Dufresne & Schwartz (2014) 综述了 mechanotransduction 与细胞外基质稳态
- 建模需重新思考动力学、质量守恒和热力学定律,并纳入作为刺激的生物/化学/电场(Lorenzo et al., 2016 的前列腺癌个性化组织尺度建模与仿真)
- 多物理场 multiscale modeling 成为必要(Chabiniok et al., 2016 的心脏力学多物理场多尺度建模;Southern et al., 2008 的生物学多尺度计算建模综述)
- 核心假设:大尺度行为从低尺度集体作用中自然涌现,而非对大尺度行为做现象学假设(Hunt et al., 2018 提出面向生物现象的机制导向模型谱系)
- 代价:计算昂贵,且引入大量未知物理和未知参数(Raissi & Karniadakis, 2018a 的 hidden physics models;Raissi, Perdikaris & Karniadakis, 2019 的 PINNs 框架)
-
随着数据记录与存储能力增强,海量生物医学数据可用于系统发现这些未知细节
-
我的分析:本段是 multiscale modeling 的定位陈述。核心论点有三层:(1) 目标是 causality 而非仅 correlation;(2) 生物材料的"活性"(active contraction, growth, remodeling)使其与传统工程材料有本质区别,需扩展物理框架;(3) 涌现性假设(emergence from collective action)是 multiscale modeling 的认识论基础,但代价是参数空间膨胀。第三点为下一节 ML 的介入提供了合理性——海量数据可用于发现这些未知细节。文献 15(Humphrey 的 mechanotransduction 综述)和文献 14(Ambrosi 的 growth and remodeling 综述)是 vascular G&R 的核心参考文献。
段落 5:Machine learning 的目标——推断生物系统动力学¶
- 核心论点:ML 的主要目标是从大数据中识别 correlation;当前焦点正从基于稀疏数据的正向问题转向基于大数据的逆向问题;ML 可系统预处理海量数据、整合不同模态和保真度的数据、识别关联、推断系统动力学,并通过 Bayesian inference 和 uncertainty quantification 量化关联的一致性。
- 支撑论据:- ML 的核心目标是从大数据中识别 correlation;当前焦点从基于稀疏数据的正向问题转向基于大数据的逆向问题(Raissi, Yazdani & Karniadakis, 2018 的 hidden fluid mechanics 框架)
- 逆向问题假设大数据可用但 governing equations 和参数不精确已知——Brunton, Proctor & Kutz (2016) 的 SINDy 方法从数据中发现非线性动力系统方程;Raissi, Perdikaris & Karniadakis (2017) 的 physics-informed deep learning Part II;Wang, Huan & Garikipati (2019) 的变分系统辨识方法
- ML 可系统预处理海量数据,整合不同输入模态和不同保真度级别的数据,识别关联并推断系统动力学
-
Bayesian inference 和 uncertainty quantification 可用于跨多尺度比较计算仿真特征与实验测量特征(Sahli Costabal, Perdikaris, Kuhl & Hurtado, 2019 的 multifidelity Gaussian processes 用于大规模计算模型加速预测)
-
我的分析:本段与上一段形成 ML-multiscale 对仗。ML 的目标是 correlation,multiscale 的目标是 causality——这一分工是全文的核心论点。关键细节是"焦点从 forward problems (sparse data) 转向 inverse problems (large datasets)"——这解释了为何 ML 在当前大数据时代变得关键。文献 27(Sahli Costabal et al., multifidelity Gaussian processes 用于心脏电生理)直接关联到参数标定中的 Bayesian 方法。
段落 6:ML 与 multiscale modeling 的互补¶
- 核心论点:ML 与 multiscale modeling 天然互补——ML 揭示 correlation 时,multiscale modeling 可验证其是否为 causal;multiscale modeling 识别 mechanism 时,ML(耦合 Bayesian 方法)可量化不确定性;整合需要在 ML 中先验嵌入物理知识(PDE、边界条件、约束),特别是在数据有限时通过守恒、对称、不变性等物理约束增强 ML 的稳健性;Figure 1 展示了 parameter level 和 system level 的双层协同。
- 支撑论据:- 自然协同的基础逻辑:ML 揭示 correlation 时,multiscale modeling 可验证其是否为 causal;multiscale modeling 识别 mechanism 时,ML(耦合 Bayesian 方法)可量化不确定性
- Lytton et al. (2017) 在脑与神经系统疾病的临床多尺度建模中展示了这种协同的实际意义
- 先验嵌入物理知识的必要性:当可用数据有限时,可通过纳入守恒、对称、不变性等物理约束增强 ML 稳健性(Raissi, Perdikaris & Karniadakis, 2019 的 physics-informed neural networks 框架)
- 数据驱动方法用于补充稀疏训练数据——Tartakovsky et al. (2018) 用 physics-informed deep neural networks 学习参数和本构关系;Tartakovsky, Tartakovsky & Perdikaris (2018) 处理非高斯非平稳统计的物理信息深度神经网络
- 跨模态数据整合用于构建生物系统预测仿真工具——Perdikaris & Karniadakis (2016) 的 multifidelity Bayesian optimization 用于血流动力学参数估计
- 双层协同框架:parameter level(约束参数空间、识别参数值、敏感性分析)和 system level(利用物理、约束设计空间、识别系统动力学)
- ML 提供的工具集:supplementing training data, preventing overfitting, managing ill-posed problems, creating surrogate models, quantifying uncertainty
-
Multiscale modeling 提供的工具集:identifying relevant features, exploring interaction, elucidating mechanisms, bridging scales, understanding emergence of function
-
我的分析:本段是全文的核心论点段,直接承接前两段的 ML/multiscale 对仗并给出整合方案。关键贡献是 Figure 1 的双层框架:parameter level(约束参数空间、识别参数值、敏感性分析)和 system level(利用物理约束、约束设计空间、识别系统动力学)。这一框架为设计具体整合方法提供了结构化指导。论证逻辑从"自然互补"到"需要理论整合"再到"具体整合方式",层层递进。但"先验嵌入物理知识"的具体技术细节留给后续 PDE/PINNs 部分展开。
段落 7:综述结构与愿景¶
- 核心论点:综述围绕四个方法领域(ODE、PDE、data-driven ML、theory-driven ML)组织,这四个主题映射到 data-physics 空间的四个角,其中数据量自上而下增加、物理知识自左而右增加;每个领域识别挑战、开放问题和机遇;Box 1 总结 ML 术语;愿景是激发讨论、推动两个领域的研究者联手。
- 支撑论据:- 综述围绕四个相互区别但重叠的方法领域组织:ODE、PDE、data-driven ML、theory-driven ML
- 四个主题映射到 data-physics 空间四个角:数据量从上到下增加,物理知识从左到右增加
- 每个领域识别挑战、开放问题和机遇,并突出生命科学中的实例
- Box 1 总结与 multiscale modeling 相关的 ML 术语和技术,涵盖 active learning, Bayesian inference, classification, clustering, CNN, deep neural networks, domain randomization, dropout, dynamic programming, evolutionary algorithms, GP regression, genetic programming, generative models, multifidelity modeling, PINNs, RNN, reinforcement learning, regression, supervised/unsupervised learning, system identification, uncertainty quantification 等
-
愿景是激发讨论并推动 ML 和 multiscale modeling 领域研究者联手,为人类健康创建可靠的预测工具
-
我的分析:本段是结构说明段,明确四象限框架。关键信息是 data-physics 空间的两轴:数据量轴和物理知识轴。这一坐标系将四种方法定位在不同象限,使读者能理解每种方法的适用条件。愿景部分"spark discussion and inspire scientists to join forces"是典型的 perspective 文章风格,但缺乏对现有合作障碍的分析(如学科文化差异、工具链不兼容、数据共享机制缺失等)。
CHALLENGES¶
段落 1:核心挑战——数据不完整与物理未完全理解¶
- 核心论点:生物医学的核心挑战是理解数据不完整且物理未完全已知的系统;若有完整高分辨率数据可用 ML 探索设计空间和关联,若有已验证标定的物理方程和参数可用 multiscale modeling 预测动力学和因果;整合二者可兼得两者优势,最终目标是提供对生物系统的定量预测洞察;Figure 2 以心脏系统为例展示整合方案。
- 支撑论据:- 心脏系统案例展示整合方案:multiscale modeling 提供底层物理——ODE(cellular electrophysiology)描述细胞电生理,PDE(electro-mechanical coupling)描述机电耦合
- ML 在此框架中的作用:识别 gating variables(控制局部离子通道动力学的门控变量)的参数值,识别 anisotropic signal propagation(各向异性信号传播,控制全局扩散)的系统动力学
- 整合逻辑:multiscale modeling 教 ML 如何利用底层物理并约束设计空间,ML 教 multiscale modeling 如何识别参数值和系统动力学
-
核心挑战定位:数据不完整且物理未完全已知时,完整高分辨率数据可用 ML 探索设计空间和关联,已验证标定的物理方程和参数可用 multiscale modeling 预测动力学和因果
-
我的分析:本段是 Challenges 部分的总纲,重申 ML-multiscale 互补论点并引入心脏案例。逻辑结构与 Motivation 段落 6 一致,但更强调"不完整数据 + 未完全已知物理"这一双重不确定性条件下的挑战。心脏案例的选择具有代表性——它同时涉及 ODE(细胞电生理)和 PDE(机电耦合),能展示完整的多尺度整合。但仅以心脏为例,未讨论其他系统(如血管、骨骼、肿瘤)的整合挑战,覆盖面有限。
段落 2:ODE 将时间演化编码进 ML¶
- 核心论点:ODE 在生物医学中无处不在,因为不考虑空间异质性时较容易获取数据;ODE 系统参数可达数千,核心挑战是识别非线性耦合驱动项;system identification 方法(经典回归、stepwise regression)作为非线性优化问题确定系数组合;Bayesian 框架提供不确定性量化;ML 可减少动力学变量和参数数量同时保持生物学相关性。
- 支撑论据:- ODE 系统参数数量庞大,可达数千甚至更多(Yang, Zhang & Karniadakis, 2018 的 physics-informed GANs for stochastic differential equations;Yang & Perdikaris, 2019 的 physics-informed NNs 中的对抗性不确定性量化)
- 核心挑战是识别非线性耦合驱动项——system identification 方法包括经典回归和 stepwise regression
- 系统辨识方法从大候选项空间出发:Brunton, Proctor & Kutz (2016) 的 SINDy 通过稀疏识别从数据中发现 governing equations;Wang, Huan & Garikipati (2019) 的变分系统辨识在不同保真度和噪声下推断模式形成 PDE
- 这些方法以非线性优化问题形式确定代数项和速率项的最佳系数组合
- Bayesian 框架提供不确定性量化,同时处理测量误差和模型误差(Kennedy & O'Hagan, 2001 的计算机模型 Bayesian calibration)
- 近期系统辨识技术(Mangan et al., 2016, 2019; Quade et al., 2018; Rudy et al., 2017; Champion, Brunton & Kutz, 2019)从大候选项空间出发系统控制和处理模型误差
-
ML 可减少动力学变量和参数数量同时保持生物学相关性(Brunton et al., 2016; Snowden, van der Graaf & Tindall, 2017 的大规模生物系统模型降维方法综述)
-
我的分析:本段聚焦 ODE-based 整合的技术挑战。关键论点是 system identification 能从候选项空间中学习 parsimonious 系数集——这与 SINDy(sparse identification of nonlinear dynamics,文献 24)等方法直接相关。Bayesian 框架处理测量误差和模型误差的联合能力对 G&R 参数标定有直接参考价值。但"ML 减少变量和参数"的论点仅引用文献 24 和 41,证据有限,缺乏对降维后模型可解释性的讨论。
段落 3:PDE 将物理知识编码进 ML¶
- 核心论点:跨尺度交互涉及时空变化场和大量未知参数,先验物理信息(PDE、边界条件、约束)可正则化 ML 方法使其从少量噪声数据中稳健学习;Gaussian process 将 PDE 编码为 informative function prior,深度神经网络通过耦合 PDE 决定结构的 residual network 实现物理约束(Fig. 3);需新理论扩展到 stochastic PDE(GANs)、fractional PDE(高阶离散公式)、耦合 multiscale multiphysics PDE;ML 已渗透到工程材料的 multiscale modeling 和高维 PDE 求解;不确定性量化在材料属性中日益重要。
- 支撑论据:- 跨尺度交互涉及时空变化场和大量未知参数(Walpole, Papin & Peirce, 2013 综述复杂生物系统的多尺度计算模型)
- Gaussian process 和神经网络在正则化 ML 以从少量噪声数据中稳健学习方面尤为有效
- GP 路径:PDE 编码为 informative function prior(Raissi & Karniadakis, 2018 的 hidden physics models)
- 深度神经网络路径:PDE 诱导一个耦合到标准数据驱动神经网络的新神经网络(Raissi, Perdikaris & Karniadakis, 2019 的 PINNs 框架),以一维 Schrödinger 方程为例展示未知参数 λ1 和 λ2 的学习
- 三大理论扩展需求:stochastic PDE 需用 generative adversarial networks;fractional PDE(记忆系统)需用高阶离散公式;coupled multiscale multiphysics PDE 系统
- ML 已渗透到层次化工程材料的 multiscale modeling(Raissi et al., 2017a,b 的 multifidelity data 推断微分方程解;Le, Yvonnet & He, 2015 的非线性弹性材料计算同质化;Liang & Chandrashekhara, 2008 的弹性泡沫本构模型)
- 高维 PDE 的深度学习求解方法快速发展(Weinan, Han & Jentzen, 2017; Weinan & Yu, 2018 的 deep Ritz method; Han, Jentzen & Weinan, 2018; Raissi et al., 2017; Teichert & Garikipati, 2019)
- 不确定性量化在材料属性中日益重要——Bayesian 模型选择标定应变能函数(Madireddy, Sista & Vemaganti, 2015 的软组织超弹性本构模型选择;Mihai, Woolley & Goriely, 2018 的随机各向同性超弹性材料标定)
-
GP 不确定性传播用于非线性力学系统(Lee et al., 2018, 2019 的重建手术材料行为不确定性传播;Sahli Costabal et al., 2019 的心衰多尺度表征;Hurtado, Castro & Madrid, 2017 的心脏机电力学不确定性量化)
-
我的分析:本段是 PINNs 的核心论述。关键区分:Gaussian process 路径将 PDE 编码为先验函数,深度神经网络路径将 PDE 残差作为耦合网络。Fig. 3 以后者(PINNs)为例,以一维 Schrödinger 方程展示 λ1、λ2 参数学习。三个扩展方向(stochastic/fractional/coupled PDE)的提出表明 PINNs 仍有大量未解问题。文献 55-59(Bayesian 本构标定 + GP 不确定性传播)对 vascular G&R 参数标定直接相关。论证从方法描述到扩展需求到现有应用,逻辑完整。但 f-architecture 优化依赖"trial and error by a human-in-the-loop"(Fig. 3 caption),这是当前 PINNs 的实操局限。
段落 4:Data-driven ML 在大数据中寻找关联¶
- 核心论点:ML 是经典统计建模的扩展,能消化海量数据识别高阶关联并生成预测;对超高分辨率测量技术(cryo-EM、流式细胞术、4D-flow MRI)和可穿戴/智能手机健康数据尤为重要;ML 帮助挖掘数据并拉近实验、建模和计算;大多数 data-driven ML 寻求 correlation 而非 causality,少数方法(Granger causality、dynamic causal modeling)寻求 causality 但缺乏 mechanism;multiscale modeling 同时提供 correlation、causality 和 mechanism,因此 ML 和 multiscale 可有效互补——ML 揭示的关联由 multiscale 验证是否为 causal 并向下 unpack 为机制链;这在 personalized medicine 中尤为重要。
- 支撑论据:- ML 是经典统计建模的扩展,能消化海量数据识别高阶关联并生成预测
- 超高分辨率测量技术的发展推动数据爆炸:cryo-EM、高分辨率成像流式细胞术、4D-flow MRI(van den Bedem & Fraser, 2015 关于原子分辨率动态结构生物学的综述)
- 可穿戴和智能手机健康数据的大规模分析(Althoff et al., 2017 在 Nature 上报告全球体力活动不平等的大规模数据;Hicks et al., 2019 在 npj Digital Medicine 上提出可穿戴和智能手机健康数据分析的最佳实践)
- ML 帮助挖掘数据并拉近实验、建模和计算(Duraisamy, Iaccarino & Xiao, 2019 关于数据时代的湍流建模综述)
- AI 在医学中的应用日益广泛(Topol, 2019 关于高性能医学与人类智能融合)
- 大多数 data-driven ML 寻求 correlation 而非 causality——少数方法如 Granger causality(Tank et al., 2018 的神经网络 Granger causality)和 dynamic causal modeling(Friston, Harrison & Penny, 2019)寻求 causality 但缺乏机制
- Multiscale modeling 同时提供 correlation、causality 和 mechanism(Hunt et al., 2018),因此 ML 和 multiscale 可有效互补——ML 揭示的关联由 multiscale 验证是否为 causal 并向下 unpack 为低尺度机制链
- 在 personalized medicine 中尤为重要:multiscale models 可通过识别基于患者基因组、入侵生物基因组或肿瘤细胞基因组以及免疫史的机制变体,将多样化的患者群体拆分
-
ML 提供 invaluable 工具预处理数据、自动化模型构建并分析 multiscale modeling 生成的大量输出数据(Dura-Bernal et al., 2019 的 NetPyNE 脑回路数据驱动多尺度建模;Vu et al., 2018 的神经科学 ML 共享愿景)
-
我的分析:本段重申 correlation-causality 分工并引入 personalized medicine 的转化视角。关键论点是 multiscale modeling 能"split the variegated patient population apart by identifying mechanistic variants"——这比单纯的 ML 分类更深入,因为分类可能基于 spurious correlation 而非机制。但"unpack cause into mechanisms or mechanistic chains at lower scales"的能力在实践中受限于低尺度数据的可获取性和计算成本。文献 67(NetPyNE,数据驱动脑回路建模)是 ML 辅助 multiscale 建模的具体工具实例。
段落 5:Theory-driven ML 通过整合物理与大数据寻求因果¶
- 核心论点:Theory-driven ML 的核心思想是将结构化物理定律作为 informative prior 嵌入 ML pipeline;当物理已知时用 dynamic programming 和 variational methods,当物理未知时用 ML 学习系统动力学;multifidelity 技术结合粗粒度低代价模型与少量高分辨率仿真加速预测;probabilistic formulation 指导新数据获取;直接将守恒、对称、不变性等物理原理 baked-in 到 ML 中可构建数据有限时仍稳健的预测模型。
- 支撑论据:- Theory-driven ML 的核心思想:给定基于物理的 ODE 或 PDE,如何将结构化物理定律和机制模型作为 informative prior 嵌入 ML pipeline
- 当物理已知时,dynamic programming 和 variational methods 极为有效;当物理未知或形式不确定时,用 ML 学习底层系统动力学
- Multifidelity 技术结合粗粒度低成本模型与少量高分辨率仿真显著加速预测(Perdikaris & Karniadakis, 2016 的 multifidelity Bayesian optimization;Perdikaris, Raissi, Damianou, Lawrence & Karniadakis, 2017 的非线性信息融合算法)
- 药物开发中跨十个数量级的空间和时间尺度整合——Sahli Costabal et al. (2019) 用 GP regression 表征 30 种药物对 QT 间期的影响,通过 sensitivity analysis 和 uncertainty quantification 探索药物浓度-毒性互作
- Probabilistic formulation 指导新数据审慎获取和 active learning——Zhao et al. (2018) 设计有效数据获取策略选择最有信息量的介观仿真以恢复非牛顿流的宏观本构律
- 直接将守恒、对称、不变性等物理原理 baked-in 到 ML 中——Costello & Martin (2018) 仅用反应守恒律建模细胞代谢,速率律的精确函数形式未知但用 ML 求解方程
- 辅助观测推断难测量的量——Raissi et al. (2019) 的 PINNs 可利用辅助观测推断实际中难以测量的关注量
- 物理约束 NN 从 4D MRI 非侵入性推断动脉血压——Kissas et al. (2019) 利用流体和固体力学第一原理诱导的已知动态关联
-
个性化医学中 simulation-based kernel methods 优于标准 ML——Deist et al. (2019) 在辐射对细胞影响和 Boolean cancer modeling 中证明,对于小训练集,基于近似仿真的核方法提升下游 ML 性能
-
我的分析:本段是 theory-driven 路径的核心论述,与上一段 data-driven 形成对仗。关键技术贡献有三个:(1) multifidelity 方法通过粗-细模型组合加速计算;(2) probabilistic formulation 的 active learning 策略指导新数据获取;(3) 直接 baked-in 物理原理使模型在数据有限时仍稳健。文献 11(Kissas et al.,从 4D MRI 非侵入性推断动脉血压)对血管力学建模直接相关——这正是 PINNs 在心血管领域的应用实例。文献 73 的结论(simulation-based kernel methods 优于标准 ML)仅基于小训练集,外推性需谨慎。本段论证从"先验信息嵌入"到"加速计算"到"直接 baked-in",技术深度递增。
OPEN QUESTIONS AND OPPORTUNITIES¶
段落 1:开放问题与机遇的引言¶
- 核心论点:整合 ML 与 multiscale modeling 在生物医学中涌现出大量开放问题和机遇,以下讨论最紧迫的问题。
- 支撑论据:- 本段为纯过渡段,将论述从 Challenges 转向具体的 Open Questions and Opportunities 部分
-
未引用具体文献,仅作为结构性引言,声明以下讨论最紧迫的开放问题
-
我的分析:本段是纯过渡段,将论述从 Challenges 转向具体开放问题。结构上,以下每个开放问题以设问句形式提出,既是对研究方向的指引也是对社区的合作邀请。
段落 2:Managing ill-posed problems¶
- 核心论点:许多生物系统的逆问题是 ill-posed 的(边界值问题但边界值未知),经典数学方法不适用;backward uncertainty quantification 难以扩展到现实场景;高维输入空间和生物系统固有不确定性使逆问题始终具有挑战性;开放问题:神经网络 loss function 中的固有正则化是否能处理无边界/初始条件的 ill-posed inverse PDE 并发现隐藏状态?
- 支撑论据:- 许多生物系统的逆问题是 ill-posed 的——数学上构成边界值问题但边界值未知,经典数学方法不适用
- Backward uncertainty quantification 方法可潜在处理逆问题中的不确定性,但难以扩展到现实场景
- 高维输入空间和生物系统固有不确定性使逆问题始终具有挑战性——难以确定是否存在多个解或无解,也难以量化对高维输入数据逆问题预测的置信度
-
开放问题:神经网络 loss function 中的固有正则化是否能处理无边界/初始条件的 ill-posed inverse PDE 并发现隐藏状态
-
我的分析:本段以设问结尾而非给出答案,表明这是真正的开放问题而非已有解决方案。对 G&R 参数标定的直接关联:本构参数识别本质上是逆问题,当实验数据不足以唯一确定参数时即为 ill-posed。PINNs 的 loss function 正则化能否替代传统 Tikhonov 正则化是一个有前景但未验证的方向。
段落 3:Identifying missing information¶
- 核心论点:模型参数是否足以产生高尺度系统动力学?multiscale 仿真和生成网络可与实验并行工作以独立确认参数敏感性;以 circadian rhythm 为例说明简单动力学但复杂参数依赖;开放机遇:用生成模型同时识别动力学的低维性和参数变化的高维性,不充分的 multiscale 模型可通过生成模型预测失败来识别。
- 支撑论据:- 多尺度仿真和生成网络可与实验并行设置,提供参数敏感性的独立确认
- 以 circadian rhythm generators 为例:提供相对简单的动力学但对众多底层参数有非常复杂的依赖性,multiscale modeling 可揭示这种复杂依赖
- 开放机遇:用生成模型同时识别动力学的低维性和参数变化的高维性
-
不充分的 multiscale 模型可通过生成模型预测失败来识别——构成一种模型差异检测方法
-
我的分析:本段提出一个有趣的"模型验证"思路——用生成模型作为 multiscale 模型的独立检验器,当生成模型预测失败时暗示 multiscale 模型不充分。这实质上是一种 model discrepancy detection 方法。但 circadian rhythm 的例子仅作为类比提及,未提供具体数据支撑。
段落 4:Creating surrogate models¶
- 核心论点:能否用 GANs 创建 multiscale 模型的新测试数据集?反之,能否用 multiscale modeling 提供训练或测试实例以用深度学习创建新 surrogate models?深度学习网络可提供比复杂 multiscale 模型更快的答案,在个性化医学中预测特定遗传背景患者的药物疗效方面有重要应用。
- 支撑论据:- 提出双向 surrogate 策略:用 GANs 创建 multiscale 模型的新测试数据集,反之用 multiscale modeling 提供训练/测试实例以深度学习创建新 surrogate models
- 深度学习网络可提供比复杂精密的 multiscale 模型更快的答案
-
应用前景:在个性化医学中预测特定遗传背景患者的药物疗效
-
我的分析:本段提出双向 surrogate 策略:GANs→multiscale 测试数据,multiscale→深度学习训练数据。关键价值在于计算效率——一旦 surrogate 训练完成,推理速度远高于原始 multiscale 模型。但对 surrogate model 的保真度边界(validity range)未讨论,这可能影响其在临床决策中的可靠性。
段落 5:Discretizing space and time¶
- 核心论点:能否移除或自动化传统方法中网格生成的"tyranny"?复杂三维移动域的离散化耗时且需专门知识;机器学习在自动网格生成、无网格插值和域参数化方面有新机遇;PINNs 移除 mesh 概念但保留更基本的 basis functions 概念——在 collocation points 处施加质量、动量、能量守恒律。
- 支撑论据:- 复杂三维移动域的离散化是耗时且需专门知识的劳动密集型挑战,需为每个个体模型重新完成
- 个性化模型中具有多时空尺度的复杂几何使这一问题尤为突出
- ML 在自动网格生成、无网格插值和域参数化方面有新机遇
-
PINNs 移除 mesh 概念但保留更基本的 basis functions 概念——在 collocation points 处施加质量、动量、能量守恒律,这些点既不通过规则晶格也不通过非结构化网格连接(Raissi, Perdikaris & Karniadakis, 2019 的 PINNs 框架)
-
我的分析:本段指出 PINNs 的一个被低估的优势——消除网格生成这一传统 FEM 中的重大瓶颈。但作者坦诚指出 PINNs 仍保留 basis functions 概念,只是 collocation points 不通过规则晶格或非结构化网格连接。这对具有复杂几何形状的个性化模型(如患者特异性血管几何)具有实际意义。然而,collocation points 的选择策略和分布密度对 PINNs 精度的影响未讨论。
段落 6:Bridging the scales¶
- 核心论点:ML 能否在尺度可清晰分离的情况下提供 scale bridging?以癌症为例,ML 可基于单细胞数据探索免疫细胞和肿瘤细胞的响应,指向在解族上构建 multiscale 模型以编码器官或转移尺度的肿瘤演化。
- 支撑论据:- 在尺度可清晰分离的情况下,ML 可提供 scale bridging
- 以癌症为例:ML 可基于单细胞数据探索免疫细胞和肿瘤细胞的响应
-
机遇在于在解族上构建 multiscale 模型以编码器官或转移尺度的肿瘤演化
-
我的分析:本段提出的"在解族上构建 multiscale 模型"思路暗示了一种 ensemble-based 方法,但仅以癌症为例简述,缺乏方法细节和验证。scale separation 的"clean"条件在实际生物系统中往往不满足——这正是 multiscale modeling 的核心难点之一。
段落 7:Supplementing training data¶
- 核心论点:能否用仿真数据补充训练数据?监督学习需要大量训练数据;图像分析中的 domain randomization 仿真已成功作为训练数据补充;multiscale 模型可在广阔参数空间中仿真以补充训练数据,为非线性扩散模型提供 physics-informed ML;multiscale 模型还可增强不充分的实验或临床数据集。
- 支撑论据:- 监督学习(如深度网络)是强大技术但需要大量训练数据
- 图像分析中 domain randomization 仿真已成功作为现有训练数据的补充——Tremblay et al. (2018) 展示通过域随机化用合成数据训练深度网络,弥合现实差距
- 在 multiscale 模型发展完善的领域,跨广阔参数空间的仿真可补充现有训练数据
- 为非线性扩散模型提供 physics-informed ML——将仿真数据与物理约束结合
-
Multiscale 模型可用于增强生物医学系统中不充分的实验或临床数据集
-
我的分析:本段提出 simulation-augmented learning 策略,对数据稀缺的生物医学领域有实际意义。关键论点是 multiscale 仿真可在参数空间中生成数据弥补实验不足。但仿真数据的保真度(fidelity)和与真实数据的分布差异(domain gap)可能导致训练偏差——这一问题在后续"Minimizing data bias"段落中被部分提及但未深入讨论。
段落 8:Quantifying uncertainty¶
- 核心论点:Theory-driven ML 能否可靠刻画预测不确定性并定位其来源?不确定性量化是决策的基石,在临床决策、合成生物学通路设计、药物靶点识别和风险评估中有广泛应用;还有机遇用量化指导新数据的审慎获取。
- 支撑论据:- 不确定性量化是决策的基石
- 实际应用包括:临床决策、合成生物学通路的稳健设计、药物靶点识别和药物风险评估
-
机遇在于用量化指导新数据的审慎、有针对性的获取——即 active data acquisition 策略
-
我的分析:本段强调 uncertainty quantification 的核心地位。关键论点是不确定性量化不仅是事后评估,还可指导主动数据获取(active data acquisition)——这与 theory-driven ML 段落中的 probabilistic formulation 形成呼应。但"pinpoint its sources"(定位不确定性来源)是一个比量化不确定性更高阶的要求,当前方法(如 Bayesian decomposition of uncertainty)在生物系统中的应用仍有限。
段落 9:Exploring massive design spaces¶
- 核心论点:Theory-driven ML 能否为复杂互联过程揭示有意义且紧凑的表示,进而实现大规模组合空间的成本效益探索?这在生物分子设计(药物开发中的靶属性设计)中已较常见,但生物学和生物医学中还有许多应用可受益。
- 支撑论据:- 组合空间探索在生物分子设计中已较常见——具有靶属性的分子的药物开发设计
- 生物学和生物医学中存在许多其他可受益于这些技术的应用
-
关键概念是通过 theory-driven ML 揭示 meaningful and compact representations——将复杂互联过程压缩为可探索的低维表示
-
我的分析:本段简短,指出组合空间探索在 drug design 中已有应用但其他生物医学领域尚未充分利用。关键概念是"compact representations"——通过降维或特征学习将高维组合空间压缩为可探索的低维表示。但缺乏具体案例说明哪些生物医学应用最适合迁移这一方法。
段落 10:Elucidating mechanisms¶
- 核心论点:Theory-driven ML 能否发现不仅能解释数据还能阐明机制、提炼因果、探索干预和反事实的可解释模型?如果从底层物理中已知适当的统计度量,因果推断是否会更准确或更可解释为机制?
- 支撑论据:- 因果推断通常使用各种统计度量如 partial correlation 来推断因果影响
- 开放问题:如果适当的统计度量从底层物理中已知,因果推断是否会更准确或更可解释为机制
-
这涉及将 PDE 中的物理结构作为因果推断的先验约束
-
我的分析:本段提出一个深层认识论问题:physics-informed causal inference 是否优于纯统计 causal inference?关键洞察是"如果适当的统计度量从底层物理中已知"——这意味着 PDE 中的物理结构可为因果推断提供先验约束。但这是一个开放问题,作者未给出答案,也缺乏具体方法路径。
段落 11:Understanding emergence of function¶
- 核心论点:Theory-driven ML 结合稀疏和间接测量能否产生对生物功能涌现的机制性理解?功能涌现的理解在生物学、医学、环境研究和生物技术中至关重要,关键依赖于建模低尺度集体作用以预测高尺度现象如何从集体作用中涌现。
- 支撑论据:- 功能涌现的理解在生物学、医学、环境研究、生物技术和其他生物科学中至关重要
- 研究涌现关键依赖于建模低尺度集体作用以预测高尺度现象如何从集体作用中涌现
-
理论驱动 ML 结合稀疏和间接测量是产生机制性理解的核心挑战——生物系统中高尺度功能往往无法直接观测,需从间接数据推断
-
我的分析:本段将 multiscale modeling 的核心假设(emergence from collective action)与 ML 的数据驱动能力结合。关键挑战是"稀疏和间接测量"——生物系统中高尺度功能往往无法直接观测,需从间接数据推断。这与 G&R 中从临床影像(间接测量)推断组织力学行为(功能涌现)的问题结构一致。但本段极为简短,缺乏具体方法或案例。
段落 12:Harnessing biologically inspired learning¶
- 核心论点:能否利用生物学习设计更高效的算法和架构?深度学习在棋类、Go 和图像识别中成功,但 neuronal networks 擅长的活动(如蚊子逃避和瞄准的控制系统)仍超出这些技术范围;这为更详细的脑模型协助开发新架构和新学习算法提供机遇。
- 支撑论据:- 深度学习在人类难以解决的问题上取得显著成功——典型例子包括 chess 和 Go 以及图像识别(虽然看似容易但实际调动大脑广泛区域)
- 对比:神经元网络特别擅长的活动仍超出这些技术范围——如蚊子逃避和瞄准的控制系统,其小规模神经元网络的效率令人惊叹
-
机遇在于更详细的脑模型可协助开发新架构和新学习算法(Marblestone, Wayne & Kording, 2016 关于深度学习与神经科学整合;Botvinick et al., 2019 关于快速和慢速强化学习;Neftci & Averbeck, 2019 关于人工和生物系统中的强化学习)
-
我的分析:本段提出 bio-inspired ML 的反向迁移——从生物神经系统的高效性中汲取算法设计灵感。蚊子神经网络的例子生动但非严格论证。这一方向与 ML-multiscale 整合的主线关联较弱,更多是展望性思考。
段落 13:Preventing overfitting¶
- 核心论点:能否用先验物理知识避免过拟合或非物理预测?如何在不发生过拟合的情况下标定和验证模型?如何对仿真数据应用交叉验证(特别是含长时间相关的仿真)?概念上是补充已知物理方程的本构方程问题;深度学习可能看似高精度但在训练域外数据上严重失准;需结合 ML 和 multiscale modeling 先验满足物理定律同时防止过拟合。
- 支撑论据:- 概念上这是用本构方程补充已知物理方程的问题——传统工程学科长期使用的方法
- 数据驱动方法可提供不受预设概念或模型约束的解决方案,但其预测不应违反物理基本定律
- 已知案例:一些深度学习神经网络看似高度准确,但在训练域外数据上做出高度不准确的预测;另一些则因目标数据的微小变化而做出高度不准确的预测
- 难点:当模型函数形式无法显式确定时,难以判断分析是否因正确原因预测正确答案
-
机遇在于结合 ML 和 multiscale modeling 先验满足物理基本定律同时防止数据过拟合
-
我的分析:本段是 ML 可靠性的核心论述。关键洞察有两层:(1) "predicts the correct answer for the right reasons"——即模型不仅要准确还要物理合理,这一要求对 PINNs 的 f-architecture 可视化困难构成直接挑战;(2) 仿真数据的交叉验证问题——当仿真含长时间相关时,传统的随机交叉验证可能不适用,需考虑时间结构。对 G&R 参数标定的直接意义:长期仿真的交叉验证策略需要特别设计。
段落 14:Minimizing data bias¶
- 核心论点:心律失常患者能否信任在不同于自身使用环境条件下训练的起搏器神经网络控制器?训练数据来自不同尺度和保真度,均带有归纳偏差;ML 算法只能与所见数据一样好;需 theory-driven 方法提供严格基础以估计有效性范围、量化不确定性和表征置信水平。
- 支撑论据:- 起搏器场景:心律失常患者能否信任在不同于自身使用环境条件下训练的神经网络控制器
- 训练数据来自不同尺度和不同保真度——现有模型、实验分析、历史数据和其他调查,均带有各自的归纳偏差
- ML 算法只能与所见数据一样好——需谨慎防范有偏见的数据集
-
Theory-driven 方法可提供严格基础以估计有效性范围、量化不确定性和表征 ML 方法的置信水平
-
我的分析:本段以起搏器这一高风险临床场景说明 data bias 的危险性。关键论点是"ML 算法只能与所见数据一样好"——这是 ML 的根本局限。Theory-driven 方法的价值在于提供"有效性范围估计"——即明确模型的 extrapolation boundary,这对临床应用至关重要。但"严格基础"的具体内容(如 conformal prediction、domain adaptation)未展开。
段落 15:Increasing rigor and reproducibility¶
- 核心论点:能否建立严格的验证测试和指南来充分测试 ML 算法构建模型的预测能力?开源代码和数据共享是积极步骤,但 physics-constrained NNs 需更多基准和指南;可重复性需用统计度量量化,因优化方法是随机的可能产生不同结果;当前 GPU 系统的 32-bit 限制对建模生物系统尤其困扰——steep gradients 和 multirate dynamics 可能需 64-bit 运算,在当前技术下可能需 10 倍计算时间。
- 支撑论据:- 开源代码和数据共享是 ML 社区的积极步骤
- 但 physics-constrained neural networks 需要更多基准和指南
- 可重复性需用统计度量量化,因为许多优化方法是随机的,可能导致不同结果
-
当前 GPU 系统的 32-bit 限制对建模生物系统尤为困扰——steep gradients 和非常快的 multirate dynamics 可能需要 64-bit 算术,而 64-bit 在当前技术下可能需要约 10 倍的计算时间
-
我的分析:本段提出两个常被忽视的实操问题:(1) 随机优化方法的可重复性需统计度量量化——这要求多次独立运行的统计分析,在计算密集的 PINNs 中成本高昂;(2) 32-bit vs 64-bit 精度问题——生物系统的 steep gradients(如血管壁中的应力集中)和 multirate dynamics(如电信号传播 vs 组织生长的时间尺度差异)可能确实需要 64-bit 精度,但 10 倍的计算时间成本是实际障碍。这一论点在多数 ML 综述中被忽略,体现了作者团队的实操经验。
CONCLUSIONS¶
段落 1:自然互补与五大挑战总览¶
- 核心论点:ML 与 multiscale modeling 自然互补且相互受益——ML 探索大规模设计空间以识别 correlation,multiscale modeling 预测系统动力学以识别 causality;整合二者是更好理解生物系统的关键;作者识别出推进该领域的五大挑战。
- 支撑论据:- 核心论点重申:ML 探索大规模设计空间以识别 correlation,multiscale modeling 预测系统动力学以识别 causality——二者自然互补且相互受益
- 近期趋势表明整合 ML 和 multiscale modeling 可成为更好理解生物系统的关键
-
作者识别出推进该领域的五大挑战,构成后续五段的结构
-
我的分析:本段是全文核心论点的最终重申。correlation-causality 分工被压缩为一句话,五大挑战的总览为后续五段的展开做引。注意"natural complement and mutually benefit"的措辞——作者认为这种互补不是人为构造而是自然的,这一判断的依据是前面 Motivation 和 Challenges 部分的论证积累。
段落 2:第一大挑战——稀疏数据下的预测建模¶
- 核心论点:第一大挑战是在稀疏数据下创建稳健的预测机制模型;数据不足源于实验分辨率不足或病史不完整;关键第一步是系统识别缺失信息;实验上指导新数据的审慎获取或新实验设计,计算上通过仿真补充训练数据;最终挑战是通过结合低-高分辨率数据和多源数据整合最大化信息增益和优化效率,即 multifidelity, multimodality 方法。
- 支撑论据:- 数据不足的常见来源:实验分辨率不足或病史不完整
- 关键第一步是系统识别缺失信息——实验上指导新数据的审慎获取或新实验设计以补充知识库
- 计算上可通过执行计算仿真补充可用训练数据
-
最终挑战是最大化信息增益和优化效率——结合低分辨率和高分辨率数据并整合不同来源数据,引入 multifidelity, multimodality 方法
-
我的分析:本段将"稀疏数据"问题转化为三步策略:识别缺失→实验补充/仿真补充→multifidelity 整合。关键概念是 multifidelity——结合大量低成本低保真数据与少量高成本高保真数据。对 G&R 参数标定的直接意义:临床数据(低保真、大量)+ 体外实验数据(高保真、少量)可通过 multifidelity Gaussian processes 整合。但"稳健的预测机制模型"的定义标准(如可接受的预测误差、不确定性范围)未明确。
段落 3:第二大挑战——处理 ill-posed 问题¶
- 核心论点:第二大挑战是处理 ill-posed 问题,这在生物医学中较为常见,源于逆建模(如参数识别或系统动力学识别);潜在解决方案是结合确定性模型和随机模型——将经典物理的确定性方程(质量、动量、能量守恒)与生命系统的随机方程(细胞信号网络或反应-扩散方程)耦合;PINNs 和 physics-informed deep learning 是有前景的方法,固有地使用约束参数空间和约束设计空间处理 ill-posed 问题;还可发展全新的架构和算法,受生物学习启发。
- 支撑论据:- Ill-posed 问题在生物医学中较为常见,源于逆建模(如识别参数值或识别系统动力学)
- 潜在解决方案:结合确定性模型和随机模型——将经典物理的确定性方程(质量、动量、能量守恒)与生命系统的随机方程(细胞信号网络或反应-扩散方程)耦合
- Physics-informed neural networks 和 physics-informed deep learning 是有前景的方法,固有地使用约束参数空间和约束设计空间处理 ill-posed 问题
-
更进一步可发展受生物学习启发的全新架构和算法
-
我的分析:本段提出一个有创意的方案——确定性物理方程 + 随机生物方程的耦合。关键洞察是经典物理(守恒律)提供确定性骨架,生命系统的随机性(细胞信号噪声、反应-扩散涨落)通过随机方程叠加。PINNs 的优势在于"constrained parameter spaces and constrained design spaces"——通过物理约束自然正则化逆问题。但"受生物学习启发的全新架构"仍属展望,缺乏具体方向。对 G&R 的工作:G&R 本身是确定性(力学守恒)+ 随机(生物变异)的混合系统,这一框架直接适用。
段落 4:第三大挑战——探索大规模设计空间¶
- 核心论点:第三大挑战是高效探索大规模设计空间以识别 correlation;基因测序和可穿戴电子使个性化生物医学数据前所未有地可及和廉价,但高效分析大数据仍是后勤和计算挑战;multiscale modeling 整合物理知识跨尺度传递信息,ML 利用这些洞察进行高效模型降维创建 surrogate models 大幅减少参数空间;最终,大数据的高效分析(理想情况下实时)是将 AI 解决方案引入临床的挑战性步骤。
- 支撑论据:- 基因测序和可穿戴电子的快速发展使个性化生物医学数据前所未有地可及和廉价
- 但高效分析大数据集在 massive design spaces 中仍是后勤和计算挑战
- Multiscale modeling 整合物理知识跨尺度传递信息
- ML 利用这些洞察进行高效模型降维,创建 surrogate models 大幅减少底层参数空间
-
最终,大数据的高效分析(理想情况下实时)是将 AI 解决方案引入临床的挑战性步骤
-
我的分析:本段将"大规模设计空间"挑战分解为数据获取(已解决)→数据分析(瓶颈)→实时分析(目标)。关键策略是 multiscale modeling 提供物理约束 → ML 进行 model reduction → surrogate models 减少参数空间。但"实时分析"作为临床 AI 的目标在当前计算能力下仍遥远——PINNs 的训练本身耗时,推理速度虽快但训练阶段无法实时。
段落 5:第四大挑战——预测系统动力学以识别因果¶
- 核心论点:第四大挑战是稳健预测系统动力学以识别 causality,这是整合 ML 和 multiscale modeling 的实际驱动力;能否利用模型实时识别相关生物特征并探索其互作?实际转化价值示例:能否利用基本物理定律从大数据中识别疾病进展生物标志物(如神经退行性疾病的早期生物标志物)并阐明机制;终极挑战是推进 data- 和 theory-driven 方法创建对生物功能涌现的机制性理解。
- 支撑论据:- 预测系统动力学以识别 causality 是整合 ML 和 multiscale modeling 的实际驱动力
- 转化价值示例:能否利用基本物理定律从大数据中识别疾病进展生物标志物(如神经退行性疾病的早期生物标志物)并阐明机制
-
更抽象层面:终极挑战是推进 data- 和 theory-driven 方法创建对生物功能涌现的机制性理解,解释高尺度现象作为低尺度集体作用的结果
-
我的分析:本段将 causality 识别与疾病生物标志物发现结合。关键论点是"exploiting the fundamental laws of physics"来识别生物标志物——这意味着物理约束不仅是计算工具,还可指导生物发现。但"real time"的要求与当前 PINNs 训练时间矛盾。功能涌现的机制性理解作为"ultimate challenge"呼应了 Motivation 部分的 multiscale modeling 核心假设。
段落 6:第五大挑战——认知 ML 与 multiscale modeling 的局限¶
- 核心论点:第五大挑战是认知 ML 和 multiscale modeling 的局限性;重要步骤是敏感性分析和不确定性量化;ML 工具虽越来越多用于生物系统的敏感性和不确定性分析,但有过拟合和生成非物理预测的高风险;方法只能与底层模型和训练数据一样好;防止过拟合、最小化数据偏差、增强严谨性和可重复性一直是并将始终是创建预测模型的主要挑战。
- 支撑论据:- 重要步骤是分析敏感性和量化不确定性
- ML 工具越来越多用于生物系统的敏感性分析和不确定性量化,但有过拟合和生成非物理预测的高风险
- 方法只能与底层模型和训练数据一样好——须认知模型局限和数据偏差
-
防止过拟合、最小化数据偏差、增强严谨性和可重复性一直是并将始终是创建生物系统预测模型的主要挑战
-
我的分析:本段是全文的收束,将五大挑战中的前四个(稀疏数据、ill-posed、设计空间、causality)统一归结到"认知局限"这一元层面。关键论点"方法只能与底层模型和训练数据一样好"是对 ML 乐观主义的审慎平衡。防止过拟合、最小化数据偏差、增强可重复性三个方向分别对应前面 Open Questions 中的三个子段落,形成首尾呼应。"一直是并将始终是"的措辞表明这些是永恒挑战而非可完全解决的技术问题。
摘要概述¶
这篇综述由 Alber 等 11 位作者联合撰写,系统论证了 machine learning (ML) 与 multiscale modeling 在生物、生物医学和行为科学中的互补关系。ML 擅长从海量多保真度数据中挖掘 correlation,但忽视物理定律容易产生 ill-posed 问题或非物理解;multiscale modeling 能基于守恒律、本构关系揭示 mechanism 和 causality,但面对跨尺度大数据时效率不足。作者将整合方式归纳为四个象限:ODE-based、PDE-based、data-driven、theory-driven,并指出 physics-informed neural networks (PINNs) 是连接 PDE 与深度学习的关键范式。文章以 Digital Twin 为愿景,围绕 managing ill-posed problems、identifying missing information、creating surrogate models、bridging scales、quantifying uncertainty 等方向提出十二个开放问题,最终凝练为五大挑战:sparse data 下的预测建模、ill-posed 问题处理、massive design space 探索、causality 识别、以及 ML 方法局限性的认知。
关键图表¶
-
Figure 1 — ML 与 multiscale modeling 的互补关系总览图。在 parameter level(约束参数空间、识别参数值、敏感性分析)和 system level(利用物理约束、约束设计空间、识别系统动力学)两个层面展示协同:ML 提供 supplementing training data、preventing overfitting、surrogate models、uncertainty quantification;multiscale modeling 提供 mechanism elucidation、scale bridging、emergence of function。一句话:ML 负责 correlation,multiscale modeling 负责 causality。
-
Figure 2 — 以心脏系统为案例展示整合框架。cellular electrophysiology 的 ODE 与 electro-mechanical coupling 的 PDE 提供 physics 约束,ML 用于识别 gating variables 参数值和 anisotropic signal propagation 系统动力学。一句话:从细胞电生理到器官机电耦合的完整 scale-bridging 示范。
-
Figure 3 — PINNs 架构示意。左侧 unconstrained neural network 表示解 u(x,t),右侧 residual network f(x,t) 由 PDE 决定其结构,深度正比于 PDE 最高阶导数。以一维 Schrödinger 方程为例,未知参数 λ1、λ2 通过学习获得。一句话:将 PDE 残差作为 loss 约束嵌入神经网络,实现物理知识指导的数据驱动建模。
与我的关联¶
当前 SMC G&R(vascular growth & remodeling)工作本质上就是 multiscale modeling,若能用 PINNs 或 Gaussian process surrogate 框架将 FEniCS 求解的 PDE 与临床/实验数据驱动的参数识别结合,有望解决本构参数标定中的 ill-posed 逆问题并量化不确定性。文章中提到的 cardiac tissue 参数 Bayesian 推断思路与 vascular G&R 参数标定高度相关。