Physics-informed machine learning¶
Karniadakis, George Em; Kevrekidis, Ioannis G.; Lu, Lu et al. · 2021 · Nature Reviews Physics
Metadata
Authors: Karniadakis, George Em; Kevrekidis, Ioannis G.; Lu, Lu; Perdikaris, Paris; Wang, Sifan; Yang, Liu
DOI: 10.1038/s42254-021-00314-5
Tags: #physics-informed-neural-network #deep-learning #parameter-inference #multiscale-modeling
概述(Overview)¶
摘要概述¶
本文是 Karniadakis 等人发表于 Nature Reviews Physics 的纲领性综述,系统梳理了 physics-informed machine learning(PIML)领域的理论基础、实现路径与应用前景。核心论点是:纯数据驱动的深度学习在科学问题上面面临数据稀缺、外推能力差、物理不一致等结构性缺陷,而将物理定律(PDE 守恒律、对称性、Hamiltonian 结构等)作为 inductive bias 嵌入 ML 模型,可在小数据下显著提升精度、泛化性与可解释性。综述将物理嵌入归纳为三条路径——observational bias(数据驱动)、inductive bias(硬约束,编码进网络结构)、learning bias(软约束,通过 loss 项施加),并重点介绍 physics-informed neural networks(PINNs)通过 automatic differentiation 在时空随机点处施加 PDE 约束的范式。应用覆盖流体力学(hidden fluid mechanics)、生物医学成像(4D-flow MRI 降噪)、等离子体物理、材料科学、量子化学、地球物理等领域,涵盖 forward 求解、inverse 参数反演与高维 PDE 求解。综述最后展望了 digital twins、operator regression、equivariant 架构与 intrinsic variable discovery 等方向,并坦率讨论了 spectral bias、训练不稳定性、缺乏严格收敛理论等当前局限。
综述问题、范围与选择标准¶
- 要回答的问题:如何将先验物理知识嵌入机器学习模型以克服纯数据驱动方法在科学计算中的固有缺陷(数据稀缺、外推差、物理不一致),以及当前的能力与局限是什么。
- 覆盖范围:2015–2021 年间的 PIML 文献,对象涵盖 PDE 正/逆问题、高维问题、不确定性量化与多物理场耦合,尺度从分子(量子化学)到地球系统。
- 文章性质:narrative review(叙述性综述),非 systematic review,无系统性检索式或纳入排除标准。
- 文献选择方法:未报告(作者未声明数据库、检索式或纳入排除标准;文献以作者团队及合作者的工作为主线,辅以领域代表文献)。
主题综合¶
主题 1:物理嵌入的三条路径——observational bias、inductive bias、learning bias¶
- 核心论点:物理知识可通过三种不同深度的途径嵌入 ML 模型——通过数据隐式施加(observational)、通过网络结构硬编码(inductive)、通过 loss 函数软惩罚(learning),三者可组合使用。
- 代表证据定位:文献 ref 7(Raissi et al. 2019, PINNs 原始论文);Box 2(三条路径的定义与对比);Box 3 中 PINNs 算法描述
- 共识程度:稳固——这一三分法已被 PIML 社区广泛采用,后续文献普遍沿用此框架。
- 分歧或限制:inductive bias 虽最严格但仅适用于简单且已知的对称群(平移、旋转、置换等),难以推广到复杂物理系统;learning bias 虽灵活但只能近似满足物理约束,且面临训练不稳定性问题(Wang et al. 2020, refs 76, 77, 173 识别了 spectral bias 与梯度病理)。
主题 2:PINNs 在 inverse/ill-posed 问题上的优势与 forward 问题的局限¶
- 核心论点:PINNs 在数据融合与逆问题求解上具有独特优势(mesh-free、可处理不完整边界条件、可同时反演参数与解),但在无数据同需求的 well-posed forward 问题上,传统网格求解器仍优于 PINNs。
- 代表证据定位:Merits of physics-informed learning 一节,特别是 4D-flow MRI(Fig. 3)与 espresso cup(Fig. 2)应用案例;Raissi et al. 2020(ref 106)的 hidden fluid mechanics。
- 共识程度:有限——PINNs 在逆问题上的优势有较多实证支持,但"forward 问题传统方法更优"这一判断基于经验观察而非系统性基准测试,且 2021 年后 PINNs 在 forward 问题上的表现已有所改善。
- 分歧或限制:作者承认缺乏标准化基准测试来公平比较 PINNs 与传统方法在不同问题类型上的性能(Data generation and benchmarks 一节明确指出这一点)。
主题 3:高维 PDE 求解与 operator regression¶
- 核心论点:DNN 可在目标函数为局部函数层级复合的条件下突破维数灾难,DeepONets 等 operator regression 方法可学习从输入函数到解的映射,从而处理高维参数化 PDE。
- 代表证据定位:文献 ref 13(Lu et al. 2021, DeepONets);文献 ref 142(Rotskoff & Vanden-Eijnden, 144 维 Allen–Cahn committor);Fig. 5
- 共识程度:有限——理论保证尚不完善,DNN 克服维数灾难的条件(hierarchical composition of local functions, refs 119, 120)是充分条件而非必要条件,实际应用中何时有效仍不清楚。
- 分歧或限制:高维 PDE 求解的收敛性分析仅限于特定 PDE 类型(Black–Scholes, HJB, Allen–Cahn),对一般非线性 PDE 缺乏理论保证。
关键图表、Box 与分类框架¶
- 定位:Box 1(data 与 physics 的三种情景)
- 内容:将物理问题按 data 多寡与 physics 已知程度划分为三类——small data + full physics(传统数值求解)、some data + some physics(PIML 核心舞台,可同时反演参数与解)、big data + no physics(纯数据驱动发现新物理)。
- 价值:提供了一个简洁的概念框架来定位 PIML 的适用范围,明确了"中间情景"是 PIML 最有价值的应用领域。该框架已被后续 PIML 文献广泛引用。
-
局限:三类情景的边界是定性的,缺乏对"data 量"和"physics 已知程度"的量化标准,难以据此判断某一具体问题应归入哪一类。
-
定位:Box 2(physics-informed learning 的三条路径)
- 内容:定义 observational bias(通过数据隐式施加)、inductive bias(通过网络结构硬编码对称性/守恒律)、learning bias(通过 loss 软惩罚)三种模式,并指出三者可组合。
- 价值:为 PIML 方法的设计与分类提供了清晰的 taxonomy,是理解后续方法选择的基础。
-
局限:三条路径的命名在文献中尚未完全统一,不同作者使用不同术语(如 "hard constraint" vs "inductive bias"),可能造成混淆。
-
定位:Box 3(PINNs 算法)
- 内容:以 viscous Burgers' equation 为例,展示 PINN 的网络结构(physics-uninformed 网络 + physics-informed 网络)、loss 函数(data loss + PDE residual loss,权重 w_data 和 w_PDE 平衡)、以及训练流程(Adam → L-BFGS,直到 loss < ε)。
- 价值:提供了 PINN 的最小可复现算法描述,是入门 PINNs 的标准参考。
-
局限:仅展示了单一 PDE 的标量解情况,对耦合 PDE 系统、多物理场、复杂几何域的情况未给出算法层面的细节。
-
定位:Table 1(PIML 软件库对比)
- 内容:列出 DeepXDE、SimNet、PyDEns、NeuroDiffEq、NeuralPDE、SciANN、ADCME、GPyTorch、Neural Tangents 等库的用途(solver vs wrapper)、语言与后端。
- 价值:为实践者选择工具提供了快速参考。
- 局限:未包含各库的功能覆盖范围对比(如是否支持 fractional PDE、多 GPU 并行、自适应采样等),且截至 2021 年,部分库已有重大更新。
共识、争议与研究空白¶
相对稳固的共识¶
PINNs 在逆问题和病态问题上具有独特优势:可在缺乏完整边界条件时利用 scattered noisy data 同时反演 PDE 参数与解(refs 106, 107),且 mesh-free 特性使处理不规则/移动域问题更加便利(ref 108)。这一判断在 espresso cup 流场反演(ref 140, 从温度梯度数据反演 3D 速度/压力场)和 4D-flow MRI 降噪(Fig. 3, 从噪声 MRI 重建物理一致的血流场)两个案例中得到充分验证。
尚存争议¶
PINNs 在 forward well-posed 问题上的竞争力。作者明确指出"for forward, well-posed problems that do not require any data assimilation the existing numerical grid-based solvers currently outperform PINNs",但这一判断基于 2021 年前的经验,且缺乏标准化基准测试支持。2021 年后多项工作(如 Fourier feature networks、adaptive sampling、domain decomposition)已部分缩小这一差距,争议尚未解决。
作者提出的研究空白¶
- 缺乏标准化基准测试与数据集来公平比较不同 PIML 方法(Data generation and benchmarks 一节明确提出)。
- 缺乏严格的收敛性理论——目前仅有线性椭圆/抛物型 PDE 的收敛分析(refs 188, 191),对一般非线性 PDE 的 approximation/optimization/generalization 误差分解尚不完整(New mathematics 一节)。
- 高阶导数的高效计算在主流框架(TensorFlow, PyTorch)中支持不足,需要 Taylor-mode automatic differentiation(refs 183, 184)。
我识别的遗漏¶
综述未讨论 PIML 在随机偏微分方程(SPDE)中 long-time integration 的误差增长控制——仅在不确定性量化一节提及 ref 42 的 bi-orthogonal modal decomposition 方法,但对长时间积分中误差的指数增长这一关键挑战缺乏深入讨论。这对生物力学 G&R 模型等需要长时模拟的应用场景影响显著。
个人批注¶
与我的工作的关系¶
作为计算生物力学研究者(FEniCS/FEM + 血管 G&R 模型),PIML 的 inverse problem 范式对血管 G&R 模型的参数标定有直接启发:传统 G&R 模型参数(如生长率、homeostatic 应力)依赖体外实验或文献值,精度有限;PINNs 可从 in vivo 医学影像数据(如 4D-flow MRI 的速度/压力场)直接反演材料参数与缺失的 constitutive 项,同时量化不确定性(B-PINNs)。4D-flow MRI 降噪案例(Fig. 3)展示了从噪声 MRI 数据重建物理一致血流场的可行性,但该案例假设血流为层流(Navier–Stokes),对存在狭窄/涡流/湍流的病变血管适用性存疑——作者也承认了这一限制。
可复用框架¶
Box 1 的三分类框架可直接用于定位血管 G&R 模型中的 PIML 应用场景:G&R 模型属于"some data + some physics"(已知守恒律但 constitutive 关系部分未知),适合用 PINNs 同时反演参数与解。Box 3 的 PINN 算法可作为实现起点,loss 函数中 w_data/w_PDE 权重平衡策略对 G&R 多目标优化有参考价值。Three-source uncertainty framework(physics/data/model uncertainty)可用于设计 G&R 模型的 UQ 流程。
疑问与后续动作¶
- 疑问:PINNs 的 spectral bias(高频函数学习困难)对血管壁应力梯度(stiffness 间断、boundary layer)的影响有多大?G&R 模型中应力集中区域是否需要 Fourier feature networks 或 domain decomposition 来缓解?
- 后续动作:精读 Wang et al. 2020(ref 76, "When and why PINNs fail to train")和 Raissi et al. 2020(ref 106, hidden fluid mechanics),评估 PINN inverse 在血管力学中的可行性边界;调研 2021 年后 PIML 在 soft tissue biomechanics 中的应用进展。
与上下文的关系¶
本文建立在¶
PINNs 的核心方法建立在 Raissi, Perdikaris & Karniadakis 2019(ref 7, J. Comput. Phys.)之上,该文首次系统提出 PINNs 框架。DeepONets 建立在 Lu et al. 2021(ref 13)的 universal approximation theorem of operators 之上。不确定性量化部分建立在 Xiu & Karniadakis 2002(ref 129, polynomial chaos)和 Stuart 2010(ref 131, Bayesian inverse problems)之上。多尺度建模视角与 Alber et al. 2019(ref 5, NPJ Digit. Med.)的 ML+多尺度建模综述相呼应。
已核实的后续引用¶
本次未检索
同类综述对比¶
本次未核实
与本地论文队列的关系¶
与本地 2019-ML-Multiscale-Alber 互补:Alber et al. 侧重 ML 在生物医学多尺度建模中的宏观角色定位,本文则提供 PIML 的技术细节与算法层面框架。4D-flow MRI 应用案例与 2019-Artificial-Intelligence-Cardiovascular-Siegersma 中 AI 心血管成像主题有交叉,但后者侧重临床影像诊断而非物理建模。
逐章节笔记(Section-by-Section Notes)¶
引言(Introduction)¶
段落 1:多物理多尺度系统建模的根本困难¶
- 核心论点:多物理场多尺度系统的建模与预测仍是一个未解决的科学问题,传统数值方法面临根本性挑战。
- 支撑论据:
- 以地球系统为例,其动力学涉及物理、化学、生物过程,跨越 17 个数量级的时空尺度
- 过去 50 年通过 finite differences、finite elements、spectral 和 meshless 方法求解 PDE 取得巨大进展
- 但非线性多尺度系统的不均匀级联使经典解析/计算工具面临严重挑战、高昂成本与多源不确定性
- 逆问题(如功能材料物性推断、反应输运中缺失物理的发现)通常计算成本极高,需要复杂公式、新算法和精细代码
- 最关键的是,通过传统方法求解具有缺失/稀疏/噪声边界条件的真实物理问题目前是不可能的
- 我的分析:这段以"不可能"一词设定了 PIML 的动机基调——传统方法存在硬边界。但"impossible"是强主张,实际上 data assimilation(如 ensemble Kalman filter)已部分解决噪声边界条件问题,作者此处有意凸显传统方法的局限以引出 ML 的必要性。17 个数量级的说法来自地球系统科学文献,但未在本文中进一步量化论证。
段落 2:观测数据的关键角色与数据同化瓶颈¶
- 核心论点:观测数据在多尺度系统建模中扮演关键角色,但现有数据同化方法无法充分利用多保真度数据的丰富性和时空异质性。
- 支撑论据:
- 未来十年将有超过万亿个传感器(airborne、seaborne、satellite remote sensing),提供丰富的多保真度观测
- 尽管数据的体量、速度和多样性,在许多实际情况中仍无法将多保真度数据无缝整合到现有物理模型中
- 数学和实践层面的数据同化工作蓬勃发展,但数据的丰富性与时空异质性以及缺乏普遍可接受的模型,凸显了对变革性方法的需求
- 我的分析:这段从"数据爆炸"到"同化瓶颈"的论证链条清晰,但"万亿传感器"的预测可能过于乐观(2019 年前的估计)。关键是提出了"缺乏普遍可接受的模型"这一深层问题——这不仅仅是技术问题,而是模型选择本身的不确定性,为后续 PIML"部分已知物理"的中间情景做了铺垫。
段落 3:ML 的能力与局限——需要物理嵌入¶
- 核心论点:ML 能够探索大规模设计空间、识别多维相关性和处理病态问题,但纯数据驱动模型的外推预测可能物理不一致,因此需要将物理定律嵌入 ML 作为 informative priors。
- 支撑论据:
- ML 可帮助检测气候极端或统计预测降水/植被生产力等动态变量
- 深度学习能自动从海量多保真度观测数据中提取特征,并将其与现有近似模型关联以构建新预测工具
- 生物物理和生物医学建模中 ML 工具与多尺度/多物理模型的协同整合已被倡导
- 但纯数据驱动模型虽能很好地拟合观测,预测可能因外推或观测偏差而物理不一致或不合理,导致泛化性能差
- 因此需要通过"教授"ML 模型物理规则来提供 informative priors——即在观测偏差之上的强理论约束和 inductive biases
- 我的分析:这段是全文的核心论证转折点——从"ML 有用"到"纯 ML 不够"到"需要物理嵌入"。informative priors 的概念借自贝叶斯统计,巧妙地将物理定律重新表述为 ML 的先验知识。外推/泛化性能差的论断有充分文献支持(refs 4, 6),但"物理不一致"的具体含义(是违反守恒律?还是量纲不一致?还是对称性破坏?)此处未细化,在后续 How to embed physics 一节中才逐步展开。
段落 4:Physics-informed learning 的定义与 PINNs 引入¶
- 核心论点:Physics-informed learning 定义为利用来自观测、经验、物理或数学理解的先验知识来提升学习算法性能的过程,PINNs 是其代表实现。
- 支撑论据:
- physics-informed learning 被正式定义为"利用来自观测、经验、物理或数学理解的先验知识来提升学习算法性能的过程"
- PINNs 是一类能无缝整合数据与抽象数学算子(包括有/无缺失物理的 PDEs)的深度学习算法
- 其核心动机是:先验知识/约束可产生更可解释的 ML 方法,在不完美数据(缺失/噪声值、异常值)面前保持稳健,并能对外推/泛化任务提供准确且物理一致的预测
- 我的分析:这段给出了 PIML 的正式定义,但定义相当宽泛——"观测、经验、物理或数学理解"几乎涵盖所有先验知识类型。这种宽泛性使 PIML 的边界模糊(例如,数据增强是否算 PIML?)。PINNs 作为"代表实现"被引入,但综述后续表明 PIML 还包括 kernel methods、DeepONets、equivariant networks 等不完全基于 PINN 的方法。定义的宽泛性既是优势(涵盖面广)也是弱点(缺乏精确边界)。
段落 5:Box 1——数据与物理的三种情景¶
- 核心论点:物理问题按 data 多寡与 physics 已知程度可分为三类,中间情景(some data + some physics)是 PIML 的核心应用领域。
- 支撑论据:
- 左侧(small data + full physics):仅知边界/初始条件和 PDE 参数,传统数值求解的领域
- 右侧(big data + no physics):有大量时序数据但不知道 governing PDE,纯数据驱动方法(如 operator regression)可能最有效
- 中间(some data + some physics):物理部分已知(知道守恒律但不知道 constitutive 关系),有若干 scattered measurements 可用于推断参数甚至 PDE 中缺失的泛函项,同时恢复解——这是最普遍、最有趣的类别
- 中间类别是其他两类的代表:当测量太少或太多时退化为左右两种情形
- 中间情景可能导致更复杂的场景——PDE 解是随机过程(随机激励或不确定物性),需用 stochastic PDEs 表示
- 长程时空相互作用(湍流、黏弹塑性材料、反常输运)可能需要 non-local/fractional calculus 和 fractional PDEs
- 我的分析:这段的三分类框架是全文最有影响力的概念贡献之一。中间情景的定位——"知道守恒律但不知道 constitutive 关系"——精准对应了血管 G&R 建模的核心困境(知道质量/动量守恒但 G&R 法则不确定)。但三类的边界完全定性,"some data"与"big data"之间缺乏量化标准。引入 stochastic PDEs 和 fractional PDEs 的过渡略显突兀——从确定性中间情景跳到随机/非局部情景,逻辑跳跃较大,但为后续 fPINNs(ref 103)和 SPDE 求解(refs 42, 102)做了铺垫。
段落 6:不确定性量化的历史负担与 PIML 的克服路径¶
- 核心论点:过去二十年的 UQ 努力导致高度参数化的公式(数百个不确定参数),使计算在实践中不可行;PIML 可通过无缝整合数据与数学模型来克服这些问题。
- 支撑论据:
- 国家实验室和开源程序(OpenFOAM、LAMMPS)有超过 10 万行代码,维护和更新几乎不可能
- PIML 可无缝整合数据与数学模型,通过 PINNs 或其他非线性回归物理信息网络(PINs)实现
- 我的分析:这段从代码维护和 UQ 参数爆炸两个实践痛点论证 PIML 的必要性,论证较为简短。"10 万行代码"的数字来自 OpenFOAM/LAMMPS 的实际规模,但将其与 PIML 的简洁性对比有些不公平——PIML 库(如 DeepXDE)之所以简洁,是因为它们将复杂性转嫁到了底层框架(TensorFlow/PyTorch)上,而非真正消除了复杂性。
段落 7:综述路线图¶
- 核心论点:综述将依次讨论物理嵌入方法、新能力与应用,并在结尾提供展望。
- 支撑论据:
- 首先描述如何将物理嵌入 ML 以及不同物理如何指导新网络架构设计
- 然后展示 PIML 的新能力并突出相关应用
- 最后提供展望,包括当前局限
- 已有方法分类可在 ref 12 中找到
- 我的分析:标准的综述路线图段落,明确界定了覆盖范围。将分类方法指向 ref 12 表明本文不追求穷尽性列举,而是聚焦核心概念与代表性应用。
How to embed physics in ML¶
段落 1:三条嵌入路径的总览¶
- 核心论点:没有假设就无法构建预测模型,没有适当偏差就无法期望 ML 的泛化性能;物理嵌入目前有三条路径,可分别或联合使用。
- 支撑论据:
- 无预测模型可在无假设下构建,因此无 ML 泛化性能可在无适当 bias 下获得
- 三条路径:observational biases、inductive biases、learning biases
- 三者可分别或联合使用以加速训练和增强泛化
- 我的分析:这段将 "no free lunch" 定理与 PIML 联系起来——物理知识作为一种 inductive bias 来约束假设空间。三条路径的划分在 Box 2 中正式展开,此处仅作引入。值得注意的是,"bias"一词在 ML 中通常带有负面含义(偏差=误差),但此处重新定义为"有益的先验约束",体现了物理学与统计学习对 bias 概念的不同理解。
段落 2:Observational biases——数据作为弱物理约束¶
- 核心论点:观测数据是 ML 成功的基础,也是概念上最简单的物理嵌入模式,但需要大量数据来强化物理偏差且数据获取成本高昂。
- 支撑论据:
- 给定足够覆盖输入域的数据,ML 方法在高维任务的插值上表现出色
- 传感器网络的发展使跨多尺度监测复杂现象成为可能
- 观测数据应反映底层的物理原理,可作为在训练阶段将这些原理嵌入 ML 模型的弱机制
- 但对于过参数化的深度学习模型,通常需要大量数据来强化这些偏差并生成尊重对称性和守恒律的预测
- 数据获取成本对物理和工程科学中的许多应用可能过高(昂贵实验或大规模计算模型)
- 我的分析:这段定位 observational bias 为"弱"约束——数据隐含物理但无法显式强制。核心矛盾是:物理系统数据通常稀缺(实验昂贵),而深度学习需要大量数据,这使纯 observational bias 在科学 ML 中往往不足。这一矛盾正是 inductive bias 和 learning bias 存在的理由。论证逻辑清晰,但对"弱机制"的定义不够明确——是指约束力度弱还是物理信息含量弱?
段落 3:Inductive biases——网络结构硬编码物理约束¶
- 核心论点:Inductive bias 通过设计专门的网络架构来隐式嵌入先验知识,使预测严格满足给定物理约束,但局限于简单且预知的对称群。
- 支撑论据:
- 最著名的例子是卷积神经网络(CNN),通过巧妙尊重自然图像中的不变性和分布式模式表示革命了计算机视觉
- 其他代表包括图神经网络(GNNs)、equivariant networks、Gaussian processes 等 kernel methods
- 卷积网络可推广到更多对称群(旋转、反射、gauge symmetry),在流形上开发只依赖内禀几何的网络——应用于医学影像、气候模式分割等
- wavelet-based scattering transforms 可构建平移不变表示
- covariant NNs 适配多体系统中的旋转和平移不变性
- equivariant transformer networks 改善预定义连续变换群的模型稳健性
- 但这些方法目前局限于相对简单且明确定义的物理或对称群的任务,且扩展到更复杂任务具有挑战性
- 我的分析:这段系统列举了 inductive bias 的代表性架构,从 CNN 到 equivariant transformers,覆盖面广但深度有限。关键限制——"局限于简单对称群"——是 inductive bias 路径的根本瓶颈:对于血管 G&R 这类非对称、非守恒(有质量源/汇)的复杂生物系统,很难设计显式编码所有物理约束的网络结构。FermiNet(后续 quantum chemistry 应用中详述)是 inductive + learning bias 混合的典型案例,但此处仅作为架构层面提及。
段落 4:Inductive bias 的更多实例——边界条件编码与 HJ-PDE 架构¶
- 核心论点:神经网络架构可被修改以精确满足各类边界条件,且特定 PDE 的解可被直接编码进网络结构而无需数值近似。
- 支撑论据:
- NN 架构可修改以精确满足初始条件、Dirichlet/Neumann/Robin/周期/界面边界条件
- 若 PDE 解的某些特征已知,也可编码进架构(多尺度特征、奇偶对称性、能量守恒、高频特征等)
- ref 48 提出 NN 架构与 Hamilton–Jacobi PDE viscosity 解的新连接:两层架构 f(x,t) = min_i{tL(x−u_i/t) + a_i} 类似 Lax–Oleinik 公式
- 该架构的 Hamiltonian H 和初始数据 J 可由网络参数和激活函数显式获得
- ref 48 的结果不依赖 NN 的通用近似定理,而是表明特定 HJ-PDE 类的物理可被特定 NN 架构自然编码
- 我的分析:HJ-PDE 架构是 inductive bias 的极端形式——物理直接决定了网络结构。这种"物理即架构"的范式在理论上优雅,但实用性受限:仅适用于 Hamiltonian 凸的 HJ-PDE,且需要知道 Hamiltonian 的具体形式。对一般的非线性 PDE(如 Navier–Stokes with G&R source terms),无法直接构造这样的架构。这段的价值在于展示了 inductive bias 的理论上界——当物理完全已知时,网络可无需任何训练即精确表示解。
段落 5:Learning bias——软惩罚约束施加物理¶
- 核心论点:Learning bias 通过 loss 函数中的软惩罚约束来施加物理约束,灵活性强但只能近似满足物理定律。
- 支撑论据:
- 不设计专门架构,而是通过适当惩罚常规 NN 近似的 loss 函数来施加约束——可视为多任务学习的特例
- 学习算法同时被约束拟合观测数据并产生近似满足物理约束的预测(质量守恒、动量守恒、单调性等)
- 代表性方法包括 deep Galerkin method 和 PINNs 及其变体
- 软惩罚约束的灵活性允许将更一般的领域特定知识纳入 ML 模型
- ref 53 提出统计约束 GAN,通过强制训练数据的协方差约束改进 ML 模拟器
- 其他例子包括学习接触引起的不连续性(robotics)、physics-informed auto-encoders(Lyapunov 稳定性)、InvNet(编码不变性)
- 扩展包括卷积和循环架构以及概率公式——如 ref 52 的贝叶斯框架允许不确定性量化
- 我的分析:这段将 learning bias 定位为"灵活但近似"——与 inductive bias 的"严格但局限"形成对比。PINNs 作为 learning bias 的代表方法在 Box 3 中详细展开。关键洞察是软惩罚等价于贝叶斯公式中基于物理似然假设的 MAP 估计——这为 B-PINNs(后续 UQ 一节详述)提供了理论基础。但"多任务学习"的类比有一个微妙之处:在标准多任务学习中各任务的 loss 通常是独立的,而 PINN 中 data loss 和 PDE loss 共享同一组网络参数,竞争更直接,这正是后续"梯度病理"问题的根源。
段落 6:Learning bias 的贝叶斯解释¶
- 核心论点:软惩罚约束的优化解等价于基于物理似然假设的贝叶斯 MAP 估计,完全贝叶斯处理可量化噪声和稀疏数据引起的不确定性。
- 支撑论据:
- 软惩罚约束优化的解可视为贝叶斯公式中基于物理似然假设的 MAP 估计
- 完全贝叶斯处理可使用 MCMC 或变分推断来量化噪声和稀疏数据引起的不确定性
- 我的分析:这段虽短但对 PIML 的理论基础至关重要——它将 PINN 的 loss 函数与贝叶斯推断联系起来,使物理约束获得了概率解释。这一联系使 B-PINNs 成为可能,并使 PIML 可与经典贝叶斯逆问题理论(如 Stuart 2010, ref 131)对接。但对"先验如何系统设置"这一关键问题留待后续(作者在 UQ 一节承认 B-PINN 的先验设置仍是开放问题)。
段落 7:Hybrid approaches——三种路径的组合¶
- 核心论点:三种物理嵌入路径各有优劣,组合使用可发挥协同效应,代表性组合包括 DeepONets+PINNs 和多保真度策略。
- 支撑论据:
- 非量纲化可恢复系统特性,通过 Reynolds/Froude/Mach 数等参数引入物理偏差
- DeepONets 已被证明是学习非线性算子的强大工具,与 PINNs 结合可实现实时精确预测与外推(电对流、高超音速)
- 多保真度策略:低保真度模型通过数据增强(大量低保真度数据)促进复杂系统学习
- ref 63 结合 observational 和 learning bias:大涡模拟数据 + 约束 NN 训练构建湍流闭合
- 其他用例:多保真度 NN 提取材料性质(ref 64, 仪器压痕数据)、PINs 发现非牛顿流体本构律(ref 65)、粗粒化策略(ref 66)
- FermiNets 和 graph neural operator methods 也是混合方法
- 可将 NN 嵌入传统数值方法(如有限元)——应用于非线性动力学、计算力学(本构关系)、地下力学、随机反演等
- 我的分析:这段展示了 PIML 的实际应用多以 hybrid 形式出现——纯 PINN 或纯 inductive bias 较少单独使用。对血管 G&R 建模的启示是:可将 FEM(低保真度,已知守恒律)与 PINN(高保真度,从 MRI 数据反演参数)结合为多保真度框架。ref 64 的多保真度框架(将压痕实验的屈服应力推断误差从 >100% 降至 <5%)是材料参数标定的有力先例。但 hybrid 方法的复杂性——需要设计低保真/高保真模型的耦合方式——增加了实现门槛。
段落 8:Connections to kernel methods——NN 与核方法的渐近联系¶
- 核心论点:许多 NN 技术与 kernel methods 有渐近联系,可通过 kernel 视角理解 PINN 训练动态,并利用 kernel methods 的可解释性和理论基础来理解深度学习的成败。
- 支撑论据:
- PINN 的训练动态在网络宽度趋于无穷时可理解为 kernel regression(refs 76, 77)
- NN 方法可严格解释为 kernel methods,其中底层 warping kernel 也从数据中学习
- PINNs 可视为在由 feature map(由网络初始层参数化)张成的 reproducing kernel Hilbert space 中求解 PDE
- 统计推断与数值近似之间存在紧密联系——PDE 求解、逆问题、optimal recovery、贝叶斯数值分析
- attention-based transformers 也可建立与 kernel methods 的联系
- kernel methods 通常可解释且有强理论基础,可帮助理解深度学习何时失败或成功
- 我的分析:这段是全文理论性最强的一节,将 PIML 置于更广阔的数学框架中。Neural tangent kernel(NTK)理论(ref 198)是理解 PINN 训练的关键工具——后续 Wang et al.(refs 76, 77, 173)正是通过 NTK 视角识别了 PINN 的 spectral bias 和梯度病理。但对非 ML 理论背景的读者(如生物力学研究者),这节的实用价值有限——它更多是为理论分析者提供视角,而非直接指导实践。
段落 9:Connections to classical numerical methods——NN 与经典数值算法的类比¶
- 核心论点:现代深度学习模型与经典数值算法存在对应关系,这些类比可启发新的"数学信息"元学习架构。
- 支撑论据:
- 卷积 NN 类比有限差分 stencil(平移等变 PDE 离散化)和 multigrid 方法
- 残差网络(ResNets)类比自治 ODE 的前向 Euler 离散
- Runge–Kutta 方案与循环 NN 架构(甚至 Krylov 型无矩阵线性代数方法)类比
- ReLU 激活函数的 DNN 表示等价于线性有限元方法的连续分段线性函数
- ref 7 提出受隐式 Runge–Kutta 积分器启发的离散时间 NN 方法:使用多达 500 个隐式阶段,允许大时间步长
- 我的分析:这段的 NN-数值方法类比对计算力学背景的读者特别有吸引力——它将陌生的深度学习概念映射到熟悉的 FEM/ODE 积分器语言。ReLU↔线性有限元的等价性尤其深刻:它意味着 FEM 的 piecewise linear 基函数可被 DNN 表示,为 PINN 替代 FEM 求解提供了理论合理性。但类比不等于等价——NN 的参数是通过优化学习的而非装配的,收敛性和稳定性保证因此不同。受 Runge–Kutta 启发的 500 阶段 NN 方法是一个令人印象深刻的案例,但其实际效率与经典 RK4 的对比未在此处给出。
Merits of physics-informed learning¶
段落 1:PINNs 在逆问题上的整体优势¶
- 核心论点:PINNs 在求解病态和逆问题上特别有效,但在无数据同需求的 forward well-posed 问题上传统数值求解器仍优于 PINNs。
- 支撑论据:
- PINNs 的扩展覆盖守恒律、随机 PDE 和分数阶 PDE
- 域分解与 PINNs 结合提供多尺度问题的灵活性,且因每个子域可用不同 NN、不同 GPU 而易于并行
- 集体结果表明 PINNs 在病态和逆问题上特别有效
- 对不需要数据同化的 forward well-posed 问题,现有数值网格求解器目前优于 PINNs
- 我的分析:这段是全文关于 PINNs 适用范围的核心判断。"forward 问题传统方法更优"这一结论基于 2021 年前的经验,且作者以"currently"限定,暗示这一差距可能随时间缩小。对血管 G&R 的启示是:若仅需求 forward 求解(已知全部参数和边界条件),FEniCS 仍是首选;但若需要从 MRI 数据反演参数(inverse),PINNs 具有独特优势。域分解的并行性对 3D 血管模型有实际意义。
段落 2:Incomplete models and imperfect data——不完美模型与数据下的求解¶
- 核心论点:Physics-informed learning 能在模型和数据均不完美时找到有意义的解,这是传统数值方法可能失败的场景。
- 支撑论据:
- ref 106 证明即使因 PINN 公式的平滑性/正则性使问题非完全 well-posed,仍可找到有意义的解
- 示例包括无初始/边界条件或部分 PDE 参数未知的 forward 和 inverse 问题——传统数值方法可能失败的场景
- 处理不完美模型和数据时,将贝叶斯方法与 PIML 结合用于不确定性量化是有益的(如 B-PINNs, ref 107)
- 相比传统数值方法,PIML 是 mesh-free 的,无需计算昂贵的网格生成,可轻松处理不规则和移动域问题
- 代码也更易实现,利用 TensorFlow/PyTorch 等开源深度学习框架
- 我的分析:这段列举的 PIML 优势——mesh-free、处理不完整边界条件、贝叶斯 UQ——对血管力学有直接价值:血管几何随心动周期变化(移动域),MRI 数据噪声大且稀疏(不完美数据),constitutive 参数不确定(不完美模型)。但"代码更易实现"的主张需要 qualifier:虽然 DeepXDE 确实简洁,但实现复杂多物理场(如 FSI + G&R)的 PINN 仍需要相当的工程努力。
段落 3:Strong generalization in small data regime——小数据下的强泛化¶
- 核心论点:通过嵌入物理约束,深度学习模型被有效约束在低维流形上,从而可用少量数据训练,且 PIML 具备外推(而非仅插值)能力。
- 支撑论据:
- 深度学习通常需要大量数据训练,但物理问题中高精度数据难以获取
- 通过嵌入物理,深度学习模型被有效约束在低维流形上,可用少量数据训练
- 嵌入物理的三种方式:网络架构、软惩罚约束、数据增强
- PIML 能够外推——不仅插值:可在边值问题中进行空间外推(ref 107)
- 我的分析:"低维流形约束"是 PIML 小数据优势的几何直觉——物理定律将解空间从所有可能函数缩减到满足 PDE 的子流形。但这一直觉缺乏严格量化:约束的"强度"取决于 PDE 的类型和 loss 权重,且"低维"是相对于什么基准?外推能力的主张来自 B-PINNs(ref 107),但外推范围受物理模型有效域的限制——PIML 的外推本质上是"物理模型允许的外推",而非无约束外推。
段落 4:Understanding deep learning——物理洞察深度学习¶
- 核心论点:物理原理不仅增强 ML 模型的训练和泛化,还为理解深度学习本身提供了理论工具。
- 支撑论据:
- refs 109–112 用颗粒介质的 jamming transition 理解深度学习的 double-descent 现象
- 浅层 NN 可视为 interacting particle systems,用 mean-field theory 在概率测度空间而非高维参数空间分析(ref 113)
- ref 114 严格构造了从 variational renormalization group 到基于 restricted Boltzmann machines 的深度学习架构的精确映射
- ref 115 将量子启发的 tensor networks 应用于多类监督学习
- ref 116 从统计物理视角研究深度网络的 loss landscape,建立 NN 与 spin-glass 模型的直觉联系
- ref 117, 118 基于动力系统理论研究宽 DNN 中的信息传播,识别"edge of chaos"确保信息传播
- 我的分析:这段展示了一个反向受益方向——不仅物理帮助 ML,ML 也帮助物理学者理解深度学习。对实践者的直接价值有限,但 double-descent → jamming transition 的映射、NN → spin-glass 的类比提供了概念工具来理解为何过参数化网络不会过拟合(这在 PINN 语境下意味着增加网络宽度不一定导致 PDE 解的过拟合)。mean-field 视角(ref 113)对分析 PINN 的训练动态有潜在价值。
段落 5:Tackling high dimensionality——高维问题求解¶
- 核心论点:DNN 能在目标函数为局部函数层级复合的条件下突破维数灾难,已成功应用于高维 PDE 求解。
- 支撑论据:
- DNN 成功解决高维问题(图像分类、语言建模、高维 PDE)
- 突破维数灾难的条件:目标函数是局部函数的层级复合(refs 119, 120)
- ref 121 将一般高维抛物型 PDE 用 backward SDE 重述,用 DNN 近似解的梯度
- 实践中应用于高维 Black–Scholes、Hamilton–Jacobi–Bellman 和 Allen–Cahn 方程
- GANs 在从高维分布生成样本方面相当成功(图像/文本生成)
- physics-informed GANs 用于量化高维随机微分方程的参数不确定性(ref 102)
- DeepONets 可应对与输入空间相关的维数灾难(refs 127, 128)
- 我的分析:这段的关键限定——"hierarchical composition of local functions"——是 DNN 克服维数灾难的充分条件,但对血管 G&R 这类全局耦合系统是否满足此条件尚不清楚。Black–Scholes 等金融 PDE 和 Allen–Cahn 等物理 PDE 的高维求解有实际意义,但这些 PDE 的结构相对简单(系数已知),与 G&R 这类参数不确定的非线性 PDE 有本质区别。GANs 用于高维不确定性量化的思路(ref 102)对 SPDE 参数推断有参考价值。
段落 6:Uncertainty quantification——三类不确定性来源¶
- 核心论点:PIML 的不确定性量化需考虑三类来源——物理不确定性(随机 PDE)、数据不确定性(aleatoric + epistemic)、模型不确定性(NN 近似/训练/泛化误差)。
- 支撑论据:
- 第一类:随机物理系统,由 SPDE/SODE 描述,包括参数随机性——NN 作为投影函数恢复低维非线性流形(ref 132)、physics-informed loss 训练参数化解(ref 133)、conditional convolutional generative model 预测密度(ref 51)
- 第二类:数据噪声引起的 aleatoric uncertainty 和数据缺口引起的 epistemic uncertainty——高斯过程回归可自然量化不确定性并用于 active learning(refs 23, 135, 136);B-PINNs 提供合理的不确定性边界,但先验系统设置仍是开放问题(ref 107)
- 第三类:学习模型的局限——NN 的近似、训练和泛化误差,难以严格量化;卷积 encoder–decoder NN 映射 PDE 源项/几何到解及不确定性(ref 137);dropout + arbitrary polynomial chaos 量化组合不确定性(ref 138);bi-orthogonal modal decomposition 处理长时间积分(ref 42)
- 我的分析:这段的三分类框架对设计 G&R 模型的 UQ 流程有直接指导价值:物理不确定性对应 G&R 参数的随机性(可用 SPDE 描述),数据不确定性对应 MRI 测量噪声与稀疏采样,模型不确定性对应 NN 架构选择与训练误差。B-PINNs 的先验设置问题对 G&R 尤为突出——G&R 参数的先验分布通常来自少量实验,难以系统设定。第三类不确定性(模型误差)的量化最为困难,dropout 方法(ref 138)虽简单但理论基础争议较大。长时间积分的误差控制(ref 42 的 modal decomposition)对 G&R 的长时模拟(模拟数年血管重塑)至关重要。
Applications highlights¶
段落 1:Flow over an espresso cup——hidden fluid mechanics¶
- 核心论点:PINNs 可从温度梯度视频数据反演三维速度和压力场,无需任何边界条件——这是传统方法无法处理的 ill-posed inverse 问题。
- 支撑论据:
- 输入数据为 espresso 杯上方温度梯度的视频(Tomo-BOS 成像系统)
- 这是 hidden fluid mechanics(ref 106)的示例——ill-posed inverse problem,无边界条件或其他信息
- PINN 以时空坐标为输入,推断速度和压力场,通过最小化包含温度数据失配和守恒律(质量、动量、能量)残差的 loss 训练
- 物理假设为 Boussinesq approximation(密度变化相对小时有效)
- 独立 PIV 实验证实 Tomo-BOS/PINN 方法可提供连续、高分辨率、准确的 3D 流场
- 我的分析:这个案例是 PIML inverse 能力的标杆演示——从纯观测数据(温度场)反推不可观测量(速度/压力场),物理定律充当正则化。PIV 实验的独立验证增强了结果可信度。但对血管力学的直接迁移需注意:espresso 杯流是低速自然对流(Boussinesq 近似有效),而血管流是脉动流(Womersley 数高),且血管壁是弹性边界(FSI),物理假设不同。案例的核心启示不是具体方法迁移,而是"从可观测量反演不可观测量"这一范式可行性。
段落 2:4D-flow MRI physics-informed filtering——生物医学成像应用¶
- 核心论点:PINNs 可用 Navier–Stokes 方程约束对 4D-flow MRI 数据进行降噪和物理一致重建,同时推断壁面剪应力等重要生物标志物。
- 支撑论据:
- MRI 非侵入性且提供多种结构/生理对比,已成为定量评估血流的不可或缺工具
- 但 MRI 测量常受限于极粗的分辨率且可能被噪声严重破坏
- DNN 被 Navier–Stokes 方程约束以降噪 MRI 数据,产生物理一致的速度/压力场重建,确保任意高时空分辨率下的质量/动量守恒
- 滤波速度场可用于识别无滑移区域,重建动脉壁位置和运动,推断壁面剪应力、动能和耗散等量
- 但在高信噪比 MRI 测量和复杂流模式(边界层、高涡量区域、狭窄后湍流突发、弯曲分支血管等)下存在潜在稳健性问题
- 生理条件下血流为层流,PINN 模型通常仍有效
- 我的分析:这个案例与血管 G&R 直接相关——壁面剪应力(WSS)是 G&R 模型的关键输入量,从噪声 MRI 重建 WSS 的能力对 G&R 参数标定有直接价值。但作者坦承的局限(狭窄后湍流、弯曲分支血管)恰恰是动脉粥样硬化好发部位——这些正是 G&R 模型最需要准确 WSS 的区域。"层流假设下 PINN 有效"这一限定意味着 PIML 在病理血管(狭窄、动脉瘤)中的应用需要额外处理。这个案例最适合的迁移场景是健康主动脉的 WSS 重建与 G&R 参数反演。
段落 3:Edge plasma dynamics——等离子体物理应用¶
- 核心论点:PINNs 可从合成等离子体的部分观测(电子密度和温度)准确学习与双流体理论一致的湍流场动力学。
- 支撑论据:
- 预测磁约束聚变装置边缘的湍流输运是跨越数十年的长期目标,目前在聚变电站的粒子和能量约束上存在显著不确定性
- PINNs 可从单一测试放电的 2D 合成测量(电子密度和温度)准确重建未知的湍流电场和电势
- 仅需电子密度和温度的部分观测即可推断完整的三维碰撞等离子体动力学
- 我的分析:这个案例展示了 PINN 从部分观测反演完整动力学的能力——与 hidden fluid mechanics 类似但物理更复杂(双流体理论)。对生物力学的间接启示是:若可观测的生理量(如血流速度)与不可观测的量(如壁面应力、材料参数)通过物理方程耦合,PINN 有可能从前者反演后者。但等离子体案例使用的是合成数据(synthetic plasma),真实实验验证尚未完成。
段落 4:Metastable state transitions——高维 committor function¶
- 核心论点:Physics-informed learning 可通过将 NN 表示 committor function 并用变分公式作为 loss 来研究高维概率分布的亚稳态间转变。
- 支撑论据:
- NN 表示 committor function,训练使用 committor 函数的变分公式作为 physics-informed loss,结合边界条件软惩罚
- 自适应重要性采样用于采样主导 loss 的稀有事件,降低解的渐近方差并改善泛化
- 144 维 Allen–Cahn 类型系统的结果展示了该方法对高维问题的有效性
- 但应用于更复杂系统和 NN 架构对给定系统的适配仍具挑战
- 我的分析:这个案例的技术含量最高——committor function 的变分公式作为 loss 是一个非标准的 PIML 应用(不是直接求解 PDE,而是优化一个变分泛函)。144 维的成功令人印象深刻,但 Allen–Cahn 系统的特殊结构(有已知势能函数)可能是关键。对 G&R 的间接启示是:若将血管重塑的"健康→疾病"转变视为亚稳态间跃迁,committor function 方法可能用于量化转变概率——但这需要 G&R 动力学的随机表述,目前仍是探索性想法。
段落 5:Thermodynamically consistent PINNs——cvPINNs¶
- 核心论点:控制体积 PINN(cvPINN)将传统有限体积格式推广到深度学习设置,可通过恢复熵解来保证热力学一致性。
- 支撑论据:
- 物理正则化在 PINNs 中可解释为使用 NN 基的点评估最小二乘残差
- 对含激波的双曲问题,解的点评估是病态的,需要降低正则性要求的替代物理稳定
- cvPINN 推广有限体积格式到深度学习,可适应 TVD limiters 和恢复熵解
- 该框架允许估计冲击流体动力学模型的黑箱状态方程(适用于金属等材料)
- DNN 提供处理未知模型形式的理想手段,而 cvPINN 的有限体积结构保证热力学一致性
- 我的分析:cvPINNs 对含激波/不连续的问题至关重要——标准 PINNs 在不连续处因点评估病态而失败。对血管 G&R 的直接价值有限(G&R 解通常连续),但如果考虑血管狭窄处的冲击波(如超声冲击波)或相变(如血栓形成),cvPINNs 的热力学一致性保证可能有价值。
段落 6:Quantum chemistry——FermiNet¶
- 核心论点:FermiNet 通过混合 inductive bias(反对称架构)和 learning bias(变分能量 loss)实现了多电子 Schrödinger 方程的 ab initio 求解。
- 支撑论据:
- FermiNet 有专门架构服从 Fermi–Dirac 统计(输入电子状态交换下反对称)和边界条件(无穷远处衰减)
- 训练也是 physics-informed:loss 设为能量期望值的变分形式,梯度由 Monte Carlo 估计
- 消除了量子化学中常见的基组外推误差源
- 但性能取决于架构、优化算法等多种因素,需进一步系统研究
- 我的分析:FermiNet 是 inductive + learning bias 混合方法的标杆案例——架构层面强制反对称性(硬约束),loss 层面施加变分原理(软约束)。这种"分层约束"策略对 G&R 有参考价值:可在架构层面编码守恒律(如质量守恒),在 loss 层面施加 G&R 法则。但 FermiNet 的计算成本极高(需要大量 Monte Carlo 采样),实际可扩展性仍是问题。
段落 7:Material sciences——材料无损检测与多保真度¶
- 核心论点:PIML 可通过逆问题求解识别材料表面裂纹,并通过多保真度框架从仪器压痕数据提取力学性质。
- 支撑论据:
- ref 144:优化 PINN 识别金属板表面裂纹,5 MHz 超声表面波数据 + 声波方程,未知波速函数用 NN 表示,自适应激活函数加速收敛
- ref 64:多保真度框架从 3D 打印材料的仪器压痕数据提取力学性质——低保真 ResNet(大量有限元仿真数据)+ 高保真 ResNet(稀疏实验数据),发现低/高保真数据间的非线性相关函数
- 多保真度框架将屈服应力推断误差从 >100% 降至 <5%
- 我的分析:ref 64 的多保真度框架对血管 G&R 参数标定有最直接的迁移价值——可将 FEniCS 仿真(低保真度,大量)与 MRI 数据(高保真度,稀疏)结合,通过 NN 学习两者间的非线性映射。屈服应力误差从 >100% 降至 <5% 的结果令人鼓舞,但需注意该案例的材料(3D 打印钛/镍合金)与血管组织的力学行为有本质区别(弹性 vs 黏弹性)。
段落 8:Molecular simulations——DeePMD¶
- 核心论点:DeePMD 用 NN 替代人工设计的势能函数,实现 ab initio 精度的分子动力学模拟,规模可扩展至 1 亿原子。
- 支撑论据:
- ref 145 提出保持平移/旋转/置换对称性的 NN 架构表示势能面
- DeePMD(ref 146)用 ab initio 仿真数据训练 NN,以随系统规模线性增长的成本达到 ab initio 精度
- ref 147 将分子动力学模拟极限推至 1 亿原子、1 ns 轨迹(Summit 超算),此前 ab initio 精度仅限 100 万原子
- 我的分析:DeePMD 展示了 PIML 的规模化能力——从理论到工程实现。对称性保持是 inductive bias 的典型应用。对生物力学的间接启示是:若可获取大量 G&R 仿真数据(不同参数组合下的 FEniCS 解),可训练一个 NN 替代模型(surrogate)来加速参数扫描和不确定性传播——但这是 operator regression(DeepONet 范畴)而非传统 PINN。
段落 9:Geophysics——地球物理逆问题¶
- 核心论点:PIML 已应用于多种地球物理逆问题,包括地震反演、速度估计和断层成像。
- 支撑论据:
- ref 71:耦合 NN 与全波形反演、地下流过程和岩石物理模型估计渗透率/孔隙率
- ref 149:结合 DNN 和数值 PDE 求解器解决地震反演问题——速度估计、断层破裂成像、地震定位、源时间函数检索
- 我的分析:地球物理应用与生物力学有结构相似性——都涉及从地表/表面观测反演地下/内部结构。但地球物理的尺度(km 级)与血管(cm 级)差异巨大,且地球物理的 PDE(波动方程)比 G&R 方程更标准化。这些案例的方法论价值大于直接迁移价值。
Software¶
段落 1:PIML 软件库总览¶
- 核心论点:多个专为 PIML 设计的软件库已被开发并推动领域快速发展,可分为 solver 和 wrapper 两类。
- 支撑论据:
- 基于 TensorFlow、PyTorch、Keras、JAX 等 ML 库构建
- 专门库包括 DeepXDE、SimNet、PyDEns、NeuroDiffEq、NeuralPDE、SciANN、ADCME(Table 1)
- Python 是 ML 主导语言,大部分库为 Python(NeuralPDE 和 ADCME 为 Julia)
- solver 类(DeepXDE, SimNet):用户只需定义问题,solver 处理底层细节
- wrapper 类(SciANN, ADCME):封装低层函数为高层函数,用户仍需实现求解步骤
- GPyTorch 和 Neural Tangents 可从 kernel methods 视角研究 NN 和 PINNs
- 我的分析:软件生态的成熟度是 PIML 可推广性的关键指标。DeepXDE 作为推荐入门库(ref 154, SIAM Rev.)对实践者友好。SimNet 由 Nvidia 开发并针对 GPU 优化,适合大规模工程问题。Julia 库(NeuralPDE, ADCME)体现了 Julia 在科学计算中的潜力,但生态规模仍小于 Python。对血管 G&R 应用,DeepXDE 是合理起点——它支持复杂域几何(constructive solid geometry)和分数阶 PDE。
段落 2:DeepXDE 的特色功能¶
- 核心论点:DeepXDE 不仅支持整数阶 ODE/PDE,还支持积分微分方程和分数阶 PDE,且提供高效的 Hessian 计算。
- 支撑论据:
- 支持 integro-differential equations 和 fractional PDEs
- 通过 constructive solid geometry 支持复杂域几何
- 代码紧凑,接近数学公式表述
- 结构良好且高度可配置,组件松耦合
- 可作为研究工具和教育工具
- SimNet 专门针对 Nvidia GPU 优化大规模工程问题
- DeepXDE 的 dde.grad.hessian 提供惰性求值和记忆化——仅在需要时计算 Hessian 元素,并记忆已计算梯度避免重复
- 我的分析:DeepXDE 的惰性 Hessian 求值和记忆化对耦合 PDE 系统(如 FSI + G&R)有实际价值——这类系统需要频繁计算高阶导数。但 DeepXDE 的功能覆盖面与 SimNet 的 GPU 优化之间需要权衡:研究原型用 DeepXDE,大规模工程问题可能需要 SimNet。ADCME 将 NN 嵌入传统数值格式的思路对已有 FEM 代码库的渐进式 ML 集成有吸引力。
Which model, framework, algorithm to use?¶
段落 1:选择困境与元学习展望¶
- 核心论点:给定物理系统和数据,应使用哪个 ML 框架、训练算法和多少样本——目前没有经验法则,但元学习可能自动化这一过程。
- 支撑论据:
- 无 rule-of-thumb 策略,需经验来正确设置 PIML 模型
- 元学习技术(refs 166–168)可能在未来自动化此过程
- 选择取决于具体任务
- 我的分析:这段坦诚承认了 PIML 实践中的核心痛点——模型选择缺乏系统性指导。对新手而言这意味着大量试错。元学习自动化是理想方向,但 2021 年时尚不成熟。
段落 2:架构选择 taxonomy¶
- 核心论点:PINN 架构选择由问题性质决定——多层感知机通用但不编码特殊偏差,CNN 适合网格化 2D 域,Fourier feature networks 适合高频/周期解,循环架构适合非 Markov/时间离散问题。
- 支撑论据:
- 多层感知机:通用但不编码专门 inductive bias
- 卷积 NN:适合网格化 2D 域
- Fourier feature networks:适合高频或周期边界的 PDE
- 循环架构:适合非 Markov 和时间离散问题
- 概率变体可推断随机过程(贝叶斯/频繁ist 集成捕获 epistemic 不确定性,VAE/GAN 捕获 aleatoric 不确定性)
- DeepONet 框架可推断算子而非函数,其架构也可根据数据类型变化
- 样本复杂度通常未知,由 inductive bias 强度、数据-物理兼容性和目标函数/算子复杂度决定
- 我的分析:这段提供了实用的架构选择指导,但定性多于定量。对血管 G&R:3D 血管几何是网格化的→CNN 可能适用;血流有高频分量(脉动)→Fourier features 可能有助;G&R 是时间离散的非 Markov 过程→循环架构可能适用。但这些选择需要实验验证,且不同选择可能需要不同数据量。样本复杂度的三个决定因素(inductive bias 强度、数据-物理兼容性、目标复杂度)提供了定性框架但缺乏定量预测。
Current limitations¶
段落 1:Multiscale and multiphysics problems——spectral bias 与多物理耦合¶
- 核心论点:全连接 NN 难以学习高频函数(spectral bias/F-principle),多尺度问题中网络常无法学习高频分量且训练失败,多物理同时学习计算昂贵。
- 支撑论据:
- 全连接 NN 难以学习高频函数——"F-principle"(ref 169)或"spectral bias"(ref 170)
- refs 171, 172 严格证明了 DNN 中频率偏差的存在并推导了收敛率与目标频率的函数关系
- 高频特征导致陡峭梯度,PINN 模型常难以准确惩罚 PDE 残差
- 多尺度问题中网络难以学习高频分量且常训练失败(refs 76, 173)
- 缓解方法:域分解(ref 105)、Fourier features(ref 174)、multiscale DNN(refs 45, 175)
- 多物理同时学习计算昂贵——可先分别学习各物理再耦合(DeepM&M 方法,refs 60, 61)
- 也可在粗尺度学习物理,仅在小域使用精细仿真数据(ref 176)
- NN 物理信息 loss 主要是 point-wise 的——在某些低维情况(如非光滑 conductivity 的扩散方程)可能失败(ref 177)
- 我的分析:spectral bias 是 PINN 在血管力学中的关键挑战——血管壁应力梯度(尤其是狭窄处)是高频特征,标准 PINN 可能无法准确捕获。Fourier feature networks(ref 174)和 multiscale DNN(refs 45, 175)是直接相关的缓解手段。DeepM&M 的"先分后合"策略对 FSI(fluid + structure 分别学习再耦合)有参考价值。point-wise loss 在非光滑系数下失败的问题对 G&R 中材料性质突变(如斑块-正常壁界面)需要特别注意——可能需要 weak form(hp-VPINN, ref 104)替代。
段落 2:New algorithms and computational frameworks——训练不稳定与高阶导数¶
- 核心论点:PINN 的多损失项 loss 是高度非凸优化问题,训练不稳健且不保证收敛到全局最小,且高阶导数的高效计算在主流框架中支持不足。
- 支撑论据:
- loss 函数多项竞争,训练不稳健,收敛到全局最小不保证(refs 178, 179)
- Wang et al.(refs 76, 77, 173)识别了 PINN 两个根本弱点:spectral bias 和 loss 不同分量收敛率差异导致的梯度消失
- 缓解方法:适当模型架构和训练算法、weak form + hp-refinement(ref 104)、自适应激活函数(ref 180)、自适应采样(ref 181)
- 架构设计目前凭经验,元学习可自动化(refs 166–168)
- 架构可能随系统分岔参数(如 Reynolds 数)变化而需要调整
- 训练昂贵,需通过 transfer learning 加速(如 DeepONet 的 crack propagation 应用,ref 182)
- 可扩展和并行训练算法应利用 GPU/TPU,使用数据并行和模型并行
- 高阶导数在 TensorFlow/PyTorch 中高效支持不足——Taylor-mode automatic differentiation(refs 183, 184)可大幅降低计算成本
- 除整数阶导数外,积分算子和分数阶导数在 PIML 中也很有用(ref 103)
- 我的分析:这段是 PIML 实践者最重要的"警示"——PINN 训练不保证收敛,多 loss 项竞争导致梯度病理。对血管 G&R 应用意味着:需要仔细选择 loss 权重策略(如自适应权重,ref 173),可能需要多个网络架构尝试。"架构随 Reynolds 数变化"的观察对脉动血流(Womersley 数变化)有启示——不同血管段可能需要不同网络配置。Taylor-mode AD(ref 184, JAX)对涉及高阶导数的 G&R 方程(如四阶 PDE)有实际价值。
段落 3:Data generation and benchmarks——缺乏标准化基准¶
- 核心论点:PIML 缺乏标准化基准测试和数据集来公平比较不同方法的精度、速度和可复现性,且物理系统中的基准设计比图像/NLP 更复杂。
- 支撑论据:
- ML 社区(图像/语音/NLP)广泛使用标准基准来评估算法改进、可复现性和计算成本
- UCI ML Repository 包含一些物理科学数据集(翼型噪声、海洋温度、水动力阻力)
- 但物理/化学中许多应用需要全场数据(如 DFT、MD、湍流 DNS),无法实验获取且计算资源消耗大
- 需要考虑如何公开、策展这些数据并包含物理模型和所有参数
- 需要设计有意义的基准来测试新 PIML 算法的精度和加速——非平凡任务
- 物理系统中目标是预测动力学,捕获/识别动力系统分岔和混沌状态很复杂
- valid-time prediction(ref 187)等新度量可能适用
- 我的分析:标准化基准的缺失使不同 PIML 方法之间难以公平比较——这是 2021 年文献中普遍存在的问题。对血管 G&R 而言,缺乏 PIML 基准意味着无法直接判断 PINN 与 FEM 在特定问题上的性能差异,需要自行构建比较框架。valid-time prediction 度量对 G&R 的长时模拟评估有参考价值——可量化 PINN 预测在多长时间内保持有效。
段落 4:New mathematics——收敛理论的不完善¶
- 核心论点:PIML 的理论基础尚不完善,需要新理论来严格分析其能力和局限——特别是 PDE 求解中的 approximation/optimization/generalization 三类误差的 well-posedness、稳定性和收敛性。
- 支撑论据:
- 根本问题:网络能否通过梯度优化找到 PDE 解?
- 总误差分解为三类:approximation error(网络能否以任意精度近似 PDE 解?)、optimization error(能否达到零或极小训练 loss?)、generalization error(更小训练误差是否意味着更准确预测解?)
- 需要分析 well-posedness、稳定性和收敛性
- 当算子本身由数据学习时,well-posedness 分析是数学挑战
- 初始/边界/内部条件本身作为(可能不确定的)数据提供时挑战加剧
- 首个 PINN forward 问题的数学分析(ref 188):Hölder 正则化控制泛化误差,分析二阶线性椭圆/抛物型 PDE 并证明一致性
- refs 189, 190:用 quadrature 点的误差估计,但无收敛结果
- ref 191:线性 PDE 的抽象误差估计框架,用 Rademacher 复杂性处理泛化误差
- refs 49, 193–195:连续 loss 公式下的误差估计
- 需要新理论理解训练动态(gradient descent, SGD, Adam)
- ref 197:过参数化两层网络收敛性分析,但未包含边界条件
- ref 76:neural tangent kernel 理论扩展到 PINNs
- 需要理解不同公式(强形式/弱形式)和不同 loss 函数/范数之间的等价性
- 需要 deep learning、优化、数值分析和 PDE 理论的协同
- 我的分析:这段是 PIML 最深层的局限——缺乏严格理论保证。三类误差分解对实践者有指导意义:approximation error 取决于网络容量,optimization error 取决于训练算法,generalization error 取决于数据量和正则化。对血管 G&R 应用,最关键的是 optimization error——PINN 训练是否收敛直接决定结果可信度。现有收敛分析仅限于线性 PDE(refs 188, 191),而 G&R 方程是非线性的,理论保证不直接适用。NN tangent kernel 视角(ref 76)虽提供了训练动态的近似理解,但仅在网络宽度趋于无穷时严格成立,实际网络有限宽度下偏差多大尚不清楚。
Outlook¶
段落 1:展望总览与开发环境需求¶
- 核心论点:PIML 可在噪声和高维环境中无缝整合数据与数学模型并有效求解逆问题,但需要更友好的开发环境和可视化工具来推广。
- 支撑论据:
- 已总结 Boxes 1–3 的关键概念和框架/开源软件
- 讨论了当前能力、局限和多样化应用(流体力学、生物物理、等离子体物理、亚稳态转变、材料等)
- 对物理问题,需要扩展需求:多物理和复杂几何域、解场可视化(甚至高维)
- 类似 FEniCS、OpenFOAM 的传统计算平台提供的可视化能力
- 用户友好的、基于图的 ML 开发环境可帮助更多实践者开发 PIML 算法
- 我的分析:这段将 PIML 的推广瓶颈定位在工具链成熟度上——与 FEniCS 等成熟 FEM 平台相比,PIML 的可视化和交互工具仍不完善。对从 FEM 迁移到 PIML 的研究者(如生物力学领域),工具链的差距是实际门槛。基于图的开发环境(类似 Simulink 的可视化建模)可能降低入门门槛,但 2021 年后此类工具尚未大规模出现。
段落 2:Digital twins——数字孪生¶
- 核心论点:PIML 因其自然融合物理模型和数据、去除网格生成的能力,有望成为数字孪生时代的使能催化剂。
- 支撑论据:
- 数字孪生(GE 首创概念)正在多个行业成为现实——通过同化真实测量校准计算模型来复制物理实体的行为
- 基本问题:观测数据稀疏且噪声大、数据模态异构(图像/时序/实验室/临床记录)、某些量不可直接观测
- 物理模型依赖繁琐预处理和校准(网格生成、初始/边界条件校准),阻碍实时决策
- 复杂自然系统的物理模型"部分已知"——守恒律不提供闭合方程组除非提出适当本构律
- PIML 的自然能力——融合物理模型和数据 + automatic differentiation 去除网格生成——使其适合数字孪生
- 我的分析:数字孪生是 PIML 最有前景的应用方向之一,对血管 G&R 直接相关:患者特异性血管数字孪生需要从稀疏 MRI 数据实时校准 G&R 模型,PIML 的"部分已知物理 + 数据融合"范式天然适配。"去除网格生成"的 claim 需 qualifier——PINN 虽无需传统网格,但仍需配置残差点采样策略(自适应采样,ref 181),这本身是一种"软网格"。数据模态异构的问题在临床场景中突出(MRI + 血压 + 实验室值),多保真度框架是自然解决方案。
段落 3:Data and model transformations——模型间转换与可解释性¶
- 核心论点:不同研究者可能对同一现象得到不同的数据驱动模型,需要构建模型间的可验证转换来系统融合数据和模型并增强可解释性。
- 支撑论据:
- 两组使用相同数据的研究者可能得到不同训练的网络(不同 latent space、不同 operator),即使训练集预测几乎不可区分
- 需要构建 ML 模型间的一对一转换(可变换、对偶、可校准)
- 已有转换发现:非线性动力学→Koopman 模型、Poisson 系统→Hamiltonian 系统、Nesterov 迭代→对应 ODE
- ML latent space 特征与物理可解释观测量之间、ML 学习的算子与闭式方程之间的转换将增强可解释性
- 需要测试转换的泛化范围:在什么观测范围内 ML 模型可映射到不同 ML 模型或物理模型,泛化极限是什么
- 我的分析:这段提出了一个前沿且深刻的问题——不同 ML 模型之间的"等价性"或"可转换性"。对血管 G&R 意味着:不同研究者用不同架构 PINN 得到的 G&R 参数反演结果可能表面一致但内部表示不同,需要方法来判断它们是否在物理上等价。Koopman 模型转换(非线性→线性)对简化 G&R 动力学分析有潜在价值。但这些方向在 2021 年仍属探索阶段,实用工具尚未成熟。
段落 4:Searching for intrinsic variables——内禀变量与涌现表示¶
- 核心论点:新兴范式是使用观测和学习方法自动发现好的/内禀变量和有用的物理模型公式,超越当前"先定义可观测量再收集数据"的传统范式。
- 支撑论据:
- 当前 PIML 范式:先定义人类可解释的观测/变量→收集数据→用合理算子词典公式化物理→应用学习算法
- 新范式:用观测和学习自动确定内禀变量和有用的物理模型公式
- manifold learning(ISOMAP, t-SNE, diffusion maps)和深度学习对应物(生成模型、auto-encoders)将原始观测嵌入降维的数学有用 latent space
- 涌现表示可超越嵌入相关特征——可为时空无序数据创建 ML 驱动的涌现空间(refs 200, 201)
- 可在学习到的涌现"时空"中学习演化算子(PDE/SODE)
- 与现代物理中涌现时空的讨论有直接类比(ref 203)
- 在主动学习框架中整合数据收集和学习——利用 latent space 几何指导新数据选择
- "理解"的含义正在改变——可在无机制理解的情况下做出准确预测
- 我的分析:这段是全文最具哲学深度的部分——重新定义"理解"的含义。对血管 G&R 的启示是双面的:一方面,如果存在 G&R 的内禀变量(尚未被传统力学变量捕捉),ML 可能发现它们;另一方面,"无机制理解的准确预测"对生物力学研究者构成认识论挑战——G&R 模型的价值不仅在于预测还在于理解机制。主动学习框架(利用 latent space 几何指导实验设计)对临床试验数据收集有实际价值——可指导何时何地采集 MRI 数据以最大化信息增益。但"涌现时空"的概念在 2021 年仍高度实验性,实用工具尚未成熟。
摘要概述¶
本文是 Karniadakis 等人发表于 Nature Reviews Physics 的综述,系统梳理了 physics-informed machine learning(PIML)这一新兴领域。核心论点是:纯数据驱动的深度学习在科学问题上面面临数据稀缺、外推性差、物理不一致等问题,而将物理定律(PDE 守恒律、对称性等)作为 inductive bias 嵌入 ML 模型,可以显著提升小数据下的精度、泛化性和可解释性。文章将 PIML 归纳为三条路径——observational bias、inductive bias(硬约束,直接编码进网络结构)、learning bias(软约束,通过 loss 项施加),并重点介绍了 physics-informed neural networks(PINNs)通过 automatic differentiation 在时空随机点处施加 PDE 约束的范式。综述覆盖了从流体力学、生物物理到等离子体物理的多样化应用,涵盖 forward 问题(求解 PDE)、inverse 问题(参数发现、隐物理发现)及高维 PDE 求解,最后展望了 digital twins、operator regression、equivariant 架构等未来方向。
关键图表¶
-
Box 1(数据与物理的三种情景) — 按 data 多寡与 physics 已知程度划分三类问题:small data + full physics(传统数值求解)、some data + some physics(最普遍、最有趣的中间情形,可用 PINN 同时反演参数与解)、big data + no physics(纯数据驱动发现新物理)。中间情景是 PIML 的核心舞台。
-
Fig. 1(physics-inspired 网络架构) — 展示了如何利用对称性/不变性设计网络结构(如 covariant compositional networks、equivariant transformers、HJ-PDE 两层架构),使网络自动满足物理约束,属于 inductive bias(硬约束)路径。
-
Fig. 2/3(流体与血流应用) — Fig. 2 用 PINN 从 espresso cup 的 Tomo-BoS 视频反演三维流场(hidden fluid mechanics);Fig. 3 对猪主动脉的 4D-flow MRI 数据做 physics-informed 滤波,重建壁面剪应力等量,展示了 PIML 在生物医学成像降噪与反演中的实际威力。
与我的关联¶
作为计算生物力学研究者,PIML 提供了一条将 FEniCS/FEM 传统求解与实验数据(如医学影像、力学测量)融合的新路径——尤其是 inverse problem 范式(从 noisy data 反演材料参数或缺失的 constitutive 项)对血管 G&R 模型的参数标定与不确定性量化有直接启发,值得进一步精读其 PINN inverse 机制与 high-dimensional PDE 章节。