Skip to content

Challenges and Strategies for Deep Learning in Cardiovascular Imaging: Ejection Fraction and Heart Failure Management

Pasdeloup, David; Østvik, Andreas; Olaisen, Sindre et al. · 2025 · JACC: Cardiovascular Imaging

Metadata

Authors: Pasdeloup, David; Østvik, Andreas; Olaisen, Sindre; Skogvoll, Eirik; Dalen, Havard; Lovstakken, Lasse

DOI: 10.1016/j.jcmg.2025.02.011

摘要概述

本文以左心室射血分数 (LVEF) 自动测量与心衰 (HF) 管理为案例,系统评估深度学习 (DL) 在心血管影像临床转化中面临的三大共性挑战:评价指标可靠性、训练数据分布与模型泛化能力。研究在三个独立人群 (EchoNet N=10,030, HUNT4 N=1,762, CAMUS N=500) 上使用基于 MoViNet 架构的端到端 DL 框架进行 LVEF 自动估计,发现 AUC 仅因人群特征变化即可在 0.71 至 0.98 之间波动,揭示传统二分类指标在回归衍生诊断场景下的不稳定性。在训练数据方面,通过 enrichment 和 oversampling 策略,即使减少 40% 训练样本仍可改善模型精度;在外部数据上模型出现显著性能退化,而将超声领域知识以 image augmentation 形式融入 DL 框架可有效恢复性能并缩小泛化差距。作者据此提出以 extended Bland-Altman 分析为核心的缓解策略,强调评价指标、训练数据分布与领域知识融合三者并重,为 DL 模型在心血管影像中的稳健设计与评估提供了可操作的指导框架。

综述问题、范围与选择标准

  • 要回答的问题:DL 模型在心血管影像自动化测量中面临哪些共性挑战,这些挑战如何影响模型的临床可用性,以及如何通过缓解策略加以克服?具体以 LVEF 估计与 HF 管理为示范案例。
  • 覆盖范围:覆盖 DL 在 echocardiography 中 LVEF 自动估计的三个核心维度——评价指标 (MAE, R², AUC, Bland-Altman LOA)、训练数据 (样本量、分布均衡性、选择策略) 与模型泛化 (内部到外部数据集的迁移性能);涉及三个独立人群 EchoNet (N=10,030)、HUNT4 (N=1,762)、CAMUS (N=500),使用 Philips 与 GE HealthCare 超声扫描仪;时间跨度覆盖 2019–2024 年的关键 DL 心血管影像文献。
  • 文章性质:perspective
  • 文献选择方法:未报告。本文未描述系统性文献检索策略 (数据库、检索式、纳排标准),而是以作者团队自身实验为骨架,选择性引用相关综述与方法学文献来支撑论点。

主题综合

主题 1:评价指标可靠性与临床相关性

  • 核心论点:常用的评价指标 (MAE, R², AUC) 在 DL 模型评估中高度依赖测试数据的分布特征,不能可靠反映模型在临床任务 (如 HF 管理中 LVEF 截断值附近) 中的实际性能。AUC 在二分类诊断场景下仅因人群分布变化即可从 0.71 波动至 0.98,MAE 从 3.9% 变化至 6.0%,这种不稳定性使得跨数据集比较和临床可接受性判断变得困难。作者提出 extended Bland-Altman 分析 (结合 inverse sample weighting、range of interest 限制与 trend 量化) 作为更稳健的替代方案。
  • 代表证据定位:Fig. 4 (Influence of Population Imbalance on Commonly Used Evaluation Metrics), Fig. 6 (Robustness of the Extended Bland-Altman Analysis), § RESULTS — Evaluation challenge, PDF p. 753–754
  • 共识程度:有限共识。DL 评价指标受数据分布影响这一现象已有文献报道 (ref 13 Maier-Hein et al; ref 8 Varoquaux & Cheplygina),但将 AUC 在回归衍生二分类中的不稳定性定量到 0.71–0.98 范围并提出 extended Bland-Altman 作为系统缓解方案是本文的原创贡献。
  • 分歧或限制:extended Bland-Altman 分析在 heteroscedasticity 可忽略时价值有限,且在 range of interest 缩窄后 LOAs 会变宽 (§ Discussion — Evaluation challenge, PDF p. 758)。此外,该方法尚未在 HF 管理以外的临床任务中验证其通用性。

主题 2:训练数据分布与样本选择策略

  • 核心论点:模型性能不仅取决于训练数据量,更取决于数据分布的多样性与临床任务相关性。通过 enrichment 策略 (选择性纳入 LVEF 远离 60% 的患者) 和 oversampling 策略 (复制低代表性样本以实现均匀分布),即使将训练样本从 7,156 减少到 2,146 (减少约 70%),oversampling 仍可获得比 3,578 个 baseline 患者更窄的 LOA 宽度 (P < 0.001)。这表明在数据量受限的回顾性研究或昂贵影像模态中,合理的样本选择比单纯增加数据量更有效。
  • 代表证据定位:Fig. 2 (Patient Selection and Resampling Strategies), Fig. 7 (Model Precision for Different Training Data Selection Strategies), § RESULTS — Training data challenge, PDF p. 754–755
  • 共识程度:有限共识。data imbalance 对 DL 训练的负面影响是领域内已知问题,但将 enrichment 与 oversampling 在心血管影像 LVEF 估计中进行定量比较并提出前瞻性数据采集优化建议是本文的贡献。
  • 分歧或限制:oversampling 在使用 100% 全量数据时与 baseline 无显著差异 (P = 0.97),且 enrichment 在大数据集 (50% 和 100%) 时亦无显著改善 (§ RESULTS — Training data challenge, PDF p. 755)。该结论仅基于单一训练集 (EchoNet),在其他数据集或模态上的适用性未验证。

主题 3:模型泛化能力与领域知识融合

  • 核心论点:DL 模型在内部数据上表现良好但迁移到外部数据时出现显著性能退化,且模型会从训练数据中学习到 LVEF 上下界的 "shortcut",导致无法预测超过约 75% 的 LVEF 值。将超声领域知识以 image augmentation (模拟 gain、dynamic range、color map、field of view 变化) 形式融入训练过程,可有效恢复性能:HUNT4 数据集上 LOA 宽度从 42.8% 降至 32.7%,泛化差距从 +9.4% 降至 +1.9%;但 CAMUS 数据集上改善有限。
  • 代表证据定位:Table 1 (Baseline and Revised DL Model Performance Compared With Previous Work), Fig. 8 (Visual Representation of LVEF Estimations), § RESULTS — Generalization challenge, § Discussion — Generalization challenge, PDF p. 755–760
  • 共识程度:稳固共识。DL 模型跨中心泛化退化是领域内广泛报道的问题 (ref 9 Roberts et al; ref 10 Sanchez-Martinez et al; ref 34 Pooch et al),通过 domain-specific augmentation 改善泛化也有先前工作支持。
  • 分歧或限制:domain augmentation 在 CAMUS 数据集上效果不及 HUNT4,作者推测可能与 reference measurement 精度和系统性误差有关 (§ Discussion — Generalization challenge, PDF p. 760)。此外,仅使用单一数据集训练 (避免引入 confounders),未探索多数据集混合训练的风险与收益。模型学习的 75% 上界 shortcut (ref 31 DeGrave et al) 表明 end-to-end DL 的可解释性仍存隐患。

关键图表、Box 与分类框架

  • 定位:Central Illustration (Baseline DL Framework With the Associated Challenges and Our Proposed Mitigation Strategies), PDF p. 762
  • 内容:以流程图形式整合了三大挑战及其缓解策略:(1) Training data challenge — imbalance、lack of diversity,缓解策略为 balancing 与 enrichment patient selection;(2) Evaluation challenge — reference values uncertainty、data imbalance、metrics influenced by demographics,缓解策略为 extended Bland-Altman analysis 实现 analysis independence、robust performance comparison 与 reliable quantification of generalizability;(3) Generalization challenge — performance degradation from internal to external data、robustness to imaging devices,缓解策略为 insertion of imaging domain knowledge 与 continuous testing on external datasets throughout training。图中还标注了各数据集的样本量 (EchoNetTrain N=7,465, EchoNetVal N=1,288, EchoNetTest N=1,277, HUNT4 N=1,762, CAMUS N=500) 和训练流程。
  • 价值:该图是全文的视觉总纲,将分散在 Results 与 Discussion 中的发现与建议整合为单一框架,便于研究者与临床医生快速理解三大挑战的关联与缓解路径。它同时明确了本文的方法学定位——以端到端 DL 框架为载体,将方法学评估与临床任务 (HF management) 绑定。
  • 局限:该框架以 LVEF 估计为唯一案例,其泛化到其他测量任务 (如 strain、chamber volume) 或其他影像模态 (如 CMR、CT) 的适用性仅在文字中提及但未实验验证。Central Illustration 未涵盖 foundation models 这一新兴方向的具体缓解路径。

共识、争议与研究空白

相对稳固的共识

DL 模型在内部数据上表现良好但迁移到外部数据时性能退化是跨领域共识,本文在三个独立数据集上再次证实了这一点 (Table 1: HUNT4 MAE 从内部 4.7% 升至 6.5%,CAMUS MAE 升至 9.1%;§ RESULTS — Generalization challenge, PDF p. 755)。这一发现与 ref 9 (Roberts et al)、ref 10 (Sanchez-Martinez et al)、ref 34 (Pooch et al) 的报道一致。此外,仅依靠内部评估不足以证明临床相关性,外部验证是必要条件这一观点也被本文及引用文献共同支持 (§ Discussion — Generalization challenge, PDF p. 760)。

尚存争议

extended Bland-Altman 分析是否应取代传统 MAE/R²/AUC 作为 DL 模型的首选评估方法尚有争议。作者承认该方法在 heteroscedasticity 可忽略时价值有限,且 range of interest 缩窄会导致 LOAs 变宽 (§ Discussion — Evaluation challenge, PDF p. 758)。同时,log transformation 在 heteroscedasticity 场景中的常规应用被作者认为 "sub-optimal",但这一判断仅基于 LVEF 案例的单一实验,未在其他测量任务中验证。此外,oversampling 相比 enrichment 的优越性仅在 EchoNet 数据集上成立,两者在 100% 全量数据时均与 baseline 无显著差异 (Fig. 7, PDF p. 759),说明数据选择策略的价值可能随数据量增大而递减。

作者提出的研究空白

作者明确指出多项研究空白:(1) DL 模型是否能独立于 manual reference values 超越人类操作者尚待研究,因 reference values 受测量误差与 rounding effect 影响 (§ STUDY LIMITATIONS, PDF p. 760);(2) 混合多数据集训练的风险与可能性未探索 (§ STUDY LIMITATIONS, PDF p. 760);(3) imaging protocol 和 frame rate 等潜在 confounders 需进一步调查 (§ STUDY LIMITATIONS, PDF p. 760);(4) foundation models 在心血管影像中的潜在 bias 需在临床部署前严格评估 (§ FUTURE PERSPECTIVES, PDF p. 761);(5) PRIME checklist 的未来修订应纳入 generalizability、training data 与 evaluation 相关挑战 (§ PERSPECTIVES — TRANSLATIONAL OUTLOOK, PDF p. 763)。

我识别的遗漏

本文聚焦于 end-to-end DL 框架,但未系统比较 segmentation-based LVEF 估计方法面临相同挑战时的差异。虽然作者在 Supplemental Figure 11 中简要提及 commercial software 和 segmentation-based 方法的 heteroscedasticity,但正文未展开定量分析。这一遗漏影响了结论对当前主流 DL 方法 (许多采用 segmentation-based pipeline) 的适用性判断。此外,本文仅使用 apical 4-chamber 单一视角,未讨论多视角融合对泛化能力的影响,而临床实践中 LVEF 测量常基于 biplane Simpson's method,这使得结论对实际临床工作流的代表性有限。

个人批注

与我的工作的关系

本文对 DL 模型评价指标局限性与泛化问题的系统性分析,对我评估医学影像深度学习方法论的稳健性与可迁移性具有直接参考价值。特别是 extended Bland-Altman 分析框架中 inverse sample weighting 和 range of interest 限制的思路,可迁移到我关注的计算力学参数标定中的不确定性量化场景。此外,domain-specific augmentation 的设计逻辑——基于跨数据集外观差异 (gain, dynamic range, color map, field of view) 构建 augmentation——为我思考如何将物理领域知识融入 data-driven 方法提供了可操作的范式。

可复用框架

extended Bland-Altman 分析框架 (inverse weighting + range of interest + trend quantification) 是本文最核心的可复用方法学贡献,作者已开源代码 (ref 43, UncertMedCompare, https://github.com/dfpasdel/UncertMedCompare)。该框架的三要素——(1) 使分析独立于测试数据分布、(2) 限制到临床相关范围、(3) 量化 proportional bias——可推广到任何涉及 continuous measurement 对比的不确定性评估场景。Central Illustration 中的三大挑战分类 (evaluation, training data, generalization) 也可作为 DL 医学影像项目设计时的检查清单。

疑问与后续动作

  • 疑问 1:extended Bland-Altman 分析中 inverse weighting 的具体权重函数形式是什么?文中提到 "inversely weighing each sample based on the mean value of the 2 comparators",但未给出数学表达式,需查阅开源代码确认。
  • 疑问 2:enrichment 策略中 "increasing the proportion of subjects with LVEF further from 60%" 的具体选择阈值是什么?文中未明确,这影响了策略的可复现性。
  • 后续动作:查阅 UncertMedCompare 开源仓库 (ref 43) 以理解 extended Bland-Altman 分析的完整实现;检索 PRIME checklist 的当前版本与后续修订进展,评估本文建议的实际采纳情况。

与上下文的关系

本文建立在

本文的核心方法论建立在以下上游工作之上:EchoNet 数据集与 DL 框架 (ref 17, Ouyang et al, Nature 2020) 提供了训练数据与基线方法;Ghorbani et al (ref 16, NPJ Digit Med 2020) 建立了 echocardiogram DL 解释的先例;Maier-Hein et al (ref 13, Nat Methods 2024) 的 metrics reloaded 建议为评价指标批判提供了方法学基础;Varoquaux & Cheplygina (ref 8, NPJ Digit Med 2022) 系统梳理了 ML 医学影像的方法学失败;Roberts et al (ref 9, Nat Mach Intell 2021) 与 Sanchez-Martinez et al (ref 10, Front Cardiovasc Med 2022) 揭示了跨中心泛化问题;DeGrave et al (ref 31, Nat Mach Intell 2021) 关于 AI shortcut learning 的分析为模型 75% 上界现象提供了理论解释;Sengupta et al (ref 12, Lancet 2024) 的 cardiac imaging AI 挑战综述提供了宏观框架。Bland-Altman 分析方法本身基于 Carstensen (ref 32, 2010) 的临床测量方法比较理论。

已核实的后续引用

本次未检索。

同类综述对比

与 ref 12 (Sengupta et al, Lancet 2024) 的 cardiac imaging AI 挑战综述相比,本文以单一案例 (LVEF) 进行深度方法学实验,而非广覆盖的定性综述;与 ref 13 (Maier-Hein et al, Nat Methods 2024) 的 metrics reloaded 相比,本文将 metrics 评估与具体临床任务 (HF management) 绑定并提出可操作的 extended Bland-Altman 替代方案;与 ref 15 (Dey et al, JACC Cardiovasc Imaging 2023) 的 NHLBI Workshop 报告相比,本文聚焦方法学层面而非政策与研究方向。本次未核实更多同类综述的详细对比。

与本地论文队列的关系

  • 2023-AI-VulnerablePlaque-Foellmer:同为 AI/DL 在心血管影像中的应用综述,Foellmer 等聚焦 vulnerable plaque 识别的 roadmap,本文聚焦 LVEF 自动测量的方法学挑战,两者互补——前者关注临床应用全景,后者提供评估方法学的具体范式。
  • 2023-Wearable-Cardiac-Ultrasound-Hu:Hu 等的可穿戴心脏超声使用 FCN-32 DL 模型提取 ejection fraction,本文提出的 evaluation 与 generalization 挑战框架可直接用于评估此类设备的 DL 性能稳健性。
  • 2021-Heart-Failure-Pathobiology-Mishra:Mishra 等综述 HFpEF 的细胞与分子病理生物学,本文以 LVEF 分类 (HFrEF/HFmrEF/HFpEF) 为临床应用场景,两者在 HF 分型基础上形成机制研究与影像方法学的互补。

快速判断

  • 一句话结论:本文以左心室射血分数 (LVEF) 自动测量为案例,系统评估了深度学习 (DL) 在心血管影像临床转化中面临的三大挑战:评价指标可靠性、训练数据分布与模型泛化能力。
  • 阅读范围:仅 metadata、first page、abstract、最多 3 个 figure/table captions 和 conclusion;未通读正文
  • 处理决定:保留参考
  • 决定理由:该文与心血管临床证据、风险评估或干预效果相关;受限材料足以保留研究线索,但不足以支持全文级方法或稳健性判断。

摘要概述

本文以左心室射血分数 (LVEF) 自动测量为案例,系统评估了深度学习 (DL) 在心血管影像临床转化中面临的三大挑战:评价指标可靠性、训练数据分布与模型泛化能力。研究在三个独立人群 (N=3,538) 上使用基于 MoViNet 架构的端到端 DL 框架进行 LVEF 自动估计,并分析其在心衰 (HF) 管理中的表现。结果显示,AUC 在不同人群特征下可从 0.71 波动至 0.98,揭示了传统评价指标在二分类诊断场景下的不稳定性;训练数据方面,通过优化样本选择策略,即使在减少 40% 训练样本后模型性能仍可提升;在外部数据上模型出现性能退化,而将医学影像领域知识集成到 DL 框架中有助于恢复性能并改善泛化能力。作者据此提出了针对评价指标、训练数据分布与领域知识融合的缓解策略,为 DL 模型在心血管影像中的稳健设计与评估提供了指导。

关键证据

  • 证据 1(定位):Abstract
  • 展示或报告:本文以左心室射血分数 (LVEF) 自动测量为案例,系统评估了深度学习 (DL) 在心血管影像临床转化中面临的三大挑战:评价指标可靠性、训练数据分布与模型泛化能力。研究在三个独立人群 (N=3,538) 上使用基于 MoViNet 架构的端到端 DL 框架进行 LVEF 自动估计,并分析其在心衰 (HF) 管理中的表现。
  • 支持的结论:本文以左心室射血分数 (LVEF) 自动测量为案例,系统评估了深度学习 (DL) 在心血管影像临床转化中面临的三大挑战:评价指标可靠性、训练数据分布与模型泛化能力。
  • 注意事项:仅据受限 quick source;方法细节、完整定量结果与稳健性分析本次未核实。

局限与未核实项

  • 最大局限:当前仅完成 quick triage,不能据此确认正文中的全部实验、模型或统计假设。
  • 未核实项:完整方法、样本或参数设置、敏感性分析、局限讨论及数据与代码可用性。

与我的关联

  • 可复用点:研究设计、结局定义或风险评估思路可作为临床研究的候选参考;跨人群可迁移性本次未核实。
  • 关联的当前问题:该文对 DL 模型在心血管影像中的评价指标局限性与泛化问题的系统性分析,对我评估医学影像深度学习方法论的稳健性与可迁移性具有方法论参考价值。
  • 下一步动作:保留参考;仅在当前问题需要其完整方法或定量证据时升级为 deep note。