Roadmap on the use of artificial intelligence for imaging of vulnerable atherosclerotic plaque in coronary arteries¶
Föllmer, Bernhard; Williams, Michelle C.; Dey, Damini et al. · 2023 · Nat. Rev. Cardiol.
Metadata
Authors: Föllmer, Bernhard; Williams, Michelle C.; Dey, Damini; Arbab-Zadeh, Armin; Maurovich-Horvat, Pál; Volleberg, Rick H. J. A.; Rueckert, Daniel; Schnabel, Julia A.; Newby, David E.; Dweck, Marc R.; Guagliumi, Giulio; Falk, Volkmar; Vázquez Mézquita, Aldo J.; Biavati, Federico; Išgum, Ivana; Dewey, Marc
DOI: 10.1038/s41569-023-00900-3
Tags: #atherosclerosis #AI-imaging
概述(Overview)¶
摘要概述¶
本 Roadmap 综述了人工智能(AI)在冠状动脉易损粥样硬化斑块影像评估中的应用现状与未来方向。作者系统梳理了 AI 在 CCTA、IVUS、OCT 等模态中用于自动化斑块分割、特征识别、风险分层的研究证据,并通过 Delphi 共识法(15 个问题,3 轮投票)汇集了 14 位心血管影像 AI 专家的共识建议。核心发现:AI 工具在研究环境中已接近人类专家表现(如 deep learning 斑块分析 5.7s vs 25.7min,TCFA 检测 AUC 0.96),但经临床验证的商业化解决方案尚不可用;可信 AI 的四大支柱——鲁棒性、可解释性、不确定性量化、偏倚缓解——是实现临床采纳的前提。作者提供了从共识到 RCT 的路线图,强调 AI 应辅助而非替代临床决策。
综述问题、范围与选择标准¶
- 要回答的问题:AI 在冠状动脉易损斑块影像评估中处于什么阶段?现有工具有哪些?哪些技术挑战和信任挑战阻碍临床采纳?未来需要什么?
- 覆盖范围:2013-2023 年间 AI 在 CCTA(非侵入)、IVUS/OCT(侵入)斑块评估中的应用;Delphi 共识法聚焦 15 个问题,涵盖参考标准、观察者变异性、AI 工具可用性、分割质量、伪影敏感性、可信 AI 要求、RCT 需求、读片时间、报告生成等
- 文章性质:consensus
- 文献选择方法:Delphi 三轮 + 补充两轮投票;14 位专家(心脏病学家、放射学家、心外科医生、生物医学工程师、计算机科学家);Likert 1-9 量表,共识阈值 ≥0.8,partial consensus 0.6-0.8
主题综合¶
主题 1:AI 在 CCTA 非侵入性斑块评估中的应用¶
- 核心论点:AI 已实现 CCTA 上冠状动脉钙化评分、中心线提取、斑块分割和易损特征(低衰减、正性重构、点状钙化、napkin-ring sign)的自动化;deep learning 系统在多中心研究中达到接近专家的量化精度
- 代表证据定位:§AI for vulnerable plaque assessment - Non-invasive assessment(PDF p.5-7),文献 [47,53-58]
- 共识程度:稳固——automated calcium scoring 在非对比 CT 和低剂量胸部 CT 上与人工量化一致性优秀 [53,54];deep learning 多中心研究(n=921)斑块量化 5.7s vs 25.7min,与 IVUS 一致性好 [47];total plaque volume ≥238mm³ 与 5 倍 MI 风险关联 [47]
- 分歧或限制:CCTA 受心脏运动和重度钙化影响;AI 工具在真实世界低质量图像上表现下降;radiomics 特征的可重复性跨中心/扫描仪未充分验证
主题 2:AI 在 IVUS/OCT 侵入性斑块评估中的应用¶
- 核心论点:OCT 的 AI 分割(A-line 分类和 pixel-based deep learning)已实现毫秒级实时分析;IVUS 的 AI 分析受限于低分辨率但 TCFA 检测 AUC 达 0.84-0.91
- 代表证据定位:§Invasive assessment(PDF p.7-8),文献 [15,16,70-78]
- 共识程度:有限——OCT pixel-based segmentation Dice=0.764,高风险成分(如巨噬细胞)精度低于斑块分割 [15];TCFA 检测 AUC 0.96 但 vessel-level 假阳性率 31% [75];组织学+OCT 联合训练优于单纯 OCT 训练 [77]
- 分歧或限制:OCT 假阳性率高(31% vessel-level);IVUS 低分辨率限制 pixel-based 方法;商业化 AI 工具仅用于研究
主题 3:可信 AI 的四大支柱¶
- 核心论点:临床采纳 AI 需要解决鲁棒性(域偏移、伪影)、可解释性(黑箱→可视化)、不确定性量化(置信度传达)、偏倚缓解(代表性差异)
- 代表证据定位:§Trustworthy AI + §Explainability, interpretability and generalizability + §Fairness and bias mitigation(PDF p.9-11),Table 1 Q8-11,Box 1,文献 [90-101]
- 共识程度:有限——共识 Q8 要求视觉确认直到完全信任;Q10 partial consensus 要求 95% CI + heatmap;Q11 partial consensus 要求大样本多样化训练+偏倚量化。RCT 是否必须(Q9)无共识
- 分歧或限制:STARD-AI/DECIDE-AI/CONSORT-AI 报告指南刚提出但未广泛采用;2022 系统评价仅 41 个 AI RCT,7 个高偏倚风险 [89]
关键图表、Box 与分类框架¶
- 定位:Figure 1
- 内容:AI/ML/DL 层级关系——AI ⊃ ML(supervised + unsupervised)⊃ DL(CNN、RNN、GAN)
- 价值:为非技术读者提供 AI 术语基础
-
局限:过于简化,未区分 weakly supervised、self-supervised 等
-
定位:Figure 3
- 内容:AI 在斑块评估中的任务交互图——从冠状动脉树提取、钙化评分到斑块分割、特征提取(radiomics)、CAD-RADS 分类、多模态学习、风险分层
- 价值:展示 AI 工具链的完整 pipeline 和模态间关系
-
局限:未标注各任务的成熟度等级
-
定位:Box 1
- 内容:可信 AI 的要求清单——鲁棒(技术+临床、可靠性、安全性、实时决策、泛化性、置信度传达)、伦理公平(安全、隐私、透明、公平、无偏、可解释)、合法(认证、GDPR、医疗器械法规)
- 价值:提供 AI 临床部署的系统性 checklist
- 局限:未给出各要求的具体度量标准
共识、争议与研究空白¶
相对稳固的共识¶
- 视觉确认 AI 分割结果直到完全信任(Q8,consensus)——AI 应辅助而非替代,Table 1(PDF p.4)
- AI 可在不增加读片时间的情况下提供完整量化(Q13,consensus),Table 1(PDF p.4)
- 数据保护和隐私问题必须在 cloud-based 解决方案使用前解决(Q14,consensus),Table 1(PDF p.4)
- 结构化报告应包含治疗建议+解释+发现分解+定量测量+摘要+自由文本(Q15,consensus),Table 1(PDF p.4)
尚存争议¶
- RCT 是否必须验证 AI 临床有效性(Q9,no consensus)——分割任务可能不需要 RCT 但影响患者管理的任务需要,Table 1(PDF p.4)
- 当前是否有 FDA/CE 批准的 AI 工具用于临床(Q4,no consensus)——专家对"AI 工具"定义不一致,底层技术(简单阈值 vs deep learning)对用户不可见,Table 1(PDF p.4)
- vulnerable plaque 概念本身仍有争议——斑块破裂常无症状 [24];PROSPECT 和 SCOT-HEART 支持预后价值但 ISCHEMIA 不支持低衰减斑块独立预测 [42];阳性预测值低无法预测哪些患者会进展
作者提出的研究空白¶
- 大规模多样化标注数据集缺乏——收集、整理、标注耗时且需专业知识,§Challenges(PDF p.9)
- 外部验证数据集与临床结局数据不足——AI 工具在高质量研究数据上训练后在真实世界低质量图像上 underperform,§Challenges(PDF p.9)
- AI RCT 严重不足——2022 系统评价仅 41 个 AI RCT,无一遵循标准化报告指南,7 个高偏倚风险 [89],§Challenges(PDF p.10)
- domain shift 问题——能量积分探测器训练的 AI 模型在 photon-counting CT 上可能失效,§Explainability(PDF p.10)
我识别的遗漏¶
- 综述未讨论 AI 工具在不同种族/族裔群体中的性能差异——仅提到概念但无具体数据或案例
- 未涉及 AI 在斑块力学评估中的应用——如从影像推断血管壁应力分布、斑块应力集中与破裂风险
- 未讨论 federated learning 作为解决数据隐私和多中心训练的方案——这在当前 AI 医学影像领域是重要方向
- radiomics 的可重复性(跨扫描仪/中心/重建参数)未被深入讨论——这是 radiomics 临床转化的关键障碍
个人批注¶
与我的工作的关系¶
作为计算生物力学研究者,本综述与我当前血管力学建模课题的关联在于:AI 影像可提供患者特异性的斑块形态和组成信息,这些信息可作为 G&R 模型的几何和材料参数输入。特别是 CCTA 衍生的低衰减斑块体积(与脂质坏死核心相关)和正性重构(与血管壁 G&R 相关)是 G&R 模型的直接相关量。AI 自动化量化解决了"从影像到模型参数"的瓶颈——以往手动量化耗时且变异大。此外,AI 识别的"不可见特征"(radiomics)可能提供 G&R 模型未捕获的斑块异质性信息。
可复用框架¶
Box 1 的可信 AI checklist 可迁移到评价血管力学仿真工具的临床转化——鲁棒性(参数不确定性)、可解释性(应力分布可视化)、不确定性量化(模型置信区间)、偏倚缓解(人群代表性)。
疑问与后续动作¶
- AI 量化斑块形态如何转化为 G&R 模型的初始条件/边界条件?
- radiomics 特征与血管壁力学性质(如刚度、应力分布)的关联是什么?
- 后续查阅 Cleerly Labs 和 Autoplaque 的验证文献,了解其量化精度是否足够作为 G&R 模型输入
与上下文的关系¶
本文建立在¶
建立在 SCOT-HEART [27] 和 PROSPECT [9] 试验建立的易损斑块预后价值之上,扩展了第二版 QCI 会议的共识声明 [13] 至 AI 领域。
已核实的后续引用¶
本次未检索。
同类综述对比¶
与本队列 2021-Wearables-Cardio-Bayoumy 对比:Bayoumy 关注可穿戴设备的临床应用和 ABCD 指南,Foellmer 关注 AI 在斑块影像中的技术和信任框架。二者都强调了可信 AI 的必要性——Bayoumy 的 ABCD 框架对应 Foellmer 的 Box 1。与本队列 2019-Artificial-Intelligence-Cardiovascular-Siegersma 对比:Siegersma 是 AI 在心血管中的 general review,Foellmer 聚焦易损斑块 imaging 这一具体领域。
与本地论文队列的关系¶
2021-Wearables-Cardio-Bayoumy:ABCD 框架 vs Box 1 trustworthy AI checklist——两种临床整合指南2009-VascularBiomech-Taylor:Taylor & Humphrey 的血管 G&R 框架需要患者特异性参数——AI 影像量化可提供这些参数2014-ECM-Remodelling-Bonnans:ECM 重塑与斑块稳定性的分子机制——AI radiomics 可能提供 ECM 组成的影像代理
逐章节笔记(Section-by-Section Notes)¶
Introduction¶
段落 1:AI 在心血管影像中的兴起¶
- 核心论点:AI 从被怀疑到成为日常生活的一部分,过去十年在心血管影像中应用快速增长,尤其在冠心病、心衰和心律失常的诊断和预后评估中
- 支撑论据:
- 1960 年代被认为不可能的 AI-based 自动语音和面部识别已广泛集成于现代智能手机,展示 AI 从实验室到日常消费技术的转化路径
- 过去十年中 AI 方法在心血管医学中的应用持续增长,Quer et al. (2021, JACC) 和 Al'Aref et al. (2019, Eur Heart J) 等综述系统记录了这一趋势;Litjens et al. (2019, JACC Cardiovasc Imaging) 指出深度学习在心血管影像分析中已达到 state-of-the-art 水平
- 多数 AI 方法聚焦于冠心病(CAD)、心力衰竭和心律失常的诊断、风险分层和预后评估;Friedrich et al. (2021, Eur Heart J Digit Health) 的系统评价确认这一应用分布
- 易损斑块作为急性冠脉事件(斑块破裂继发血栓形成)前兆的预后证据在过去十年更加 robust:Williams et al. (2019, JACC) 在 SCOT-HEART 中证实、Stone et al. (2011, NEJM) 在 PROSPECT 中证实、Kedhi et al. (2021, Eur Heart J) 在 COMBINE OCT-FFR 试验中证实
-
视觉及定量斑块检测耗时、需高 expertise,且存在显著 intra/interobserver 变异:Jonas et al. (2022, Clin Imaging) 在 CLARIFY 子研究中量化了专家读者间斑块体积和特征变异,Gruslova et al. (2022, JACC) 报告 OCT 核心实验室对不稳定斑块识别存在困难
-
我的分析:这段将 AI 定位为"不可避免的趋势"——但未充分讨论 AI 在心血管影像中的失败案例和局限。这是 Roadmap 的基调——审慎乐观但有条件
段落 2:易损斑块的预后价值与量化挑战¶
- 核心论点:易损斑块的预后证据过去 10 年更加 robust,但视觉和定量检测耗时、需高 expertise、且有显著 intra/interobserver 变异
- 支撑论据:
- 易损斑块作为急性冠脉综合征前兆的机制由 Muller et al. (1989, Circulation) 最早描述,确立了斑块破裂继发血栓形成的事件链
- 过去十年中预后证据趋 robust:Williams et al. (2019, JACC) 在 SCOT-HEART 中报告低衰减非钙化斑块预测 MI;Stone et al. (2011, NEJM) 在 PROSPECT 前瞻性自然史研究中证实 TCFA 与疾病进展关联;Kedhi et al. (2021, Eur Heart J) 在 COMBINE OCT-FFR 试验中证实 TCFA 预测糖尿病患者的临床事件
- 定量冠脉斑块检测和表征耗时、需要高水平专业知识:Jonas et al. (2022, Clin Imaging) 在 CLARIFY 试验子研究中量化了专家读者间在冠脉 CT 血管造影上量化斑块体积和特征时的变异
- Gruslova et al. (2022, JACC) 报告国际 OCT 核心实验室能够识别稳定斑块但无法可靠识别不稳定冠脉斑块,揭示了观察者内变异
-
这些变异和耗时负担为 AI 自动化量化提供了直接动机
-
我的分析:这段建立了"预后价值有但量化难"的核心矛盾——AI 的价值在于自动化量化减少变异。但"预后价值"本身的争议(vulnerable plaque 概念争议)在后文才展开
段落 3:本 Roadmap 的范围与方法¶
- 核心论点:本 Roadmap 聚焦 CCTA、IVUS、OCT 三种最先进模态,用 Delphi 共识法汇集多学科专家意见
- 支撑论据:
- 作者聚焦 CCTA、IVUS 和 OCT 三种最先进的成像模态,并讨论 bias、可解释性、不确定性和泛化性四个可信 AI 维度
- 共识采用 Delphi 方法,与首个 QCI(Quantitative Cardiovascular Imaging)会议在心肌缺血影像上达成共识时使用的方法类似(Dewey et al., 2020, Nat Rev Cardiol)
- 第二次 QCI 会议于 2022 年 9 月召开,采用三轮 Delphi 问卷法评估不同成像模态的临床适当性
- 首轮无共识后启动第二轮 Delphi 过程,增加两轮以达成共识;问卷发送给 14 位直接参与心血管影像 AI 工具研发的科学家和医师
- 共 15 个问题,采用 Likert 1–9 量表、分类回复或自由文本形式作答,每题附推理说明
-
共识程度按标准化参数定义:<0.6 无共识,0.6–0.8 部分共识,≥0.8 共识;序数尺度跨模态平均,名义尺度采用归一化熵(Tastle & Wierman, 2006, Behav Res Methods)
-
我的分析:Delphi 方法的透明度是优势——但 14 位专家的代表性可能受限(偏向欧洲和北美)。共识阈值(≥0.8)合理但"no consensus"的问题(Q4、Q9)恰恰是最重要的临床问题
The concept of vulnerable plaque imaging¶
段落 1:易损斑块的特征与争议¶
- 核心论点:易损斑块有特定特征(大坏死核心+薄纤维帽 TCFA),与不良结局关联,但斑块破裂常无症状且阳性预测值低
- 支撑论据:
- 急性冠脉综合征在多数患者中由冠脉粥样硬化斑块破裂或侵蚀触发(Finn et al., 2010, Arterioscler Thromb Vasc Biol)
- 易损斑块具有特定病理特征:大坏死核心 + 薄纤维帽(thin-cap fibroatheroma, TCFA),这些特征可通过多种成像模态可视化
- 多项临床研究(包括侵入性和非侵入性技术)发现易损斑块与患者不良结局之间存在关联(Vázquez Mézquita et al., 2023, Nat Rev Cardiol;Gaba et al., 2023, Nat Rev Cardiol)
- 然而病理和临床影像研究一致表明,这些易损斑块破裂常常不伴随临床综合征,而是斑块进展的固有部分(Arbab-Zadeh & Fuster, 2015, JACC)
- Yamamoto et al. (2020, JACC) 证实对富含脂质和非富含脂质冠脉斑块进行支架置入是安全的,但目前缺乏支持局部治疗易损斑块的证据
-
阳性预测值低:即使检出易损斑块特征,目前也无法预测哪些患者会发生斑块进展并最终导致主要不良心血管事件
-
我的分析:作者诚实呈现了 vulnerable plaque 概念的争议——这是本领域的核心未解问题。PPV 低意味着即使检出易损斑块也无法确定哪些会进展为事件
段落 2:成像模态的优劣¶
- 核心论点:CCTA 是最佳非侵入性模态但受辐射和运动/钙化影响;OCT 是唯一能识别 <0.065mm 薄帽的模态但侵入性
- 支撑论据:
- 冠脉粥样硬化斑块可通过多种侵入性和非侵入性模态评估:CT 和 MRI 提供非侵入性结构成像;X 射线冠脉造影、IVUS、OCT 和 NIRS 为侵入性技术
- OCT 和 IVUS 在分辨率上优于 CT,但这些侵入性模态的可得性有限
- PET 是唯一允许通过放射性示踪剂摄取非侵入性评估冠脉斑块生物学的模态(Joshi et al., 2014, Lancet),但其可得性同样有限
- CCTA 可识别定性高危斑块特征(如 napkin-ring sign)并量化总斑块负荷;CCTA 衍生的斑块量化与 IVUS 评估相关性良好(Matsumoto et al., 2019, Eur Radiol;Conte et al., 2020, Eur Heart J Cardiovasc Imaging)
- 低衰减斑块与粥样斑块的脂质坏死核心相关,并与不良结局关联(Williams et al., 2019, JACC)
- CCTA 存在中度辐射暴露,且图像质量可能受心脏运动或冠脉钙化影响
- OCT 是目前唯一具有足够空间分辨率以识别真实 TCFA 所定义薄帽(<0.065 mm)的成像模态(Aguirre et al., 2021, JACC)
-
侵入性技术无法用于评估严重狭窄病变、小口径血管或深部斑块结构;且费用高昂、可能引起严重并发症,因此不适合大规模人群应用
-
我的分析:模态间的 trade-off 清晰——非侵入(CCTA,低分辨率)vs 侵入(OCT/IVUS,高分辨率)。AI 的价值在于弥合——从低分辨率 CCTA 提取更多特征
段落 3:预后价值——SCOT-HEART vs ISCHEMIA 矛盾¶
- 核心论点:SCOT-HEART 证明低衰减斑块负荷 >4% 与 5 倍 MI 风险关联,但 ISCHEMIA 初步结果未发现低衰减斑块独立预测价值(调整总斑块负荷后)
- 支撑论据:
- TCFA 经 IVUS 或 OCT 识别后,在多项前瞻性研究中与较差结局关联:Cheng et al. (2014, Eur Heart J) ATHEROREMO-IVUS、Calvert et al. (2011, JACC) VIVA、Prati et al. (2020, Eur Heart J) CLIMA
- CCTA 上视觉可识别的易损斑块与后续不良心脏事件风险增加关联:Motoyama et al. (2015, JACC) 注册研究、Ferencik et al. (2018, JAMA Cardiol) PROMISE 试验、Ferencik et al. (2015, JCCT) ROMICAT II 试验
- PROMISE 试验(Ferencik et al., 2018, JAMA Cardiol)中,疑似冠心病患者的 15% 存在易损斑块,在校正心血管危险因素后与主要不良心血管事件风险增加近两倍关联;但该研究未校正总体疾病负荷
- PROSPECT 研究(Stone et al., 2011, NEJM):IVUS 测量的斑块负荷 ≥70% 和最小管腔面积 ≤4.0 mm² 独立预测急性冠脉综合征患者的疾病进展和随访期间复发性胸痛
- SCOT-HEART 试验(Williams et al., 2020, Circulation):CCTA 上的低衰减斑块负荷是 MI 的强预测因子,超越心血管风险评分、钙化评分和狭窄存在;低衰减斑块负荷 >4% 的患者发生后续 MI 事件的可能性约为负荷 ≤4% 患者的五倍
- ISCHEMIA 试验初步结果(Min et al., 2021, Circulation 摘要 17195):调整总斑块负荷后,低衰减斑块未预测死亡或 MI,与 SCOT-HEART 结论矛盾
-
目前易损斑块特征的阳性预测值低,无法预测哪些患者会发生最终导致主要不良心血管事件的斑块进展
-
我的分析:SCOT-HEART vs ISCHEMIA 的矛盾是核心未解问题——可能因为 ISCHEMIA 入选了更晚期患者(总负荷更高掩盖了低衰减的独立效应)。这提示 AI 需要超越单一特征,整合多维信息
AI for vulnerable plaque assessment¶
段落 1:AI/ML/DL 定义与 radiomics¶
- 核心论点:CNN 是最常用的影像分析 DL 架构;radiomics 提取大量人眼不可见的定量特征用于精准表型
- 支撑论据:
- AI 旨在模仿人类认知执行物体/模式识别等任务,已应用于医学影像领域(Hosny et al., 2018, Nat Rev Cancer)
- 机器学习是 AI 的子领域,通过监督或无监督学习使算法从经验中自动学习和改进;深度学习使用多层人工神经网络直接从输入进行预测
- 深度学习在心血管影像领域仅在过去约 7 年中出现(Hampe et al., 2019, Front Cardiovasc Med),但已加速了易损斑块评估及前置任务(管腔和斑块分割)的研究
- CNN 是最常用的图像分析深度学习网络,包含多个卷积层以生成特征图;U-Net 和卷积 LSTM 网络等标准模型以及专用网络已被应用于易损斑块分割(Lin et al., 2021, Radiol Cardiothorac Imaging;Hampe et al., 2022, Front Cardiovasc Med)
- radiomics 从医学图像中提取大量定量特征(形状、纹理、灰度统计),大多数特征人眼不可见,可描述给定感兴趣区(如分割的冠脉斑块)内体素间的复杂空间关系
-
ML 方法可执行精准表型分析并基于 radiomic 模式构建预测模型:Kolossváry et al. (2017, Circ Cardiovasc Imaging) 证实 CCTA radiomics 改善 napkin-ring sign 识别;Lin et al. (2022, JACC Cardiovasc Imaging) 证实 radiomics 精准表型可识别不稳定冠脉斑块;Chen et al. (2023, Radiology) 证实 radiomics 模型可识别易损斑块并预测心血管事件
-
我的分析:AI/ML/DL 定义标准但适合非技术读者。radiomics 的"不可见特征"概念有价值但也带来可解释性问题——这些特征的临床意义往往不明
段落 2:非侵入性评估——自动化钙化评分与中心线提取¶
- 核心论点:automated calcium scoring 在非对比 CT 和低剂量胸部 CT 上与人工量化一致性优秀;中心线提取是斑块分析的前置步骤
- 支撑论据:
- 非对比 CT 上的自动冠脉钙化量化(van Velzen et al., 2020, Radiology)和低剂量胸部 CT 上的自动钙化量化与人工量化在风险分层方面一致性优秀
- CCTA 上的自动钙化量化与传统非对比 CT 衍生的 Agatston 评分一致性良好(Wolterink et al., 2016, Med Image Anal;Föllmer et al., 2022, Med Phys)
- Motwani et al. (2017, Eur Heart J) 的 5 年多中心前瞻性注册研究证实机器学习整合患者和 CCTA 特征可预测全因死亡率
-
检测钙化和非钙化斑块及狭窄的方法通常需要生成冠脉动脉中心线以便分析动脉及其邻近区域;已开发多种自动或半自动方法用于冠脉树提取、斑块分割和狭窄分级(Hampe et al., 2019, Front Cardiovasc Med;Jia & Zhuang, 2021, Comput Med Imaging Graph)
-
我的分析:automated calcium scoring 是 AI 最成熟的应用——已有多个 FDA 批准的产品(Table 2)。但中心线提取在解剖变异或重度钙化时仍不稳定
段落 3:易损斑块特征识别与 radiomics¶
- 核心论点:AI 识别低衰减、正性重构、点状钙化、napkin-ring sign;radiomics 提取的纹理/几何特征优于传统定量 CT 指标
- 支撑论据:
- AI 方法已被用于识别易损斑块特征,如正性重构、低衰减斑块、点状钙化和 napkin-ring sign(Lin et al., 2021, Radiol Cardiothorac Imaging)
- CCTA radiomics 改善了 napkin-ring sign 识别(Kolossváry et al., 2017, Circ Cardiovasc Imaging)和其他易损斑块特征的检测(Murgia et al., 2020, Cardiovasc Diagn Ther)
- 机器学习技术识别了与急性冠脉综合征罪犯病变相关的影像生物标志物(Lin et al., 2022, JACC Cardiovasc Imaging)
-
Al'Aref et al. (2020, JACC Cardiovasc Imaging) 使用 XGBoost 提升集成算法结合定性和定量斑块 radiomics 特征识别高危患者的 ACS 罪犯病变前兆,其检测罪犯病变的性能优于直径狭窄、CCTA 相关高危斑块特征和病变级别特征等传统指标
-
我的分析:radiomics 优于传统指标是预期——但 radiomics 特征的跨中心可重复性是关键未解决问题。不同扫描仪/重建参数/对比剂浓度会改变 radiomics 特征
段落 4:多模态斑块评估与风险预测¶
- 核心论点:ML 整合患者临床数据+斑块特征+多模态数据(CCTA+PET)优于单一指标预测 MI 和全因死亡率
- 支撑论据:
- Motwani et al. (2017, Eur Heart J) 多中心前瞻性注册研究:LogitBoost 算法整合患者、临床和斑块特征,5 年全因死亡率预测准确性优于单独使用临床或 CCTA 指标
- Al'Aref et al. (2020, JACC Cardiovasc Imaging) XGBoost 集成算法结合定性和定量斑块 radiomics 特征识别 ACS 罪犯病变,优于直径狭窄等传统指标
- 多项研究使用机器学习结合斑块大小、几何和密度特征识别心肌缺血(Diaz-Zamudio et al., 2015, Radiology;Yang et al., 2021, JACC Cardiovasc Imaging;von Knebel Doeberitz et al., 2019, Eur Radiol;Coenen et al., 2018, Circ Cardiovasc Imaging)
- Dey et al. (2018, Eur Radiol) 254 例多中心试验:LogitBoost 整合临床数据与定量和定性斑块特征检测病变特异性缺血(FFR 定义),AUC 0.84,优于定量狭窄(AUC 0.76)、总斑块体积(AUC 0.74)和 CAD 临床前期可能性(AUC 0.63)
-
Kwiecinski et al. (2022, J Nucl Med):极端梯度提升整合临床数据、定量 CCTA 斑块分析和 ¹⁸F-NaF PET 冠脉斑块活性测量,预测已确诊 CAD 患者的 MI,最佳模型 AUC 0.85(结合临床+CCTA+PET)
-
我的分析:多模态整合是 AI 的核心优势——但 ¹⁸F-NaF PET 的可及性远低于 CCTA,临床推广受限。AUC 0.84-0.85 优秀但不足以单独决定临床干预
段落 5:Deep learning 多中心斑块量化¶
- 核心论点:多中心研究(n=921)中 deep learning 系统在 5.7s 内完成斑块分析(vs 25.7min 人工),与 IVUS 一致性好,且 total plaque volume ≥238mm³ 与 5 倍 MI 风险关联
- 支撑论据:
- Lin et al. (2022, Lancet Digit Health) 国际多中心研究纳入 921 例接受 CCTA 的患者,开发和验证了深度学习卷积网络用于 CCTA 衍生的斑块体积和狭窄严重程度测量
- 深度学习系统在所有患者中训练斑块分割,并在 >200 例测试集中验证,其中包括 50 例在 CCTA 后 1 个月内接受冠脉 IVUS 的患者
- 深度学习系统完成斑块分析的时间(5.7 s)显著短于专家读者(25.7 min),且两组测量值之间一致性良好或优秀
- 深度学习衍生测量值与专家测量值在总斑块体积和最小管腔面积方面与 IVUS 一致性优秀,在狭窄严重程度分类方面同样一致(Canan et al., 2020, Radiographics 对 CAD-RADS 分类)
-
在 SCOT-HEART 试验的 1,611 例外部队列中进一步验证预后价值:深度学习衍生的总斑块体积 ≥238 mm³ 与 MI 风险增加五倍关联,为阻塞性狭窄存在和临床风险评分增加预后价值
-
我的分析:这是本综述最有说服力的单一研究——多中心、大样本、与 IVUS 对照、外部预后验证。5.7s vs 25.7min 的时间节省是临床转化的强动力。但"≥238mm³ → 5 倍 MI"是观察性关联不是因果
段落 6:侵入性评估——OCT 自动分割¶
- 核心论点:OCT 的 AI 分割已实现毫秒级实时分析;A-line 分类和 pixel-based DL 是两种主要方法
- 支撑论据:
- 深度学习方法可在毫秒级完成精确且非常快速的 OCT 分割(Chu et al., 2021, EuroIntervention),使人机交互实时分析成为可能并提升信任和用户接受度
- A-line 分类方法(Lee et al., 2020, Sci Rep;Lee et al., 2020, Proc SPIE;Cheimariotis et al., 2021, Appl Sci)将横截面纵向重排并在每条 A 线上环形分类斑块,利用 OCT 导管发射光线的自然方向,独立于脂质斑块完全光衰减导致的外弹力膜不可确定问题
- A-line 技术允许纤维帽检测和量化,仅 5.5% 的帧需要手动调整(Lee et al., 2022, Sci Rep)
- 像素级深度学习允许在横截面上分割单个斑块成分并纳入 3D 空间信息;U 形神经网络自动分割单个 OCT 帧耗时 0.07 ± 0.01 s,平均 Dice 相似系数 0.764,对高危斑块成分(如巨噬细胞积累)的精度低于整体斑块分割(Chu et al., 2021, EuroIntervention);外部验证队列的区域分割和表征总体诊断准确率为 86.6%
- Lee et al. (2019, Biomed Opt Express) 基于 CNN 的像素级方法对脂质和钙化斑块识别的敏感性和特异性均 >85%
- Min et al. (2020, EuroIntervention) DenseNet 模型分类 OCT 衍生 TCFA,内部验证集约 10,000 帧中 AUC 0.96;但帧级假阳性率 6%,血管级假阳性率 31%;pullback 分析时间 2.1 ± 0.3 s vs 人工 289 ± 270 s
-
Holmberg et al. (2021, Front Cardiovasc Med) 证实组织学+OCT 联合训练优于单纯 OCT 训练
-
我的分析:OCT 的 AI 进展比 IVUS 快——因为 OCT 分辨率更高且图像更清晰。但 vessel-level 31% 假阳性率是实际问题——意味着每个 vessel 的约三分之一 TCFA 诊断是误报。组织学联合训练的改进提示多模态学习是未来方向
段落 7:侵入性评估——IVUS 自动分割¶
- 核心论点:IVUS 的 AI 分析受低分辨率限制,但 deep learning TCFA 检测 AUC 达 0.84-0.91
- 支撑论据:
- IVUS 的图像方法受限于低空间分辨率,因此大多数算法采用二值逐帧或环形斑块分割(Cho et al., 2021, Atherosclerosis;Jun et al., 2019, Med Biol Eng Comput)
- Jun et al. (2019, Med Biol Eng Comput) 基于深度学习的斑块分析结合特征提取,以 OCT 为金标准识别 TCFA,AUC 达 0.84–0.91
-
Cho et al. (2021, Atherosclerosis) 角度学习后,钙化斑块和衰减识别的 Dice 相似系数分别为 0.79 和 0.74(角度级别)
-
我的分析:IVUS 的 AI 发展滞后于 OCT——低分辨率限制了 pixel-based 方法。但 AUC 0.84-0.91 的 TCFA 检测性能可接受,尤其考虑到 IVUS 比 OCT 更广泛可用
段落 8:AI 工具的商业化可用性¶
- 核心论点:研究 AI 工具丰富但临床商业产品有限;CT 钙化评分产品最多,CCTA 斑块分析产品逐渐出现,OCT 仅 Abbott Ultreon 获批
- 支撑论据:
- 虽然大量用于评估冠脉斑块的方法已被开发并用于研究,但这些方法在临床实践中并未广泛可用
- 已发表的科研论文通常不提供源代码、数据或训练模型的公开仓库访问,阻碍了可复现性分析
- QCI 专家组就学术研究中 AI 工具用于斑块评估的当前可用性达成部分共识
- 通过分析 AI 和机器学习医疗器械数据库(Muehlematter et al., 2021, Lancet Digit Health;Wu et al., 2021, Nat Med;FDA AI/ML 医疗器械列表)识别相关研究工具和 CE/FDA 认证产品
- 自动钙化评分分析在 ECG 同步或非 ECG 同步 CT 中已在多个心血管影像软件产品中建立
- 多数可用的软件包包含组织类型和解剖结构(如血管壁和管腔)的自动分割工具,但根据图像质量和解剖变异,仍常需人工校正(如中心线校正、血管壁调整、管腔或斑块分割)
-
最新 OCT 软件包包含管腔、支架、外弹力膜和钙化检测,部分甚至包含 AI 斑块评估,但目前 AI 斑块评估仅可用于研究目的
-
我的分析:代码/数据不公开是 AI 医学影像领域的系统性问题——限制了独立验证和学术审查。FDA 510(k) 的 substantial equivalence 逻辑也意味着 AI 产品无需证明优于标准护理
Challenges with AI tools in clinical practice¶
段落 1:数据与标注挑战¶
- 核心论点:大型多样化标注数据集缺乏是 AI 开发的核心瓶颈;AI 在高质量研究数据上训练后在真实世界低质量图像上 underperform
- 支撑论据:
- AI 在心血管影像中是新兴技术,其在易损斑块影像中的未来收益难以预测(Nicol et al., 2023, JACC Cardiovasc Imaging;Nicol et al., 2022, JCCT)
- 临床 AI 工具开发的主要挑战是大型、多样化、匿名化和标注数据集的可用性,这些数据集需具有可用的结局数据以用于测试、训练和验证
- AI 开发所需的大规模图像收集、整理和标注非常耗时;标注质量是重要关切,所需专业知识取决于具体任务
- AI 工具必须在外部验证数据集和临床结局上测试以确保其在更广泛人群中的泛化性
- 许多 AI 工具在经过精心筛选和标注的高质量图像数据集上训练,因此在真实世界临床实践中表现不佳
- 图像伪影和图像采集变异可能阻碍 AI 工具的使用或导致不准确或不可靠的输出
-
图像采集标准化可辅助 AI 开发,包括一致的命名、重建算法的一致性和结构化报告
-
我的分析:这是 AI 医学影像领域的"domain shift"问题——训练分布与部署分布不一致。解决方案(transfer learning、data augmentation、多域训练数据)都有局限——特别是标注数据在目标域也稀缺
段落 2:可解释性与 RCT 缺乏¶
- 核心论点:AI 需要可解释性才能被临床信任;但 RCT 严重不足且报告质量差
- 支撑论据:
- 临床使用的 AI 工具必须以临床医生能够理解和信任的方式提供结果;机器学习模型可能生成结果概率,但 AI 工具通常不传达此结果
- 提高可解释性的方法(即可解释 AI)包括专用模型、事后评估、特征重要性和图形可视化
- 代码、数据和模型共享可帮助其他研究者复现研究结果并促进临床采纳,但在数据隐私和数据研究使用方面可能具有挑战性
- 大规模前瞻性 RCT 评估心血管影像 AI 工具临床效用尚未开展(Zhou et al., 2021, NPJ Digit Med)
- 对于某些任务(如分割),可能不需要 RCT;但对于许多可影响后续患者管理的任务,AI 工具必须满足与其他医疗治疗相同的临床标准,并评估疗效和成本效益
- Plana et al. (2022, JAMA Netw Open) 2022 系统评价仅发现 41 项医学 AI 工具 RCT,无一遵循标准化报告指南,其中 7 项试验的偏倚风险较高
-
评估 AI 工具能力的指标选择以及 AI 研究标准化报告指南的使用至关重要
-
我的分析:41 个 RCT 对比医学影像 AI 的巨大研究量意味着 <1% 的研究进入 RCT 阶段——大量验证停留在回顾性研究。Q9 无共识反映了专家对"何时需要 RCT"的分歧——分割任务可能不需要但影响管理的任务必须
Trustworthy AI¶
段落 1:可信 AI 的定义与框架¶
- 核心论点:可信 AI 必须合法、伦理、技术和社会鲁棒;支持决策而非自主决策;提供透明无偏的建议
- 支撑论据:
- 根据 EU 伦理指南(European Commission, 2019),可信 AI 必须在技术和社会层面上合法、伦理和鲁棒
- 在临床 AI 解决方案背景下,这些工具应支持决策而非自主决策,鲁棒且安全,并提供透明和无偏的建议
- 满足这些标准可使 AI 解决方案最大化临床医生和患者的收益,同时最小化患者风险
- 临床部署期间,AI 解决方案的鲁棒性和安全性应在准确性、可靠性和可重复性方面确定
- 可信性不仅取决于技术方面,还取决于影响其在真实世界环境中性能的人为因素
- 这要求根据既定报告指南对 AI 解决方案进行全面和透明的评估
-
Box 1 系统列出了三大维度要求:鲁棒 AI(技术和临床鲁棒性、可靠性、安全性、实时决策、泛化性、置信度传达如 95% CI 和 heatmap);伦理和公平 AI(安全性、隐私和安全、透明度、公平和包容性、无偏模型、解释和解释);合法 AI(CE/FDA 认证、GDPR、医疗器械法规)
-
我的分析:Box 1 是本综述最有价值的贡献之一——提供了系统性 checklist。但各要求缺乏具体度量标准——"鲁棒"到什么程度才算够?"可解释"到什么程度才算透明?
段落 2:评估指南与不确定性量化¶
- 核心论点:STARD-AI/DECIDE-AI/CONSORT-AI 提供了 AI 评估的报告框架;不确定性量化(如 95% CI)和可视化(heatmap)是传达模型置信度的必要手段
- 支撑论据:
- 临床部署前应使用 STARD-AI 指南评估诊断准确性(Sounderajah et al., 2021, BMJ Open)
- DECIDE-AI 指南包含在临床部署早期阶段评估工具诊断准确性的建议(Vasey et al., 2022, Nat Med)
- CONSORT-AI 指南用于 RCT 背景下评估 AI 解决方案(Liu et al., 2020, Nat Med)
- 何时需要 RCT 验证临床有效性和优于标准护理的优势、何时回顾性研究足以评估简单人类任务(如分割任务),在专家中存在争议
- 临床部署中,AI 解决方案应以适当方式(理想情况下为定量方式)增加对建议的信心,使临床医生能够轻松解释其输出
-
Q10 部分共识要求:经过良好校准和可靠的定量测量(如 95% 置信区间);需要视觉方法(如 heatmap)以确保解释的清晰度;低置信度应警示医师可能需要进一步检查
-
我的分析:三个指南的层次设计合理(诊断精度→早期部署→RCT),但都是新提出的尚未被广泛采用。不确定性量化的 partial consensus 反映了技术挑战——DL 模型的 calibration 仍不成熟
Explainability, interpretability and generalizability¶
段落 1:可解释性 vs 可解释度¶
- 核心论点:AI explainability(检查模型内部确认输出)和 interpretability(形式化因果关联)不同;在斑块影像中需要 editable contours 和 probability visualization
- 支撑论据:
- AI explainability 指检查 AI 模型内部以确认其输出;AI interpretability 更正式地将因果关系联系起来,使模型输出始终可追溯到模型输入
- 这些标准包含在 EU 伦理指南(European Commission, 2019)和 WHO 健康人工智能伦理和治理指南(WHO, 2021)中,作为确保 AI 开发和部署中透明度和公平性的一部分
-
在粥样硬化斑块影像背景下,可使用分割模型的可编辑轮廓或输出概率分布可视化来提供决策信息
-
我的分析:explainability vs interpretability 的区分重要但过于理论化——临床医生更关心"这个 AI 给出的斑块体积有多可信"而非模型内部机制
段落 2:泛化性与 domain shift¶
- 核心论点:训练数据质量变化导致预测偏差——energy-integrated detector 训练的模型在 photon-counting CT 上可能失效
- 支撑论据:
- AI 斑块分析模型需要仔细创建和管理训练数据集以确保泛化性
- 输入数据质量变化可能对预测产生不良影响,例如在质量受控的研究数据上训练的模型应用于各种临床情况下获取的临床数据,或使用不同成像技术
- 具体例子:在能量积分探测器获取的数据集上训练的粥样硬化斑块分析 AI 软件在应用于光子计数 CT 数据集时可能失效
- 处理这些域偏移的解决方案包括(Ugurlu et al., 2022, Springer):迁移学习(在新数据小子集上重新训练模型);数据增强(通过模拟新域属性);使用来自多个域的训练数据;以及这些技术的组合
- 不同经验水平和专业知识的放射科医师对斑块的标注差异也可导致模型性能差异;应报告模型输出不确定性以通知临床医生重新审视其发现,或在模型训练中纳入标注不确定性以获得更鲁棒的输出
-
QCI 专家组达成共识:训练数据集中需要多个观察者以补偿观察者间变异并提供泛化性,且可支持不确定性估计过程
-
我的分析:photon-counting CT 的出现是 domain shift 的具体例子——新一代扫描仪改变了图像特征分布。transfer learning 需要目标域标注数据,而 data augmentation 难以精确模拟真实域偏移
Fairness and bias mitigation¶
段落 1:偏倚来源与缓解¶
- 核心论点:AI 可放大健康差距——数据偏倚(代表性不足)和算法偏倚(部署中的系统性错误)是两大来源
- 支撑论据:
- 数据驱动的 AI 解决方案容易受到偏倚影响,可能放大医疗保健差距(Adamson & Smith, 2018, JAMA Dermatol;Obermeyer et al., 2019, Science;Seyyed-Kalantari et al., 2021, Nat Med)
- 在冠脉易损斑块影像背景下,偏倚可能源于系统性错误,如某些患者亚组的过度或不足代表性、高危患者的过度代表性,或将 AI 解决方案应用于初始训练中未包含的亚组(如在急性胸痛患者中训练的模型应用于稳定胸痛患者)
- 训练数据集中的不平等代表性可特别影响少数民族和其他少数群体,如果这些群体未包含在训练数据集中,AI 解决方案可能在这些群体中表现不佳(Bavli & Jones, 2022, NEJM)
- 两大主要偏倚来源:用于训练 AI 算法的数据;AI 算法的实施和部署(Bernhardt et al., 2022, Nat Med;Suresh & Guttag, 2021, ACM)
- 表征偏倚可在训练数据收集或预处理阶段通过少数群体的重新加权或重采样或数据增强来解决
- 理想情况下,用于训练 AI 算法的临床数据应基于大规模临床试验数据,采用务实试验设计并具有最小排除标准以确保高外部有效性
- 训练中使用的特征可调整以不与敏感属性相关,或使用对抗学习方法去偏;AI 解决方案开发后可使用校准均衡奇数等技术减少性能偏倚
-
Q11 部分共识要求:AI 工具应在大型和多样化人群上开发和测试以确保泛化性;应明确证明 AI 工具在非代表性人群方面的局限性;应评估和量化偏倚;数据集中的偏倚应通过添加或加权少数样本来缓解
-
我的分析:偏倚缓解的讨论停留在概念层面——无具体案例说明斑块影像 AI 中的偏倚如何表现。对于冠状动脉斑块影像,代表性不足的群体可能包括女性、非白人族裔、老年人——这些群体在训练数据中的比例未讨论
Conclusions¶
段落 1:总结与展望¶
- 核心论点:AI 有潜力变革斑块评估但在全自动化临床整合前需解决可重复性、鲁棒性、泛化性和可靠性;需要大规模多样化数据和 RCT 验证;可信 AI 系统(安全、透明、公平、可解释)是前提
- 支撑论据:
- 冠脉斑块负荷和类型是重要的预后标志物,可指导患者管理;多种非侵入性和侵入性成像模态可用于评估斑块并识别易损斑块
- AI 革命和围绕 AI 的炒作激励临床医生和科学家开发自动化评估易损斑块的工具
- AI 有潜力通过改善速度和准确性来变革斑块评估,但在完全自动化 AI 工具整合到临床实践之前,必须解决众多技术挑战,包括可重复性、鲁棒性、泛化性和可靠性
- AI 工具必须在大型和多样化数据集上评估
- 研究中的 AI 工具在各种斑块评估任务中已达到接近人类的性能,但主要在小规模、预选和偏倚的研究人群中验证
- 经批准商业软件解决方案的临床效用和成本效益 RCT 证据仍然缺乏
- 开发和评估安全、透明、公平、可解释和可解释的可信 AI 系统的概念仍然有限,需要适应易损斑块评估
-
Dewey & Wilkens (2019, NPJ Digit Med) 提出 AI 系统应与医师密切合作以促进冠脉易损斑块影像,而非替代临床医生
-
我的分析:结论平衡——承认潜力但列出具体条件。"研究中接近人类表现但小/预选/偏倚人群"是关键 caveat——真实世界性能可能显著下降。将 AI 定位为"physician collaboration tool" 而非替代是合理的
摘要概述¶
本文是由 14 位心血管影像与 AI 专家通过两轮 Delphi 共识法(第二轮共 15 题)撰写的 Roadmap,系统梳理了 AI 用于冠状动脉易损斑块(vulnerable plaque)成像的现状与未来要求。覆盖 CCTA、IVUS、OCT 等主要模态,指出 AI 在分割、斑块特征提取、风险分层上已接近人类表现,但仍受限于数据偏倚、可重复性、可解释性与泛化性。强调当前商用方案均未经大规模 RCT 验证,临床落地前必须建立 trustworthy AI(安全、透明、公平、可解释)框架。
关键图表¶
- Fig. 1 | AI / 机器学习 / 深度学习层级关系示意图。一句话:明确了医学 AI 的概念边界——deep learning 是 ML 的子集,ML 是 AI 的子集,本文聚焦 DL 在心血管影像的应用。
- Fig. 2 | CCTA、IVUS、OCT 三模态下的易损斑块特征对照(lipid core、necrotic core、thin fibrous cap、napkin-ring sign、spotty calcification、positive remodelling)。一句话:把同一病理概念在三种分辨率/模态下的成像表现并排呈现,是 AI 训练标签设计的核心参考。
- Fig. 4 | AI 临床落地路线图(临床证据 → AI 革命 → 技术挑战 → 研究期工具 → 证据驱动的 trustworthy AI)。一句话:标出当前处于"研究工具多、经 RCT 验证的商用方案为零"的阶段,后续需补 bias/explainability/generalizability。
与我的关联¶
本课题关注血管 G&R 与斑块力学,该 Roadmap 提供了 AI 用于斑块形态学自动定量的最新共识与缺口清单——可作为"影像数据驱动建模"方向的需求侧参考,特别是 AI 分割输出(plaque burden、TCFA 几何)能否作为力学模型的输入边界条件,以及 trustworthy AI 框架对生物力学参数可解释性的要求。