A proteomic surrogate for cardiovascular outcomes that is sensitive to multiple mechanisms of change in risk¶
Williams, Stephen A.; Ganz, Peter; Ostroff, Rachel et al. · 2022 · Sci. Transl. Med.
Metadata
Authors: Williams, Stephen A.; Ganz, Peter; Ostroff, Rachel; Coresh, Josef; Ballantyne, Christie M.
摘要概述¶
本研究利用 SomaScan 修饰适配体蛋白质组学平台在 9 项临床研究的 22,849 名受试者共 32,130 份血浆样本中测量约 5000 种蛋白质,通过机器学习(LASSO + Weibull AFT 模型)构建了 27 蛋白质心血管风险预测模型,预测 4 年内心肌梗死、卒中、心衰住院或全因死亡的复合终点。模型在 11,609 人的独立验证 meta-cohort 中表现优于临床模型(AUC 0.73 vs 0.64,五分位事件比 6.7 vs 2.9,NRI +0.43),且对 15 种已知改变心血管风险的因素(衰老、化疗、减重、exenatide 等)方向性一致地响应。27 个蛋白质涵盖至少 10 类生物学过程,其中 12 个通过孟德尔随机化分析与心血管因果遗传性状关联。最大限制在于校准在低事件率人群中高端过预测,且 FDA 尚未正式认定其作为替代终点的资格。
建模问题与尺度¶
- 目标问题:构建一个个体化、动态的心血管风险替代终点(surrogate end point),可预测 4 年内心肌梗死、卒中、心衰住院或全因死亡的复合终点绝对风险,并对多种机制的风险变化方向性敏感(Abstract;§ Introduction, PDF p.1-2)。
- 空间尺度:个体层面,基于血浆蛋白质组(约 5000 种蛋白质测定)。
- 时间尺度:4 年预测窗口;训练数据随访中位时间约 0.5-6.5 年(Table 1,mean follow-up 294-1136 天)。
- 状态变量与输出量:输入为 27 种蛋白质的 SomaScan 测量值(经各自训练集分布 centered and scaled);输出为 4 年复合终点绝对风险概率(0-100%),以及四个离散风险类别(low/low-medium/medium-high/high)。
- 与已有模型的差异:传统 PCE(Pooled Cohort Equation)和 Framingham 模型使用不可变的人口学+临床指标(年龄、性别、种族、胆固醇、血压、糖尿病、吸烟),对新型药物机制(如 SGLT2i、GLP-1 RA、canakinumab)的风险变化不敏感;蛋白质模型编码生物学机制信息,不使用种族变量,对风险变化方向性敏感(§ Introduction, PDF p.1-2;文献 3,4,6,15,17)。
假设与数学表述¶
核心假设¶
- 物理或生物假设:蛋白质整合了基因、环境、年龄、合并症、生活方式和药物的综合效应,蛋白质丰度/构象/电荷/表位可用性反映疾病相关生物学过程的状态;蛋白质是 95% 已知药物的靶点(§ Discussion, PDF p.10;文献 11,31,38)。
- 闭合假设:27 个蛋白质足以捕获主要心血管风险相关的生物学机制(涵盖 ≥10 类生物学过程),多变量模型比任何单一生物标志物更"通用"地整合风险(§ Discussion, PDF p.11-12;Table 3)。
- 数值便利假设:蛋白质测量经 centered and scaled 后作为线性预测器输入;采用全参数化 Weibull AFT 模型以提供时变绝对风险输出(§ Statistical methods, PDF p.12-13)。
Governing equations¶
- 方程定位:§ Development of the proteomic prognostic model, PDF p.6(lines 729-748)。
- 方程与耦合关系:见下方 Weibull AFT 生存函数及 27 蛋白线性预测器公式。
Weibull AFT 生存函数:
S(t|θ) = exp{−(θ·t)^a}
其中 a 为 Weibull 分布形状参数,â = 1.1;t 设为 4 年以生成 4 年内事件概率。
尺度参数 θ 为 27 蛋白质测量的线性组合的指数:
θ̂ = exp{−(2.83 + (−0.09)·TFF3 + (−0.23)·NTproBNP + (−0.05)·SVEP1 + 0.01·GDF-11/8 + (−0.02)·sTREM-1 + 0.09·IGDC4 + (−0.03)·NELL1 + (−0.14)·MMP-12 + 0.02·ATS13 + (−0.03)·suPAR + 0.13·CILP2 + 0.02·NDST1 + (−0.10)·Spondin-1 + 0.14·ANTR2 + 0.04·PTPRJ + (−0.07)·LRP11 + (−0.07)·ANP + (−0.07)·JAM-B + 0.08·SIRT2 + (−0.11)·CA125 + 0.10·CA2D3 + 0.03·ITI-HC2 + 0.11·ERBB3 + (−0.10)·GOLM1 + (−0.08)·PPR1A + 0.22·ARL11 + 0.10·NCAM-120)}
4 年事件概率 = 1 − S(4|θ̂)。每个分析物均按各自训练集分布进行 centered and scaling(Table 2 注释)。
- 守恒量或约束:不适用(统计预测模型,非物理守恒模型)。
初始条件、边界条件与约束¶
- 初始条件:血浆样本采集时(baseline)的 27 蛋白质 SomaScan 测量值。训练集为 HUNT3 secondary 80%(n=605)和 ARIC visit 5 secondary 20%(n=208),均为已知心血管疾病的二级预防人群(§ Statistical methods, PDF p.12-13;Table 1)。
- 边界条件:4 年预测时间窗口(t=4);复合终点定义为血样后首次发生的心肌梗死、卒中、心衰住院或全因死亡;血运重建被排除(§ Definition of the composite outcome, PDF p.12)。
- 约束:蛋白质选择流程——首先对训练集中所有蛋白质做单变量 Cox 模型,取 FDR < 0.1 的前 400 个最显著蛋白质;两个训练集交叉后 144 个共有蛋白质进入 LASSO Cox 正则化回归(10 折交叉验证,minimum lambda = 0.3);27 个非零系数蛋白质被选入最终 AFT Weibull 模型(§ Statistical methods, PDF p.12-13)。
- 特征选择约束:机器学习的有意偏差限制了相关特征的纳入,因此正式的统计生物学通路富集分析不适用(§ Biologic relevance, PDF p.2)。
参数及来源¶
| 参数 | 含义与单位 | 数值或范围 | 来源 | 可识别性或敏感性 |
|---|---|---|---|---|
| a (shape) | Weibull 分布形状参数,无量纲 | 1.1 | AFT 模型训练估计(PDF p.6) | 未报告 |
| β₀ (intercept) | 线性预测器截距,无量纲 | 2.83 | AFT 模型训练估计(PDF p.6) | 未报告 |
| β_NTproBNP | NTproBNP 线性预测系数,无量纲 | −0.23(population effect +0.23) | LASSO + AFT 训练(Table 2, PDF p.5) | 未报告 |
| β_ARL11 | ARL11 线性预测系数 | +0.22(population effect −0.22) | LASSO + AFT 训练(Table 2) | 未报告 |
| β_ANTR2 | ANTR2 线性预测系数 | +0.14(population effect −0.14) | LASSO + AFT 训练(Table 2) | 未报告 |
| β_MMP-12 | MMP-12 线性预测系数 | −0.14(population effect +0.14) | LASSO + AFT 训练(Table 2) | 未报告 |
| β_CILP2 | CILP2 线性预测系数 | +0.13(population effect −0.13) | LASSO + AFT 训练(Table 2) | 未报告 |
| β_ERBB3 | ERBB3 线性预测系数 | +0.11(population effect −0.11) | LASSO + AFT 训练(Table 2) | 未报告 |
| β_CA125 | CA125 线性预测系数 | −0.11(population effect +0.11) | LASSO + AFT 训练(Table 2) | 未报告 |
| λ (LASSO) | LASSO 正则化参数(minimum lambda) | 0.3 | 10 折交叉验证选择(PDF p.12) | 未报告 |
| CV (assay) | 27 蛋白质模型中位重现性 | 4.98% | 10 样本 9 次重复(table S10, PDF p.13) | 不适用 |
数值方法与计算流程¶
- 离散化、求解器、网格与时间步:不适用(非 PDE/网格模型)。流程为:(1) 对训练集中所有蛋白质做单变量 Cox 比例风险模型;(2) 取 FDR < 0.1 的前 400 个最显著蛋白质,两个训练集交叉后取 144 个共有蛋白质;(3) LASSO 正则化 Cox 回归(10 折交叉验证,minimum lambda=0.3)选择 27 个非零系数蛋白质;(4) 用 27 蛋白质训练全参数化 AFT Weibull 模型,输出 4 年绝对风险概率及四个离散风险类别(§ Statistical methods, PDF p.12-13)。
- 收敛性、稳定性与误差控制:10 折交叉验证用于 LASSO 特征选择稳定性;Weibull AFT 模型为全参数化模型,提供时变绝对风险;200 次 bootstrap 用于验证集中 AUC/c-statistic 的 95% 置信区间估计(§ Statistical analysis, PDF p.13)。
- 软件、版本和计算成本:R version 4.1.0;包及版本:pROC 1.17.0.1, survival 3.2-11, glmnet 4.1-1, rms 6.2-0(§ Statistical analysis, PDF p.13)。计算成本未报告。
校准、验证与不确定性¶
- 校准数据与目标函数:训练数据为 HUNT3 secondary 80%(n=605)和 ARIC visit 5 secondary 20%(n=208),均为已知心血管疾病的二级预防人群(事件率 27.4% 和 51.0%),选择高事件率人群以富集风险相关生物学机制。目标函数为 Weibull AFT 似然。校准评估使用 Hosmer-Lemeshow 拟合优度统计量(Fig. 2)。
- 验证数据:初始验证为 HUNT3 20%(n=139)和 ARIC visit 5 80%(n=784);后续独立验证 meta-cohort 包含 6 项研究共 11,609 人(BASEL VIII primary/secondary, EXSCEL placebo, ARIC elderly, CHART-2 因仅 2 年随访被排除);纵向配对样本来自 EXSCEL, ACCORD, PRADA, DiRECT;横断面风险检测在 ARIC visit 3(n=11,301,未用于训练/验证)(§ Study design, Table 1, Fig. 1, PDF p.2-4,12-13)。
- Identifiability/sensitivity:未报告正式的可识别性分析。人群层面各蛋白质贡献率为 1-23%(§ Development, PDF p.2);个体内各蛋白质贡献率有变异。模型对蛋白质选择的敏感性通过 LASSO 交叉验证间接评估。分析物 CV 范围 2.7-8.84%(Table 2)。
- 不确定性量化:AUC 和 c-statistic 的 95% 置信区间通过 200 次 bootstrap 估计(§ Statistical analysis, PDF p.13)。配对样本比较使用单尾配对 t 检验;生物标志物比较使用 Bonferroni 校正(6 次比较);横断面病例对照使用 Dunnett's 校正(§ Statistical analysis, PDF p.13)。
- 未验证部分:(1) PCSK9 抑制剂和 SGLT2i 药物类别未在纵向配对样本中测试(§ Discussion, PDF p.12);(2) Fig. 5 横断面流行病学评估未进行与现有风险因子的完全多参数调整比较(§ Discussion, PDF p.12);(3) FDA 尚未判定证据是否充分用于替代终点资格认定(§ Discussion, PDF p.12)。
核心结果与证据¶
主要发现 1:蛋白质模型的判别性能显著优于临床模型¶
- 模型结论或预测:27 蛋白质模型在 11,609 人独立验证 meta-cohort 中 4 年 AUC 为 0.73(95% CI: 0.72-0.74),c-statistic 为 0.71(0.69-0.72),显著优于重新拟合的临床模型 AUC 0.64(0.62-0.65)和 c-statistic 0.62(0.60-0.63),也优于标准 PCE(AUC 0.67, c-statistic 0.63)。将 PCE 与蛋白质模型结合仅带来 0.02 AUC 和 0.01 c-statistic 的增量改善,暗示蛋白质模型已编码了临床模型所携带的生物学信息。
- 证据定位:Abstract;§ Consistency of performance, PDF p.6-7;Fig. 4, PDF p.9。
- 参数条件:验证 meta-cohort n=11,609(4 年事件率 21.9%,2,540 事件);临床模型在 n=5,593 有完整组件的子集中计算;蛋白质模型在全部 11,609 人中计算。
- 验证程度:验证。在 6 项独立研究的 meta-cohort 中验证;在性别、种族/民族、年龄、地理区域和合并症亚组中表现一致(Fig. 4)。
- 替代解释:AUC 0.73 虽显著优于临床模型,但仍远非完美;采样后 4 年内的环境/药物/行为变化可能改变风险,使得任何预测模型的"天花板"不可知(§ Discussion, PDF p.12)。
主要发现 2:四个预定义风险类别具有显著的事件率分层¶
- 模型结论或预测:四个蛋白质定义的风险类别在验证 meta-cohort 中的 4 年观察事件率分别为 5.6%(low,预测 0-7.5%,n=1,677)、11.2%(low-medium,预测 7.6-25%,n=4,720)、20.0%(medium-high,预测 26-50%,n=3,064)和 43.4%(high,预测 51-100%,n=2,148)。事件者的中位事件时间为 1.71 年(总体),最高五分位 1.48 年,最高十分位 1.40 年。五分位最高/最低组观察事件比为 6.7(蛋白质模型)vs 2.9(临床模型)。NRI 为 +42%(total NRI +0.43)。
- 证据定位:§ Predicted and observed event rates, PDF p.6;Fig. 2, PDF p.7;Fig. 3, PDF p.8;§ Dynamic range of stratification, PDF p.6。
- 参数条件:验证 meta-cohort n=11,609;临床模型比较子集 n=5,593。四类别截断值设计为具有不重叠置信区间且易于沟通的风险倍数。
- 验证程度:验证。Kaplan-Meier 生存曲线确认四个类别间分层(Fig. 3A);各独立研究间校准一致性良好(Fig. 3B)。
- 替代解释:在低事件率人群的高端存在过预测倾向,可通过后校准缓解(fig. S1)。低端和中端范围校准合理(§ Discussion, PDF p.12)。
主要发现 3:模型对多种机制的风险变化方向性敏感("通用性")¶
- 模型结论或预测:在 15 种已知改变心血管风险的条件中,蛋白质模型方向性一致地响应。不良变化:接近事件 +2.9%/1 年(EXSCEL,P<0.01)和 +6%/2 年(ACCORD,P<0.05);蒽环类化疗 +6.2%(PRADA,P<0.01,约 3 个月);衰老 +2.25%/1 年(EXSCEL)、+4.89%/1 年(DiRECT)、+7.5%/2 年(ACCORD),均 P<0.01。中性变化:ACCORD 强化降糖——观察事件率无变化,蛋白质预测也无变化;PRADA 中 ARB/β 阻滞剂——观察和预测均无个体获益。有益变化:exenatide −1.49%(EXSCEL,P<0.01,1 年内),观察 −0.8%(P=0.06,中位随访 3.2 年);DiRECT 饮食减重 −6.7%(P<0.01,平均减重 10 kg,近半数 12 个月时糖尿病缓解)。相比之下,NTproBNP 等单一生物标志物在相同干预中表现不一致或不敏感(如在 DiRECT 中 NTproBNP 因减重而升高,会错误提示风险增加)。
- 证据定位:§ Sensitivity of the model, PDF p.7-8;Table 3, PDF p.10;§ Detecting elevated risks, PDF p.8;Fig. 5, PDF p.11。
- 参数条件:配对样本来自 EXSCEL(1 年)、ACCORD(2 年)、PRADA(约 3 个月)、DiRECT(1 年)。横断面评估在 ARIC visit 3(n=11,301,未用于训练/验证)。
- 验证程度:验证。8 项纵向配对评估 + 横断面病例对照评估。观察与预测事件率差异间相关性 r=0.83(P<0.04,fig. S2)。同一模型在 COVID-19 患者(>800 例)中也预测了 28 天全因死亡率(AUC 0.83)(§ Discussion, PDF p.11;文献 41)。
- 替代解释:exenatide 的蛋白质预测获益(−1.49%,P<0.01)比观察结果(−0.8%,P=0.06)更显著,可能反映依从性下降导致的试验效力不足,而非模型过预测;7 项其他 GLP-1 RA 试验中 4 项显示心血管获益支持这一解释(§ Discussion, PDF p.11)。
主要发现 4:横断面检测多种已知的升高风险条件¶
- 模型结论或预测:在 ARIC visit 3(n=11,301,未用于训练/验证)中,蛋白质模型正确检测到既往心血管事件、癌症史、当前吸烟、糖尿病和类风湿性关节炎患者中升高的风险。在未诊断/未治疗高血压的亚组中,收缩压高于中位数者观察事件率 +2.2%(P<0.01)、预测 +1.2%(P<0.01);在未诊断/未治疗高脂血症亚组中,总胆固醇/HDL 比值高于中位数者观察 +3.0%(P<0.01)、预测 +2.3%(P<0.01)。PRADA 乳腺癌幸存者 1 年后预测风险 13.5% vs Fenland 匹配女性 4.9%。所有条件下,观察与预测事件率差异间存在显著比例关系(r=0.83, P<0.04)。
- 证据定位:§ Detecting elevated risks, PDF p.8;Fig. 5, PDF p.11;fig. S2。
- 参数条件:ARIC visit 3 n=11,301,各病例组:糖尿病 n=1,143、癌症史 n=337、类风湿性关节炎 n=39、已知 CVD n=571、当前吸烟 n=2,034,对照组为无该条件的其余队列 n=7,666。
- 验证程度:部分验证。类风湿性关节炎组样本量过小(n=39,仅 2 事件,5.1%),无法检测到流行病学已知的升高事件率。横断面评估未进行与现有风险因子的完全多参数调整比较。
- 替代解释:对照组的过预测是预期的,因为对照组不具有模型训练所基于的高风险条件(Fig. 5 注释)。
主要发现 5:生物学合理性与因果遗传关联¶
- 模型结论或预测:27 个蛋白质涵盖至少 10 类生物学过程:血容量/利钠肽(NTproBNP, ANP)、囊泡生物发生(ARL11)、基质/组织重塑/血管生成/黏附(ANTR2, CILP2, CA125, GOLM1, Spondin-1, SVEP1, PTPRJ, ITI-HC2, NELL1, GDF11/8)、细胞免疫(MMP12, ERBB3, NCAM-120)、钙通道调节(CA2D3)、肾小球滤过率(TFF3)、免疫球蛋白/受体(IGDC4, JAM-B, sTREM1)、代谢/脂质(SIRT2, PPR1A, LRP11)、炎症(suPAR, NDST1)、凝血(ATS13)。27 个蛋白质中 16 个被纳入 PheWAS 蛋白质组-基因组数据库(文献 21),其中 12 个(75%)与至少一种心血管疾病相关遗传性状关联(标注 * 号的蛋白质),通过孟德尔随机化分析探索潜在因果关系。
- 证据定位:§ Biologic relevance, PDF p.2-3;Table 2, PDF p.5-6;table S7。
- 参数条件:PheWAS 数据库覆盖 989 种蛋白质;16/27 模型蛋白质在数据库中。
- 验证程度:部分验证。12/16 蛋白质有因果遗传关联证据;但正式的统计生物学通路富集分析因机器学习有意偏差(限制相关特征纳入)而不适用。27 个蛋白质的文献心血管关联见表 S7。
- 替代解释:虽然部分蛋白质可能是因果中介物,但不太可能所有 27 个蛋白质都捕获了心血管疾病的全部因果因素;模型设计的"通用性"概念(对净结果变化的响应)作为因果性的替代框架(§ Discussion, PDF p.11-12;文献 43)。
关键图表¶
- Fig. 1(PDF p.3):展示整个研究的发现与验证框架。HUNT3 与 ARIC visit 5 二级疾病亚组用于训练,BASEL VIII、CHART-2、EXSCEL、ACCORD、DiRECT、PRADA 等多队列用于独立验证。红色框表示有 4 年结果的验证研究,合并为验证 meta-cohort。支持多队列训练-验证设计的核心结论。
- Fig. 2(PDF p.7):蛋白质模型(左)与临床模型(右)在二级人群中的校准与分层动态范围对比。三行分别为 HUNT3 80% 训练、HUNT3 20% 验证、ARIC 80% 验证。直观体现蛋白质模型在风险五分位上的判别优势。HL 为 Hosmer-Lemeshow 拟合优度统计量。
- Fig. 3(PDF p.8):(A) 验证 meta-cohort(n=11,609)中四个风险类别的 Kaplan-Meier 生存曲线;(B) 各独立研究和 meta-cohort 中每个风险类别的预测与观察风险比较。支持四类别分层的有效性。
- Fig. 4(PDF p.9):森林图展示各亚组(性别、种族、年龄、合并症、地理区域)中 4 年 AUC 和 c-statistic 的值及 95% CI。支持模型在多人群中的判别一致性。CHART-2 仅显示 2 年 AUC。
- Fig. 5(PDF p.11):ARIC visit 3(n=11,301)中已知升高心血管风险条件下的蛋白质预测风险与观察事件率。深蓝星号表示观察事件率显著高于对照组(P<0.05, Dunnett 校正),青色星号表示预测事件率显著高于对照组。支持"机制敏感性"的关键证据。
- Table 1(PDF p.4-5):训练与验证各研究亚组的基线特征(样本量、事件率、人口学、随访时间)。CHART-2 因仅 2 年随访被排除于 meta-cohort。
- Table 2(PDF p.5-6):27 个模型蛋白质的缩写、人群效应(population effect,HUNT3 训练集中的线性预测 beta 系数)、FDR 校正的单变量 Cox P 值、分析物 CV%。* 标注有因果遗传关联的蛋白质。
- Table 3(PDF p.10):27 蛋白质模型与 6 种常见生物标志物(CRP, Cystatin-C, GDF-15, 髓过氧化物酶, NT-proBNP, 肌钙蛋白 T)在纵向配对样本中对风险变化的敏感性比较。箭头表示方向性显著变化,NS 表示无统计学意义。
局限与适用边界¶
- 数据支持的结论:蛋白质模型在独立验证中判别性能优于临床模型(AUC 差约 0.1);四个风险类别有效分层(事件率 5.6%-43.4%);对 15 种机制的风险变化方向性敏感;在多种族/地理/合并症亚组中判别一致。观察与预测事件率差异相关性 r=0.83。
- 依赖假设的结论:模型作为"通用"替代终点依赖于"通用性"假设——模型对任何机制引起的净结果变化都能响应,而非要求每个蛋白质都是因果中介物(§ Discussion, PDF p.11-12)。蛋白质整合生物学信息的假设支持模型对多种机制的敏感性。
- 模型失效条件:(1) 在低事件率的一级预防人群中高端过预测(类似 PCE 和 Framingham 的校准误差);(2) PCSK9 抑制剂和 SGLT2i 药物类别未测试,无法确认对这些机制的敏感性;(3) 类风湿性关节炎等小样本亚组检测效力不足;(4) 4 年预测窗口内采样后的环境/药物/行为变化可能改变风险,影响预测准确性(§ Discussion, PDF p.12)。
- 最大不确定性:(1) FDA 尚未判定证据是否充分用于替代终点资格认定;(2) AUC 0.73 的"天花板"不可知;(3) 横断面流行病学评估未进行完全多参数调整;(4) 校准在低事件率人群高端过预测,需后校准缓解(fig. S1)。
个人批注¶
可迁移的方程、算法或参数¶
Weibull AFT 生存模型框架 S(t|θ) = exp{−(θ·t)^a} 结合 LASSO 特征选择 + 全参数化模型的两阶段建模策略可迁移至其他时间-事件预测场景。关键设计选择包括:在高事件率二级预防人群中训练以富集生物学信号;将连续输出离散化为不重叠的易于沟通的风险类别;使用配对样本验证方向性敏感性而非仅判别指标。
与我的模型的接口¶
不适用。本论文为蛋白质组学+机器学习的统计预测模型,与本人的计算生物力学 SMC G&R 机理模型在方法论上属于不同范式(数据驱动 vs 机理驱动)。但其多队列整合训练-验证设计与对因果遗传性状的交叉验证思路,对整合多中心数据构建机制敏感的生物标志物模型有方法论参考价值。
疑问与复现实验¶
- 疑问:27 蛋白质的 LASSO 选择在 10 折交叉验证中的稳定性如何?不同随机种子下有多少蛋白质一致被选入?论文未报告特征选择的 bootstrap 稳定性分析。
- 疑问:Weibull 形状参数 â=1.1 接近 1(指数分布),这是否暗示风险基本恒定?a=1 vs a=1.1 对 4 年预测的实际影响有多大?
- 复现实验:使用论文公开的方程(PDF p.6)和 Table 2 中的系数,在公开的 ARIC 或 HUNT 数据子集上重新计算 27 蛋白质风险评分,验证 Fig. 4 中报告的 AUC/c-statistic。可检查校准曲线是否复现 Fig. 2/Fig. 3B 的模式。
与上下文的关系¶
本文建立在¶
- Ganz et al. (2016) JAMA — 先前基于 SomaScan 的蛋白质风险评分(稳定冠心病人群)(文献 18)。
- Williams et al. (2018) Circulation — torcetrapib 蛋白质组学安全性检测(文献 19)。
- Yang et al. (2020) JAHA — 肾功能对血液蛋白质组的影响(文献 20)。
- Williams et al. (2019) Nat Med — 血浆蛋白质模式作为健康综合指标(文献 31)。
- Lathia et al. (2009) Clin Pharmacol Ther — FDA 生物标志物资格认定框架(文献 16)。
- Zheng et al. (2020) Nat Genet — PheWAS 蛋白质组-基因组孟德尔随机化数据库(文献 21)。
- FDA (2004) "Innovation or Stagnation" 报告(文献 1)。
已核实的后续引用¶
本次未检索。
同类模型对比¶
- PCE(2013 ACC/AHA Pooled Cohort Equation, 文献 58):基于传统心血管风险因子(年龄、性别、种族、总胆固醇、HDL、血压、糖尿病、吸烟),不使用种族变量的蛋白质模型在判别上优于 PCE(c-statistic 0.71 vs 0.63)。PCE 不适用于本文的高风险二级预防人群。
- Framingham 通用心血管风险模型(D'Agostino 2008, 文献 47):与 PCE 类似的传统风险因子模型,在糖尿病等高风险人群中可靠性不足(文献 13)。
- 单一生物标志物(NTproBNP, 肌钙蛋白 T, GDF-15, CRP, Cystatin-C, 髓过氧化物酶):在纵向配对样本中,这些单一标志物对多种干预机制的风险变化表现不一致或不敏感(Table 3)。例如 NTproBNP 在 DiRECT 减重中升高(文献 44),会错误提示风险增加;而 27 蛋白质多变量模型正确预测了风险降低。
- Ganz et al. (2016) 9 蛋白质模型(文献 18):本文的前身研究,在稳定冠心病人群中开发了 9 蛋白质风险评分;本文将蛋白质数量扩展到 27 个,验证人群扩大到多队列 meta-cohort,并增加了方向性敏感性测试。
与本地论文队列的关系¶
不适用。
摘要概述¶
本文基于 SomaScan 高通量蛋白质组学平台,在 9 项临床研究的 22,849 名受试者共 32,130 份血浆样本中测定约 5000 种蛋白质,利用机器学习构建了一个 27 蛋白质模型,预测 4 年内心肌梗死、卒中、心衰住院或全因死亡的复合终点。该模型在 11,609 人的独立验证队列中表现优于临床模型:AUC 0.73 vs 0.64,五分位最高/最低组事件比 6.7 vs 2.9,净重分类指数 +0.43,且加入临床变量后仅提升 0.01–0.02。27 个蛋白质涵盖至少 10 类生物学过程(如利钠肽、血管基质重塑、细胞免疫、脂质代谢等),其中 12 个与相关因果遗传性状关联。模型对多种已知改变心血管风险的因素(衰老、糖尿病、化疗、高血压、减重、exenatide 等)方向性一致地响应,有望成为心血管药物开发与个体化治疗的"通用"替代终点。
关键图表¶
- Fig. 1(第 230 行):展示整个研究的发现与验证框架——HUNT 与 ARIC visit 5 二级疾病亚组用于训练,BASEL VIII、CHART-2、EXSCEL、ACCORD、DiRECT、PRADA 等多队列用于独立验证,是理解本文多队列设计的核心。
- Fig. 2(第 895 行):蛋白质模型与临床模型在二级人群中的校准与分层动态范围对比,直观体现蛋白质模型在风险五分位上的判别优势。
- Fig. 5(第 1172 行):在 11 种已知升高心血管事件风险的条件下(衰老、糖尿病、癌症史、蒽环类化疗等),蛋白质预测风险与实际事件率方向性一致,是"机制敏感性"的关键证据。
与我的关联¶
该工作是蛋白质组学+机器学习用于心血管风险预测的标杆性研究,其多队列整合训练—验证设计与对因果遗传性状的交叉验证思路,对我自己整合多中心数据构建机制敏感的生物标志物模型有直接方法论参考价值。