Skip to content

The future of machine learning for small-molecule drug discovery will be driven by data

Durant, Guy; Boyles, Fergus; Birchall, Kristian et al. · 2024 · Nature Computational Science

Metadata

Authors: Durant, Guy; Boyles, Fergus; Birchall, Kristian; Deane, Charlotte M.

DOI: 10.1038/s43588-024-00699-0

Tags: #machine-learning #deep-learning

概述(Overview)

摘要概述

本文是 Durant 等人发表于 Nature Computational Science 的观点文章,核心论点是:小分子药物发现中的机器学习方法尚未迎来"AlphaFold 2 时刻",原因不在于算法不够先进,而在于训练和验证数据的质量与数量不足。文章从三个维度系统分析了当前困境:算法选择(GNNs、transformers、diffusion models 等新架构在标准基准上仅获增量改进,Fig. 1 显示 CASF-2016、USPTO-50k、HIV MoleculeNet 三个基准的准确率随时间无显著趋势)、数据数量(公开数据仅数万至数十万量级,远低于图像/语言的百万至万亿级)、数据质量(数据偏差、噪声、负数据缺失)。作者提出改进路径包括数据增强、合成姿态、联邦学习、众包数据(如 COVID Moonshot)、更严格的验证(消融测试、盲评竞赛如 CACHE/D3R)。文章强调未来突破将是算法+数据+验证的协同改进,而非单一算法创新。

综述问题、范围与选择标准

  • 要回答的问题:为什么机器学习在小分子药物发现中未能复制在计算机视觉和蛋白质结构预测中的成功,以及如何通过改进数据来推动未来突破?
  • 覆盖范围:2018–2024 年间小分子药物发现 ML 方法的文献,覆盖 docking、retrosynthesis、QSAR/property prediction、de novo design 四个子领域。
  • 文章性质:perspective(观点文章),非 systematic review,无系统性检索式或纳入排除标准。
  • 文献选择方法:未报告(作者未声明数据库、检索式或纳入排除标准;文献以代表性工作和作者团队相关研究为主线)。

主题综合

主题 1:算法创新未带来突破——基准性能停滞

  • 核心论点:新 ML 架构(GNNs、transformers、diffusion models)在小分子药物发现的标准基准上仅获增量改进,未产生"AlphaFold 2 时刻"式的飞跃。
  • 代表证据定位:Fig. 1(三个基准性能随时间的散点图);文献 ref 24(Buttenschoen et al. 2024, PoseBusters);文献 ref 30(Harris et al. 2023, PoseCheck)
  • 共识程度:稳固——多个独立研究证实 ML 方法泛化性差、性能在替代基准上不可重复(refs 21–27)。
  • 分歧或限制:作者将算法创新的局限归因于数据问题,但也有观点认为小分子问题的内在复杂性(化学空间的高维性、蛋白-配体相互作用的物理复杂性)本身构成根本障碍,而非仅数据问题。

主题 2:数据数量——公开数据的结构性稀缺

  • 核心论点:小分子药物发现 ML 的公开训练数据仅数万至数十万量级,远低于 CV/NLP 的百万至万亿级,且制药公司的私有数据因知识产权保护而被隔离,限制了模型训练规模。
  • 代表证据定位:文献 ref 63(PDBBind, 19,443 复合物);文献 ref 72(KIBA, 117,657 对);文献 ref 97(MELLODDY 联邦学习项目)
  • 共识程度:稳固——数据稀缺是小分子 ML 领域的广泛共识,PDBBind 等数据集规模有限是客观事实。
  • 分歧或限制:作者提出的缓解措施(联邦学习、众包)有实际进展但仍规模有限——MELLODDY 仅扩展 10% 适用域,Effiris 扩展 83% 但后者规模仍远小于 CV/NLP 数据。数据稀缺的根源(实验成本高、难以自动化)短期内难以根本解决。

主题 3:数据质量——偏差、噪声与负数据缺失

  • 核心论点:小分子数据存在系统性偏差(人为偏好、归纳偏差)、实验噪声(不同 assay 条件不可比)和负数据缺失(发表偏差),这些问题导致模型学习虚假趋势而非真实物理规律。
  • 代表证据定位:文献 ref 23(Wallach & Heifets 2018, 记忆 vs 泛化);文献 ref 125(CASF-2016 最大可达精度上限 Pearson's R=0.76);文献 ref 130(HIV MoleculeNet 中 70% 真活性化合物命中 PAINs 目录)
  • 共识程度:稳固——数据偏差和噪声对 ML 模型的影响有充分文献支持。IC50/Ki 跨 assay 不可比性(Pearson's R² 分别为 0.53 和 0.81)是实验化学的已知问题。
  • 分歧或限制:提出的解决方案(数据清洗管道、实验-计算协作)缺乏具体操作框架。PAINs 子结构匹配是假阳性的"指标而非证据",简单过滤可能导致假阴性——如何平衡精确性与召回率未讨论。

关键图表、Box 与分类框架

  • 定位:Fig. 1(三个基准的性能-时间散点图)
  • 内容:CASF-2016(Pearson's R)、USPTO-50k(top-1 accuracy)、HIV MoleculeNet(AUROC)三个基准上,按发表日期绘制各 ML 方法的性能点,按架构着色(GNN/Transformer/CNN/Tree/NN/Non-ML/Other)。三个基准的 Pearson 相关系数 ρ 分别为 0.03、0.87、0.09——仅 USPTO-50k 显示随时间有改善趋势,但作者指出这也不构成"AlphaFold 2 时刻"。
  • 价值:提供了"算法创新未带来突破"这一核心论点的最直接可视化证据。三个基准覆盖了小分子 ML 的三个核心任务(亲和力预测、逆合成、活性分类),使论点具有领域代表性。
  • 局限:基准选择有限(仅三个),且都是已有数据集——可能存在选择偏差。散点图未标注每个方法的数据集大小和训练细节,无法区分"算法无效"与"数据不足"的贡献。

共识、争议与研究空白

相对稳固的共识

ML 方法在小分子药物发现中的泛化性差——方法在训练分布内数据上表现良好,但在分布外数据上性能显著下降(refs 21–27)。在标准基准上,简单方法(如决策树仅使用配体/蛋白特征)与复杂架构(GNNs、CNNs)竞争力相当(ref 133),表明当前基准可能奖励记忆数据集偏差而非学习真实物理。

尚存争议

"AlphaFold 2 时刻"在小分子发现中是否可能实现。作者认为通过改进数据和验证可以催化这一突破,但也有观点认为小分子问题的内在维度(化学空间估计 10^60 化合物)和蛋白-配体相互作用的物理复杂性使问题本质不同于蛋白质结构预测——后者有蛋白质序列作为信息丰富的先验,而小分子-蛋白结合缺乏等价的先验知识。

作者提出的研究空白

  1. 负数据的系统性缺失——发表偏差导致公开数据中正负样本比例失衡,造成分类不平衡和协变量偏移。Dark Reactions Database 已停止维护,负数据获取缺乏可持续机制。
  2. 数据噪声的量化不足——ChEMBL 等数据集不策划不确定性估计,使模型无法区分信号与噪声。
  3. 验证方法与实际使用场景脱节——redocking 评估高估了 docking 在真实药物发现中的准确性(ref 39, 50);单步逆合成基准与多步路径搜索的实际应用不匹配(ref 27)。

我识别的遗漏

文章未讨论 ML 模型在药物发现中的决策影响评估——即一个"更准确"的模型在药物发现流程中实际节省了多少时间和成本。这种"决策级"评估(decision-level evaluation)比预测精度更重要,因为药物发现的最终目标是减少实验次数而非提高预测 R²。缺乏此类评估使"数据驱动改进"的价值主张缺乏量化支撑。

个人批注

与我的工作的关系

作为计算生物力学研究者,本文对"ML 在科学问题中的局限性"有普遍性启示:数据质量和验证方法的重要性不亚于算法创新——这一洞见适用于任何数据稀缺的科学 ML 场景,包括血管 G&R 参数反演中的 ML 方法。文章中"简单方法与复杂架构竞争力相当"的发现(ref 133)是一个重要警示:在科学 ML 中,如果简单基线已经接近数据噪声上限(如 CASF-2016 的 Pearson's R 上限 0.76),则更复杂的模型可能只是过拟合噪声而非学习真实物理。联邦学习(MELLODDY)对 G&R 多中心临床数据共享有参考价值——不同医院的影像/力学数据可类比于不同药企的化合物数据。

可复用框架

"消融测试+基线比较"的验证框架:在引入新 ML 方法前,先建立简单基线(如线性回归、决策树),通过消融测试确认每个模型组件的贡献——这一框架可直接用于评估 PINN 在 G&R 问题中的实际增益。数据偏差诊断清单(人为偏好、归纳偏差、PAINs、跨 assay 噪声)可作为科学数据集质量评估的通用检查表。

疑问与后续动作

  1. 疑问:CASF-2016 的 Pearson's R 上限 0.76(ref 125)是如何计算的?这一"噪声天花板"的计算方法可否迁移到 G&R 参数反演的 ML 评估中?
  2. 后续动作:精读 Wallach & Heifets 2018(ref 23, 记忆 vs 泛化)和 Scantlebury et al. 2023(ref 49, 可泛化评分函数),评估其验证方法论是否适用于 PIML 在血管力学中的性能评估。

与上下文的关系

本文建立在

作者团队的前序工作建立了小分子 ML 评分函数的基线比较方法(ref 133, 决策树基线)和 docking 方法评估框架(ref 24, PoseBusters)。AlphaFold 2 的成功(ref 13, Jumper et al. 2021)作为"理想标杆"被反复引用。数据稀缺的分析建立在 PDBBind(ref 63)、ChEMBL(ref 65)、MoleculeNet(ref 37)等数据集的规模统计上。

已核实的后续引用

本次未检索

同类综述对比

本次未核实

与本地论文队列的关系

与本地 2021-PIML-Karniadakis 互补:Karniadakis 聚焦将物理知识嵌入 ML 以克服数据稀缺("用物理补数据"),Durant 则聚焦改进数据本身以克服 ML 局限("用数据补算法")。两者代表了科学 ML 的两种互补路径。与 2016-Chemoinformatics-New-Era-Wang 有间接关联——Wang 提出 SD 模拟可提供更丰富的 response object,而 Durant 的视角提示即使有更好的目标量,数据质量仍是瓶颈。

逐章节笔记(Section-by-Section Notes)

引言(Introduction)

段落 1:小分子药物的重要性与开发困境

  • 核心论点:小分子药物占全球已批准药物的 90%,但其开发极具挑战性,R&D 效率持续下降(Eroom's law)。
  • 支撑论据:
  • 小分子治疗药是 90% 的全球已批准药物(ref 1),在制药业仍为流行模式
  • 小分子量化学化合物通过调节生物过程治疗或预防疾病,小尺寸允许穿透细胞膜并直接作用于蛋白或 RNA 靶点(ref 2)
  • 用途和设计随时间扩展,包括 PROTAC(ref 3)和 molecular glues(ref 4)等新模态
  • 但小分子开发极具挑战性,临床前和临床试验失败导致时间和成本增加
  • 1950–2012 年间,每 10 亿美元研发投入的批准药物数每 9 年减半——"Eroom's law"(ref 5, Scannell et al. 2012)
  • 如今药物上市需数年至十年,成本数亿至数十亿美元(refs 6, 7)
  • 我的分析:这段以 Eroom's law 设定了药物发现领域的结构性困境——R&D 效率递减。Eroom's law(Moore's law 的逆反)是制药业效率下降的经典量化指标,为后续 ML 的"期望"提供了对比基准。值得注意的是 Eroom's law 覆盖 1950–2012,而本文发表于 2024——2012 年后这一趋势是否延续未更新,但 2012 年后生物制剂(非小分子)的兴起可能部分改变了格局。PROTAC 和 molecular glues 的提及表明小分子定义在扩展,但本文的分析仍聚焦传统小分子。

段落 2:ML 的期望与在其他领域的成功

  • 核心论点:ML 在计算机视觉、自然语言处理和蛋白质结构预测中取得巨大成功,制药业和学术界期望其能替代昂贵的实验、加速药物发现全流程。
  • 支撑论据:
  • ML 利用算法直接从数据中识别和建模模式
  • ML 在计算机视觉(refs 9, 10)、自然语言处理(refs 11, 12)和蛋白质结构预测(refs 13, 14)取得巨大成功——这些领域数据丰富
  • 制药业和学术界希望高精度 ML 模型替代昂贵缓慢的实验,在整个药物发现流程中产生可靠预测或合理假设(ref 15)
  • ML 是相对低成本的方法,仅需计算资源和少量专家,而非实验筛选所需的设备和设施
  • 用 ML 在化学空间的巨大空间中 in silico 搜索潜在药物比体外/体内实验更可行(ref 16)
  • 但这种可行性必须与足够高的精度匹配
  • ML 已在多处使用:de novo 分子设计(ref 17)、逆合成预测(ref 18)、docking(ref 19)、性质预测(ref 20)
  • 我的分析:这段建立了"ML 在其他领域成功→应能在药物发现成功"的期望。关键对比是数据量:CV/NLP 有百万/万亿级数据,蛋白质结构预测利用了序列数据库的庞大语料——这为后续"数据是小分子 ML 瓶颈"的论证做了铺垫。"可行性必须与精度匹配"是关键限定——ML 只有在精度足够高时才能替代实验,否则仅增加噪声而非减少成本。

段落 3:ML 在小分子领域的失败——泛化差、不可重复

  • 核心论点:尽管研究广泛,ML 在小分子药物发现中未能复制其他领域的成功——方法泛化差、性能在替代基准上不可重复、生成分子缺乏物理合理性。
  • 支撑论据:
  • ML/AI 应用于小分子治疗发现的成功不及其他领域
  • 多项研究表明方法对训练数据的分布外数据泛化差(refs 21–27)
  • 在验证数据上的性能常无法在替代基准上重复(refs 21–27)
  • 或经仔细审查后不成立——如分子新颖性(refs 28, 29)或物理合理性(refs 24, 30)
  • 这些限制重要:分布内、大数据、已建立靶点或化学空间区域的药物发现可通过更简单方法或人类专长实现——使这些 ML 方法过时(refs 31, 32)
  • 正是在分布外设置中 ML 方法最需要却最不准确
  • 我的分析:这段是"期望-现实"落差的直接陈述。"分布内简单方法已足够,分布外 ML 最差"是一个尖锐的判断——它意味着当前 ML 在最需要它的场景(新靶点、新化学空间)恰好最不可靠。refs 21–27 的多项独立研究使这一判断具有稳健性。生成分子的"物理不合理性"(refs 24, 30)是一个特别严重的局限——模型生成的分子在化学上不可能存在或与蛋白的相互作用无物理意义,这意味着模型学到的不是物理规律而是数据表面的统计模式。

段落 4:AlphaFold 2 的成功要素与小分子的"AlphaFold 时刻"缺席

  • 核心论点:AlphaFold 2 的成功源于精心的架构和工程决策而非单一特性,小分子发现尚未迎来类似的突破时刻。
  • 支撑论据:
  • AlphaFold 2 在 CASP14 中比最接近的竞争者准确 2.6 倍(ref 34)
  • 其成功依赖于精心的架构和工程决策(详尽的补充信息),而非单一特性
  • invariant point attention 和"recycling"等关键特性专门为解决蛋白质结构问题而设计
  • "AlphaFold 2 时刻"在小分子发现中尚未发生——过去几年仅获增量改进
  • 我的分析:这段将 AlphaFold 2 定位为"数据+算法+工程协同"的成功范式,暗示小分子发现需要类似的系统性突破而非单一算法改进。"精心的架构和工程决策"的强调与后续"数据质量同样重要"的论点形成呼应——AlphaFold 2 的成功不仅仅是架构创新,还包括对蛋白质结构问题的深入理解和数据的有效利用。但 AlphaFold 2 与小分子发现的一个关键差异未被点明:蛋白质序列数据(AlphaFold 2 的训练数据)是被动生成的(全球基因组测序),而小分子-蛋白结合数据需要主动实验生成——这一结构性差异是后续数据数量问题的根源。

The impact of algorithm choice

段落 1:基准性能停滞的实证证据

  • 核心论点:三个流行基准(CASF-2016、USPTO-50k、HIV MoleculeNet)上,ML 方法准确率随时间无显著改善趋势(ρ=0.03, 0.87, 0.09),GNNs 等新架构未产生显著影响。
  • 支撑论据:
  • ML 方法开发遵循典型模式:新架构→用流行训练集训练→在流行基准上测试(refs 35–39)
  • 这通常导致仅相对同样训练/测试的旧方法的增量改进
  • 作者取三个基准比较准确率与发表日期:CASF-2016(285 蛋白-配体复合物,评分函数结合亲和力预测,ref 35);USPTO-50k(逆合成,ref 36);HIV MoleculeNet(QSAR 分类,ref 37)
  • Fig. 1 结果显示相同趋势:两个基准几乎无改善,一个有增量但无"AlphaFold 2 时刻"
  • CASF-2016 和 HIV MoleculeNet 完全无趋势,USPTO-50k 有增量改善但非突破
  • 我的分析:这段提供了核心论点的最直接实证证据。三个基准覆盖了亲和力预测、逆合成和活性分类三个核心任务,结果的一致性(均无突破)使论点具有领域代表性。但 ρ=0.87(USPTO-50k)实际上表明有相当强的时间趋势——作者将其定性为"增量但非突破",这一判断的标准(何为"突破"vs"增量")是主观的。CASF-2016 的 ρ=0.03 可能部分归因于该基准的"噪声天花板"(后续 ref 125 估计最大 Pearson's R 仅 0.76)——如果基准本身有上限,则方法改进的可见效果会被天花板掩盖。

段落 2:GNNs 和 diffusion models 的有限影响

  • 核心论点:在其他领域成功的 GNNs 和 diffusion models 在小分子药物发现中未产生巨大影响——diffusion 模型虽精度提高但生成物理不合理的分子。
  • 支撑论据:
  • GNNs 允许神经网络直接在图结构上操作,无需特征化即可编码分子结构和宏分子靶点
  • 尽管在材料发现(ref 42)和抗生素发现(refs 43, 44)中有成功案例,GNNs 在所有小分子领域未产生巨大影响(Fig. 1, refs 45, 46)
  • equivariant GNNs 允许从 3D 结构直接特征化(refs 47, 48),但未必然带来更高精度或泛化性
  • diffusion 模型在 docking 和 de novo 分子生成中应用(refs 50–53),虽精度提高但两项研究显示生成分子物理不合理或与蛋白相互作用无意义(refs 24, 30)
  • 这些缺陷可能通过化学信息引导或约束的 diffusion 克服(ref 58)
  • 新方法(consistency models ref 59, flow matching ref 60)不太可能通过开箱即用产生阶跃变化——需要 ML 方法+架构工程决策+数据质量/数量的组合
  • 我的分析:这段的关键洞见是"算法在其他领域成功≠在小分子领域成功"——GNNs 在材料发现有效但在小分子 docking 无效,说明问题特异性(而非算法通用性)是决定因素。diffusion 模型生成"物理不合理分子"的发现(refs 24, 30)特别有力——它表明模型学到的生成分布偏离了化学空间的物理可行区域。"开箱即用不可能"的结论指向了"算法+数据+工程"的组合必要性,这与 AlphaFold 2 的成功要素分析一致。

The data quantity problem

段落 1:小分子数据的结构性稀缺

  • 核心论点:小分子 ML 的公开训练数据仅数万至数十万量级,远低于 CV/NLP 的百万至万亿级,且实验数据生成昂贵、难以自动化。
  • 支撑论据:
  • ML 需要大量数据才能有效建模底层趋势(ref 61)
  • LLM 和图像生成受益于互联网可抓取的海量文本和图像数据——如 DALL-E 3(ref 62)和 GPT-4(ref 11)的训练数据由互联网用户被动产生
  • 生物和化学数据处于截然不同的空间——实验生成数据昂贵、劳动密集、难以自动化
  • 公开训练数据限于数万至数十万(refs 37, 63–65),远小于图像生成的数亿(ref 66)和 LLM 的万亿(ref 67)
  • AlphaFold 2 利用了远大的公开蛋白质序列数据语料(refs 70, 71)克服了实验确定蛋白质结构的相对稀少(数十万级)
  • 小分子公开训练数据常限于数万至数十万
  • 大量数据由公司私有以保护知识产权——这种数据隔离使领域主要依赖有限的公开数据
  • 公开数据常来自学术或专利释放的有限数据:KIBA(117,657 对,ref 72)、USPTO Yields(853,638 反应产率,ref 36)、Tox21(8,575 化合物,ref 73)、PDBBind(19,443 复合物,ref 63)
  • 我的分析:这段通过具体数字建立了数据规模差距的量化图景。AlphaFold 2 的"蛋白质序列数据杠杆"(用大量序列数据弥补结构数据稀缺)是关键对比——小分子发现缺乏类似的"丰富先验数据源"。PDBBind 仅 19,443 复合物与 GPT-4 的万亿 token 对比悬殊。但数据量比较需考虑任务复杂度:蛋白质结构预测的输出是 3D 坐标(维度高但结构有约束),小分子 docking 的输出也是 3D 坐标但蛋白-配体相互作用的维度和复杂性可能更高——单纯数据量比较可能忽略了任务的信息论难度差异。

段落 2:结构数据的瓶颈与数据增强策略

  • 核心论点:结构数据(蛋白-配体复合物)规模瓶颈难以通过实验突破,需依靠数据增强、自蒸馏和预训练等策略最大化现有数据价值。
  • 支撑论据:
  • docking 算法、结构生成方法和评分函数都依赖蛋白-小分子复合物结构
  • PDBBind 最新更新仅 19,443 复合物——规模限制是模型训练瓶颈(refs 21, 74, 75 表明增加数据量和覆盖可提升性能)
  • 高通量结构测定方法目前主要限于片段筛选,约束了数据多样性(ref 76)
  • 近期不太可能大幅增加训练数据的数量或多样性——策略须充分利用现有结构数据和/或设计能以少量数据点带来最大收益的实验
  • 当前方法包括数据增强:cross-docked poses(refs 39, 53)、合成姿态(氨基酸作为独立配体,refs 77, 78)、合成口袋数据增强(ref 74)
  • self-distillation(使用校准良好的置信度算法,ref 13)、相关任务预训练(ref 49)或物理方法生成数据预训练(refs 80, 81)
  • 这些方法不互斥,未来方法将组合使用
  • 我的分析:这段的核心矛盾是"数据需求大但供给不可能大幅增加"——结构生物学实验的成本和通量限制是物理性的,非算法可解。数据增强策略(合成姿态、cross-docking)是一种"信息放大",但有循环论证风险:如果增强数据本身来自有偏差的 PDBBind,则增强后的数据集继承了原始偏差。物理方法生成数据预训练(refs 80, 81)是一个有前景的方向——它将物理模拟数据作为"免费"训练数据,类似于 PIML 中用 PDE 残差作为无标签训练信号。但物理方法的近似误差会传递到下游 ML 模型。

段落 3:负数据缺失与发表偏差

  • 核心论点:小分子药物发现中负数据极少公开可用,发表偏差导致正负样本比例失衡,造成分类不平衡和协变量偏移。
  • 支撑论据:
  • 负数据——化合物不结合靶点(ref 82)或有机合成失败(ref 83)——极少公开可用
  • 归因于发表偏差:只写阳性结果,不释放或策划负数据(refs 83, 84)
  • 对 ML 造成协变量偏移(正负数据比例失衡)和分类不平衡
  • 产率预测模型受影响:预测小分子合成中反应条件和试剂可行性(ref 83)
  • 制药公司有相反问题——需降权负数据或过采样正数据(如训练 DNA-encoded libraries, ref 85)但通常不公开
  • 提议的解决方案:更严格的发表指南促进透明性(refs 86–88)、合成负数据(ref 89)、众包数据如 Dark Reactions Database(ref 90,现已停止维护)——进展有限
  • 另一途径:从博硕论文和高通量实验原始结果中提取负数据(通常非机器可读)
  • ML 工具可挖掘这些复杂数据:ChemDataExtractor(ref 91)、DECIMER.ai(ref 92)、Nougat(ref 93)——从文献中提取"暗数据"
  • 我的分析:负数据缺失是科学 ML 中的一个普遍性问题——不仅限于小分子药物发现。"暗数据"挖掘的思路(从论文/thesis 中提取未发表的负结果)是一个有创意的解决方案,但依赖 NLP/OCR 工具的准确性。Dark Reactions Database 停止维护的事实突出了可持续数据基础设施的挑战——学术数据集常因资助结束而废弃。制药公司"有相反问题"(负数据过多)的观察表明,公私数据生态存在结构性不对称:学术界缺负数据,企业有但不公开。

段落 4:新数据源——众包与联邦学习

  • 核心论点:众包药物发现和联邦学习为增加可用数据量提供了新路径,无需集中转移私有数据。
  • 支撑论据:
  • 众包药物发现以完全开放和协作的方式开发靶点药物(ref 94),允许全球任何人审查数据并提出化合物
  • 副效应是释放大量不同类型数据供 ML 利用
  • COVID Moonshot Project 是典范:COVID-19 Mpro 蛋白酶的众包药物发现(ref 95),产生 470 晶体结构、2,000+ 化合物 IC50 测定、3,000+ 化合物合成(ref 96)
  • 联邦学习允许在分离的数据孤岛上训练 ML 模型而不转移数据(ref 97)——两种方法:teacher 模型标注数据分发给成员,或权重更新在中央服务器聚合再分发
  • MELLODDY 项目使适用域平均扩展 10%,Effiris 扩展 83%(ref 98)
  • 这些进展可通过增加训练数据量推动领域前进
  • 但仅增加数据量可能不足——数据质量同样重要
  • 我的分析:COVID Moonshot 的数据产出(470 结构、2,000+ IC50、3,000+ 合成物)相对于 PDBBind 的 19,443 是一个有意义的增量,但相对于 CV/NLP 数据仍微小。联邦学习的 10%/83% 适用域扩展看似显著,但"适用域扩展"不等于"精度提升"——模型覆盖了更广的化学空间但每个点的精度可能下降。"数据量不足,质量同样重要"的过渡引出了下一节的核心主题。联邦学习对 G&R 多中心数据共享有直接参考价值:不同医院的影像/力学数据可类比于不同药企的化合物数据,联邦学习可允许模型共享而不泄露患者数据。

Accounting for data quality

段落 1:数据偏差——人为偏好与归纳偏差

  • 核心论点:ML 模型可能学习训练数据中的虚假趋势而非真实世界模式,特别是当数据来自有限化学空间区域的非随机采样时。
  • 支撑论据:
  • ML 模型设计为识别和学习训练数据中的趋势和模式,但可能学习不代表真实世界模式的虚假趋势——数据偏差
  • 学习偏差而非相关趋势导致方法精度和实用性降低(refs 99–102)
  • 小分子研究数据常从多源策划以缓解数据量问题(refs 103–105),每源数据点由研究者选择,常探索有限化学空间而非随机无偏采样(ref 106)
  • 人为偏好偏差:药物化学中科学家对合成路径和反应的偏好受熟悉度而非有效性/成本/便利性影响(ref 107)
  • 归纳偏差:源自数据集本身而非人类——ML 虚拟筛选工具被证明依赖配体特征而非学习蛋白-配体相互作用模式(refs 109–112)
  • asymmetric validation embedding 被提议生成更严格的训练-验证分割以惩罚学习偏差(refs 23, 26),这些更严格分割表明当前方法不如最初展示的准确(refs 113, 114)
  • 域适应(domain adaptation, ref 115)、对抗方法(ref 116)和谱属性去除(ref 117)可减少偏差依赖
  • 我的分析:这段区分了两种偏差来源——人为偏好(anthropogenic bias,科学家选择化合物的偏好)和归纳偏差(inductive bias,数据集结构导致的偏差)。"模型依赖配体特征而非学习蛋白-配体相互作用"的发现(refs 109–112)是核心问题——这意味着模型本质上是在做配体分类而非结合预测,等价于"记住"了训练集中的配体而非学习了结合物理。asymmetric validation embedding(refs 23, 26)是一个重要的方法论贡献——它通过设计更难的验证分割来暴露模型的记忆行为。但对抗方法和谱属性去除在 NLP 中成功但在小分子中尚未成功,表明偏差结构在不同领域有根本差异。

段落 2:噪声数据——跨 assay 不可比性与假阳性

  • 核心论点:小分子数据集噪声严重——不同 assay 条件使 IC50 数据不可比、PAINs 化合物产生假阳性,这些噪声导致模型精度被高估。
  • 支撑论据:
  • 小分子数据噪声主要来自多源数据合并
  • IC50 活性数据来自不同 assay 被合并训练单一 QSAR 模型(refs 119–121),但不同 assay 条件使数据不严格可比(ref 122)
  • 同靶点同化合物的 IC50 和 Ki 跨 assay 的 Pearson's R² 分别为 0.53 和 0.81(refs 122–124)——显示 ground-truth 标签的高不确定性
  • 不确定性导致模型精度指标膨胀——CASF-2016 上 ML 评分函数最大精度估计为 Pearson's R=0.76(ref 125, Fig. 1)
  • ChEMBL 等数据集不策划不确定性估计(ref 65),需基于数据/assay 类型近似
  • 假阳性来源:PAINs(pan-assay interfering compounds)通过 redox cycling 或 aggregation 非特异性干扰 assay 机制,使化合物虚假显示活性(ref 127)
  • PAINs 预测方法存在(Brenk ref 128, NIH ref 129 目录),但数据集常未检查——HIV MoleculeNet 中 404 真活性化合物中 70% 命中 PAINs 目录(ref 130)
  • 但匹配是假阳性"指标而非证据",无匹配也不排除假阳性
  • meta-learning 基准中仅按 PAIN 化合物击中靶点数即可高度预测(ref 131)
  • 我的分析:这段提供了数据噪声的量化图景。IC50 跨 assay 的 R²=0.53 意味着超过一半的方差来自 assay 条件差异而非真实结合差异——这是"噪声天花板"的直接证据。CASF-2016 的最大可达 R=0.76 的估计意味着所有超过 0.76 的报告精度都可能部分归因于过拟合特定数据分割。HIV MoleculeNet 中 70% 真活性化合物命中 PAINs 目录的发现尤其令人震惊——它暗示该基准测量的可能不是真实的抗 HIV 活性而是 PAINs 的非特异性干扰。PAINs 匹配"指标而非证据"的限定是重要的——简单过滤可能导致假阴性(丢弃真正的活性化合物)。meta-learning 基准中 PAINs 数量的预测能力(ref 131)进一步证实了模型在学习数据集偏差而非真实物理。

Validating the methods

段落 1:消融测试与基线比较的不足

  • 核心论点:当前验证方法(同源测试集或标准基准)无法证明方法在真实药物发现中比现有方法更有用,应采用基线比较和消融测试来识别真正的改进来源。
  • 支撑论据:
  • 验证通常用同源测试集或标准基准——增量改进被用于论证模型在药物发现中的应用
  • 但这常无法证明方法比现有方法更有用,也阻碍了理解哪些技术进步能真正推动方法发展
  • 基线比较和消融测试是未充分利用的方法——通过与严格基线比较,可论证增加模型特征和复杂性的价值
  • 作者团队展示:仅给配体/蛋白特征的简单决策树评分函数在结合亲和力预测上与复杂方法竞争力相当(ref 133)
  • 结果表明几乎所有模型精度可归因于学习数据集偏差而非可泛化物理——学习偏差不需要 GNNs/CNNs 等高级架构(refs 49, 134–136)
  • 消融测试应随领域从"仅改算法"转向"更关注数据"而更普遍
  • 不同模型训练数据开始分化时,比较方法将更复杂——消融研究可提供哪些变化最有效的更清晰洞见
  • AlphaFold 2 的广泛消融测试是典范——展示了是多个新特性组合而非单一特性贡献了显著精度提升(ref 13)
  • 我的分析:"简单决策树与复杂 GNN 竞争力相当"的发现(ref 133)是本文最具杀伤力的论据——它表明在当前基准上,复杂架构的额外计算成本可能是不必要的。这与 PIML 综述中"传统方法在 forward 问题上优于 PINNs"的判断形成呼应:在科学 ML 中,复杂性不一定带来优势。AlphaFold 2 的消融测试作为典范被引用,暗示小分子 ML 应采用类似的系统性消融方法论。但消融测试有一个隐含假设:模型组件的贡献是可加的——实际上组件间可能存在强交互效应,逐个消融可能误导。

段落 2:测试与实际使用场景脱节

  • 核心论点:ML 方法的评估场景(如 redocking)与实际药物发现使用场景(如 docking 到预测结构)脱节,导致精度被高估。
  • 支撑论据:
  • 方法常在训练数据类型上评估,但在药物发现中用于不同类型数据——差异常未被考虑
  • docking 方法常在"redocking"(给定天然蛋白构象重获配体姿态)上评估——但 redocking 需要已存在的晶体结构,抵消了 docking 的需求
  • 在更现实测试集上(docking 到不准确构象或预测结构),精度远低(refs 39, 50)
  • 逆合成类似:单步方法在单步反应预测上基准化(USPTO-50k),但实际与路径搜索算法(如 MCTS, ref 137)组合用于全反应路径
  • 单步方法在基准上的精度与组合路径搜索算法后成功找到全反应路径的能力之间存在脱节(ref 27)
  • USPTO-50k 等基准被发现在评估可训练于更大更多样数据集的模型时不适当小(ref 27)
  • 需要更严格验证和基准化以更接近真实药物发现项目
  • 在线排行榜(如 Therapeutic Data Commons, ref 138)可集中结果;公开盲评竞赛(D3R ref 139, CACHE ref 140)通过保持验证数据私有提供更公平评估
  • 我的分析:"redocking 高估 docking 精度"的论点揭示了科学 ML 评估中的一个普遍问题——评估场景的乐观偏差。redocking 给定天然构象相当于给了模型一个"答案提示",而真实 docking 面临蛋白构象不确定性。这一发现对 PIML 在血管力学中的评估也有启示:如果 PINN 在已知解的 forward 问题上评估,可能高估其在未知参数 inverse 问题上的能力。盲评竞赛(D3R, CACHE)通过保持验证数据私有避免了过拟合基准,但规模和频率有限——无法覆盖所有任务类型。

Conclusion and future outlook

段落 1:结论与展望

  • 核心论点:小分子药物发现 ML 的革命性进展不仅依赖算法复杂度,还依赖训练和验证数据的质量、多样性和数量——需要算法+数据+验证的协同改进。
  • 支撑论据:
  • ML 革命性小分子治疗开发的承诺不仅依赖算法复杂度,还依赖训练和验证数据的质量、多样性和数量
  • 关键挑战:模型对训练分布外数据泛化差、学习数据中的混淆趋势(如数据集偏差)
  • 这些限制凸显了重新聚焦数据和验证的必要性——当前阻碍了 ML 算法的潜力
  • 改进路径:数据增强、数据抓取、众包数据和联邦学习增加数据量
  • 同时需处理 PAINs、不同实验条件噪声和误导性数据偏差等混淆因子
  • 严格训练/验证分割应避免奖励学习偏差的模型
  • 领域需转向更严格验证方法以阐明哪些方法和数据类型贡献更高精度
  • 未来光明但实现潜力需平衡关注模型开发的所有组件——从 ML 架构到数据到验证
  • 我的分析:这段的结论与开篇呼应——"AlphaFold 2 时刻"需要算法+数据+验证的系统性突破而非单一算法创新。"平衡关注所有组件"的呼吁是对当前"过度关注算法、忽视数据和验证"倾向的纠正。但展望中未提出具体的里程碑或时间表——如何判断领域是否在向"AlphaFold 2 时刻"靠近缺乏可衡量的指标。数据质量改进(如更严格的发表指南、标准化 assay)需要社区共识和时间,这比算法创新的周期更长——因此即使方向正确,突破的时间可能仍较远。

摘要概述

这篇 Perspective 论证:小分子药物发现领域的机器学习方法未来突破将主要来自数据(数量与质量)的改进,而非单纯依赖更先进的算法架构。作者通过三个常用 benchmark(CASF-2016 结合亲和力预测、USPTO-50k 逆合成、HIV MoleculeNet QSAR 分类)按发表年份绘制性能曲线,发现多年间仅有微小甚至零改进(Pearson R 或 AUROC 几乎不随时间上升),并不存在类似 AlphaFold 2 那样的"跃迁时刻"。即便引入 GNN、transformer、equivariant 网络、diffusion 等新架构,对小分子任务的泛化与精度提升也十分有限,部分 diffusion 生成器甚至无法产生物理上合理的分子。作者剖析了三类数据瓶颈——数据稀缺(公开数据仅数万至数十万量级,远低于 LLM/图像模型的数亿)、数据偏倚(人为采样偏倚 anthropogenic bias 与数据集固有归纳偏倚 inductive bias)、标签噪声(不同 assay 来源 IC50/Ki 不可比、PAINs 假阳性)——并提出数据增强、文献挖掘(dark data)、众包(COVID Moonshot)、联邦学习(MELLODDY)、domain adaptation、严格的训练-验证划分与 ablation 测试、盲测竞赛(D3R、CACHE)等应对策略。核心结论是:算法、数据、验证三者需均衡发展,单纯追逐新架构难以带来真正的药物发现效益。

关键图表

  • Fig. 1(benchmark 性能 vs 发表年份):CASF-2016(Pearson R 与年份 ρ=0.03,几乎无趋势)、USPTO-50k(top-1 accuracy,ρ=0.87,有渐进但非跃迁)、HIV MoleculeNet(AUROC,ρ=0.09,无趋势)三张散点图,按 ML 架构(GNN/Transformer/CNN/Tree/NN/Non-ML)着色。直观证明近年新架构未带来实质性能提升,是该文最有说服力的实证证据。

与我的关联

本文虽聚焦药物化学,但其方法论警示对任何应用 ML 领域都成立——即"数据量、数据质量、严格的 baseline 与 ablation 验证"比堆砌模型架构更关键;这些原则(警惕分布外泛化失败、训练偏倚、标签噪声、redocking 式过乐观验证)可作为审视自身计算生物力学 ML 建模时的对照清单。