Skip to content

Durant, Guy; Boyles, Fergus; Birchall, Kristian et al. · 2024 · Nature Computational Science

Metadata

Authors: Durant, Guy; Boyles, Fergus; Birchall, Kristian; Deane, Charlotte M.

DOI: 10.1038/s43588-024-00699-0

Tags: #drug-discovery #machine-learning

📄 Quick Note

摘要概述

这篇 Perspective 论证:小分子药物发现领域的机器学习方法未来突破将主要来自数据(数量与质量)的改进,而非单纯依赖更先进的算法架构。作者通过三个常用 benchmark(CASF-2016 结合亲和力预测、USPTO-50k 逆合成、HIV MoleculeNet QSAR 分类)按发表年份绘制性能曲线,发现多年间仅有微小甚至零改进(Pearson R 或 AUROC 几乎不随时间上升),并不存在类似 AlphaFold 2 那样的"跃迁时刻"。即便引入 GNN、transformer、equivariant 网络、diffusion 等新架构,对小分子任务的泛化与精度提升也十分有限,部分 diffusion 生成器甚至无法产生物理上合理的分子。作者剖析了三类数据瓶颈——数据稀缺(公开数据仅数万至数十万量级,远低于 LLM/图像模型的数亿)、数据偏倚(人为采样偏倚 anthropogenic bias 与数据集固有归纳偏倚 inductive bias)、标签噪声(不同 assay 来源 IC50/Ki 不可比、PAINs 假阳性)——并提出数据增强、文献挖掘(dark data)、众包(COVID Moonshot)、联邦学习(MELLODDY)、domain adaptation、严格的训练-验证划分与 ablation 测试、盲测竞赛(D3R、CACHE)等应对策略。核心结论是:算法、数据、验证三者需均衡发展,单纯追逐新架构难以带来真正的药物发现效益。

关键图表

  • Fig. 1(benchmark 性能 vs 发表年份):CASF-2016(Pearson R 与年份 ρ=0.03,几乎无趋势)、USPTO-50k(top-1 accuracy,ρ=0.87,有渐进但非跃迁)、HIV MoleculeNet(AUROC,ρ=0.09,无趋势)三张散点图,按 ML 架构(GNN/Transformer/CNN/Tree/NN/Non-ML)着色。直观证明近年新架构未带来实质性能提升,是该文最有说服力的实证证据。

与我的关联

本文虽聚焦药物化学,但其方法论警示对任何应用 ML 领域都成立——即"数据量、数据质量、严格的 baseline 与 ablation 验证"比堆砌模型架构更关键;这些原则(警惕分布外泛化失败、训练偏倚、标签噪声、redocking 式过乐观验证)可作为审视自身计算生物力学 ML 建模时的对照清单。