Skip to content

Nature Computational Science, Editorial · 2021 · Nature Computational Science

#machine-learning #reproducibility

??? info "Metadata" DOI: 10.1038/s43588-021-00152-6

📄 Quick Note

摘要概述

这是一篇 Nature Computational Science 的社论(editorial),针对机器学习驱动的计算科学研究提出可复现性(reproducibility)报告规范建议。作者指出 ML 领域正面临"reproducibility crisis",根源在于数据收集、清洗、模型选择与训练等环节缺乏透明披露。建议覆盖三个层面:(1) 数据报告——需详述数据来源、偏差(bias)、清洗/整理步骤,以及 train/validation/test 划分依据;(2) 模型报告——需论证模型选择与复杂度、进行 ablation study、披露训练时间与硬件、固定随机种子(seeding);(3) 数据/代码/模型可用性——训练与数据预处理代码、训练好的模型权重都应公开,并报告软件库版本与硬件架构以避免环境差异导致的不可复现。文末强调这不是穷尽清单,隐私与伦理议题(如医疗数据)未展开,目的是开启社区对话。

关键图表

本文为短社论,无 figure。核心内容以分节小标题组织:Data reporting / Model reporting / Availability of data, code, and models / Final remarks——这四节本身即其"建议清单"的结构化呈现。

与我的关联

作为计算力学研究者若日后引入 ML(如数据驱动的本构模型、代理模型 surrogate model),这份清单即是投稿前自查表;尤其"固定随机种子 + 报告训练时间 + 公开训练好的模型"三点对力学社区尚不普及,值得在自身工作流中提前养成习惯。