明确科学问题
可复现的化学 AI 工作流不仅需要保存模型和分数,还需要提供足够的背景信息,让其他研究人员了解评估了什么、重建操作流程,并判断结果是否支持预期决策。
先撰写一份简短的评估说明:目标性质或生成目标、相关实验条件、预期用途,以及有用答案应满足的标准。区分对实测终点的预测与对计算评分函数的优化。两者都不能自动证明结果具有实验用途。
请思考:这项评估将为哪项决策提供依据?决策时可以获得哪些输入?哪些错误会导致输出不适用?在选择模型或检查结果之前,先明确这些要点。
按评估角色选择资源
链接的资源参考资料介绍的是不同的角色,并非已测试过的组合工作流:
- RDKit 提供分子操作、描述符和指纹。它可用于建议的预处理或特征生成阶段;请记录实际选用的操作。
- Chemprop 介绍了使用消息传递神经网络进行训练、评估和预测,包括分子和反应工作流。请选择相关教程,不要假设所有任务都采用相同的输入格式。
- GuacaMol 提供分布学习和目标导向的分子生成基准,以及基于 ChEMBL 构建的标准化数据集。它是评估框架,而不是生成器本身。
- MOSES 汇集了分子生成参考数据、基线方法和集合级指标,包括有效性、新颖性和多样性。
- Matbench 提供 13 项经过整理的材料科学预测任务。规划评估前必须检查任务定义。
选择与研究问题的任务和数据相匹配的资源。该列表不能证明各软件包之间兼容,也不能证明它们在你的数据上表现如何。
固定环境和配置
执行前先创建运行清单。记录代码修订版本、依赖版本、模型配置、检查点标识符、随机种子,以及适用时的硬件信息。将配置文件与结果一同保存,不要依赖记忆中的默认设置。
版本选择对 Chemprop 尤其重要:其准备的参考资料介绍了实质性的 v2 重写、默认设置变更,以及对 v1 的停止支持。记录实际使用的版本;不要假定不同发行版本的工作流可以互换。
将环境重建与数值可重复性区分开来。保存依赖项或许有助于重新运行,但不能保证输出完全相同。适当规划重复运行,并记录观察到的变异;没有证据时,不要声称结果具有确定性。
保留输入和转换记录
在许可允许的情况下,保留不可变的源数据副本,并将派生数据单独存放。记录数据集来源、稳定标识符、校验和、目标定义、单位和测量条件。保留转换日志,将每条派生记录与其源记录关联起来。
记录每个预处理步骤的目的及其影响:分子标准化、重复项处理、缺失标签排除、特征生成和单位转换。保留执行这些更改所用的代码和配置。若某条记录被拒绝,在许可允许的情况下,保留其标识符和拒绝原因。
明确规定输入/输出契约。一个建议的性质预测工作流可以接收包含标识符和实测目标的分子记录,并输出与这些标识符关联的预测结果。具体的软件包格式仍需查阅相关文档。对于 MOSES,链接的参考资料特别说明,生成的 SMILES 是指标的输入,而 metrics.csv 是其基线工作流的输出。
在选择结果之前设计评估
保存数据划分分配,并说明它们为何能代表预期的部署情境。检查相关结构、重复测量或预处理决策是否可能导致训练数据与评估数据之间的信息泄漏。将模型选择与最终评估分开处理,包括将从数据中学习到的转换步骤也纳入考虑。
在比较候选方案前选定基线和指标。记录指标定义、聚合规则、排除项,以及用于证明各项比较合理的依据。保留预测、误差、失败的运行和基线结果,而不只是最高分。
对于生成任务,记录请求和返回的样本数量、评分目标、无效输出及重复运行程序。MOSES 建议至少生成 30,000 个分子,并通过重复实验估计指标方差。GuacaMol 为分布学习和目标导向评估提供了不同接口;请记录所用的评估方式。不要将这些分数解读为对生成分子的前瞻性验证。
规划示例:假设的性质研究
假设一个团队希望将分子性质预测器与基于描述符的基线方法进行比较,以预测某个实测终点。这只是一个假设性的计划,并非已完成的实验或经过测试的集成方案。
- 明确决策。 说明预测器是否用于优先筛选待后续测量的化合物。在训练前记录终点、单位、条件和可接受的误差标准。
- 固定输入。 保留包含记录标识符、分子表示和标签的源表。按照商定的标准化和排除规则,创建有记录可查的派生表。
- 准备评估。 保存数据划分归属及其理由,使之符合预期用途。将最终评估数据与候选方案选择过程分开。
- 规定候选工作流。 建议使用 RDKit 描述符作为基线,并使用 Chemprop 模型进行比较。尝试集成前,先检查所选接口及数据处理方式。
- 保留输出。 为每次计划的运行保存与标识符关联的预测、配置、检查点引用、基线输出、指标和失败日志。
- 作出决策。 根据预先定义的标准比较结果,并检查重要的错误案例。如果条件缺失或数据覆盖不足以支持有意义的结论,就记录这一限制,而不是只突出最高分。
最终记录应说明如何重新运行这项比较,以及它为何能够或不能够回答科学问题。
附上证据并说明局限
区分来源资料所述的能力、本地观察到的结果和拟议的评估步骤。将文档链接与其支持的说法放在一起。如果进行了来源核查,应将核查日期与实验日期分开记录;仅有链接并不代表已经完成审查。
基准测试各有边界。MOSES 使用经过筛选的化学参考集合,因此其比较并不代表不受限制的化学空间。来源摘录未详细说明 Matbench 任务的输入、指标和数据划分;设计运行前请查阅其文档。可复现的计算结果仍需结合领域知识解读,且不能证明生物活性或合成可行性。
维护记录:可执行检查清单
指定负责人并定义重新评估的触发条件,包括新增数据、依赖项变更、模型修订或预处理方式改变。保存恢复流程,并注明制品存放位置和访问要求。
结束评估前,请检查:
- 科学问题和决策标准已明确。
- 输入、转换和数据划分分配均可追溯。
- 环境、配置和检查点均已记录。
- 输出、排除项、失败情况和基线均已保留。
- 来源资料中的说法与实验结果已明确区分。
- 局限、负责人和重新评估触发条件均已记录。