比较角色,而非先比较结果
化学工作流可能涉及分子处理、性质预测和合成规划,但这些任务并不能互相替代。本合集将 RDKit、Chemprop、DeepChem 和 AiZynthFinder 放在一起,旨在帮助明确各自的角色,而非对其科学性能进行排名,也不暗示它们已组成经过测试的流水线。
先确定工作流需要支持的决策:你是在准备分子表示、估算实测性质、探索建模方法,还是提出逆合成路线?只选择该决策所需的组件。纳入每一种资源会增加需要检查的边界,却未必能改善科学结论。
以下能力来自官方来源和已整理的资源参考。连接测试和规划示例属于建议的评估步骤,并非第一手测试报告。
为每项资源指定具体任务
- RDKit 提供化学信息学操作,包括二维和三维分子处理以及描述符生成。整理的参考资料还介绍了指纹生成。可考虑将其用于分子处理和特征准备,而不是视作现成的性质预测器。
- Chemprop 是一个基于 PyTorch 的框架,用于训练和评估消息传递神经网络,以预测分子性质。其文档涵盖训练、预测、数据拆分、缩放和额外特征工作流。这些选项并不能证明其对某个特定终点具有准确性。
- DeepChem 是更广泛的科学机器学习工具链,涵盖药物发现、材料科学、量子化学和生物学。其代码库介绍了 TensorFlow、PyTorch 和 JAX 依赖,并建议逐步调整教程。明确输入或输出前,应先选定具体示例和模型。
- AiZynthFinder 用于逆合成规划。其默认搜索采用蒙特卡洛树搜索,并由基于反应模板的神经网络扩展策略引导。它需要库存文件和经过训练的扩展策略;经过训练的过滤策略则为可选项。
Chemprop 和选定的 DeepChem 工作流可以作为建模比较的候选方案。AiZynthFinder 回答的是关于拟议路线的另一类问题。因此,在后续决策中,性质预测和路线提议应作为彼此独立的证据。
明确输入和输出边界
对每个拟议的交接,先编写简短规范,再实现转换。记录以下内容:
- **输入:**表示形式、必需字段、分子标识符和缺失值规则。
- **转换:**你拟议的任何分子标准化、特征计算或目标缩放。
- **输出:**字段名称、顺序、单位、标识符和失败状态。
- **来源与处理记录:**组件版本、配置、数据集来源以及模型或资产标识。
- **失败处理:**无效输入是被拒绝、保留并附带警告,还是排除。
确认手性交接过程中立体化学、电荷和不连通组分是否保持一致。如果使用描述符,记录其名称和顺序;没有特征定义的数值数组并不是完整的接口约定。
来源摘录并未为每项资源都明确输入和输出的具体架构。AiZynthFinder 文档中的 CLI 示例使用 SMILES 文件和配置文件,但这并不能证明它能从其他组件直接导出数据。对于未记录的连接方式,在核实前应标记为未知。
分步评估拟议的连接方式
尝试完整工作流之前,先用一组规模较小且具有代表性的输入进行测试。既包括常规记录,也包括刻意设置的问题案例,例如缺失结构、重复标识符和目标单位不一致。预先确定预期处理方式,再检查成功输出和失败情况。
DeepChem 将 RDKit 列为核心需求之一。这种依赖关系说明二者有关联,但不能证明任何 RDKit 派生特征表都适用于任何 DeepChem 模型。同样,Chemprop 文档提到额外描述符,但拟议的描述符交接仍需检查架构和配置。
对于预测建模,应确定数据如何拆分、哪种指标适合目标终点,以及如何处理重复或相关记录。将评估数据与模型开发期间作出的决策分开。只有在终点定义、单位、评估记录和预处理选择都一致时,才比较候选方案。
应针对所选版本记录环境限制,而不要假设一个环境可以支持全部四个项目。整理的 DeepChem 参考资料指出其 Python 兼容性声明存在差异;在规划安装前,应根据所选软件包配置核实这些差异。
规划示例:假设的候选分子短名单
假设某团队拥有溶解度实测记录,以及另一组候选分子。团队希望筛选候选对象以供科学审查,随后探索可能的合成路线。这是一个假设性规划示例;此处未报告模型训练、数据转换或路线搜索。
**计划输入:**分子标识符、分子表示、溶解度实测值、单位和测量背景。保留原始记录,并与任何拟议的处理后表示一并保存。
**阶段 1 — 分子准备:**考虑使用 RDKit 进行分子处理。计划输出为按标识符关联的表格,其中包含已接受记录、处理决策,以及附有原因的拒绝记录。具体实现方式应根据文档确定。
**阶段 2 — 性质建模:**选择 Chemprop 或某个具体的 DeepChem 示例进行初步评估。计划输出为按标识符关联的预测表,并包含终点单位、模型标识和评估证据。不要假设其中提供了适用的预训练模型。
**阶段 3 — 路线探索:**仅在检查输入边界后,将选定的目标表示传递给单独配置的 AiZynthFinder 工作流。计划输出为与每个目标关联的候选路线信息,以及所用的库存和策略资产。
**决策问题:**测量背景是否足够一致,适合建模?选择某个候选对象的依据是什么?路线搜索资产是否适用于这些目标?由谁评估拟议路线?将预测和路线提议保存在不同字段中,不要凭空构造组合评分。
审查许可与科学局限
分别检查代码、模型权重、数据集、库存文件以及任何服务条款。开展这项工作时,记录确切的许可来源和检查日期。代码许可证并不能确立所有相关资产都可再分发。
成功完成数据转换并不能证明预测具有泛化能力。同样,拟议的逆合成路线也不能证明其在实验室中可行或前体当前可获得。在依据任一输出采取行动前,应进行适当的科学评估。
本合集仍是草稿,尚待编辑筛选和来源审查。它不包含性能排名、已完成的科学测试或经过测试的兼容性声明。
组建工作流前
- 明确科学决策和所需终点。
- 为每项选定资源指定一个明确角色。
- 规定标识符、表示形式、单位和失败处理方式。
- 扩大规模前,先检查有代表性的转换案例。
- 记录版本、配置以及数据或资产来源。
- 确保建模比较条件一致,并保持评估边界。
- 按组件检查许可;未解决的事实仍标记为未知。