概览
Chemprop 提供的是用于构建分子性质预测器的框架,而不是单个预训练模型或托管预测服务。其官方文档介绍了基于 PyTorch 的消息传递神经网络,并提供命令行教程和 Python 模块,支持训练、评估和预测。它适用于研究工作流:用户可针对自己的化学性质任务开发模型,再将这些模型用于其他输入。
文档所述的数据工作流包括数据点、数据集、数据加载器、数据拆分,以及分子和反应的图特征化。示例涵盖分类、多组分回归、反应回归和多任务模型。根据所选工作流,输出包括性质预测、原子和化学键预测,或学习得到的指纹表示。文档还列出了模型保存与加载、集成、输入/输出缩放、额外描述符,以及使用 RayTune 或 Optuna 进行超参数优化。应在相关教程中核实确切的输入架构和输出格式;来源摘录未对此作出说明。
其他笔记本涉及不确定性量化、主动学习、迁移学习,以及使用 Myerson 值、蒙特卡洛树搜索和 Shapley 分析进行解释。这些是文档中介绍的工作流选项,并不能证明模型在新数据集上的准确性。版本选择很重要:README 介绍了 v2 的重大重写、默认设置的变更,以及对 v1 支持的终止。README 还指出,其边更新实现与所引用理论论文中的做法存在差异。所提供的来源无法证明其预测性能,也无法确定它是否适用于特定科学终点。
主要功能
- 提供命令行训练和预测教程,以及针对消息传递神经网络模型的 Python 模块教程。
- 支持分子和反应图特征化,并提供分类、多组分回归、反应回归和多任务示例。
- 支持原子和化学键性质预测,包括一个受约束预测笔记本。
- 提供学习得到的指纹提取、模型保存与加载、集成,以及输入/输出缩放工作流。
- 提供使用 RayTune 或 Optuna 进行超参数优化的教程和笔记本。
- 提供有关不确定性量化、迁移学习和预测解释的笔记本示例,所用方法包括 Myerson 值、蒙特卡洛树搜索和 Shapley 分析。
使用场景
- 建议的评估:在分子性质数据集上训练分类或回归模型,并在留出拆分上评估预测结果。
- 建议的评估:使用相应的训练和预测笔记本,探索反应性质回归或多组分回归。
- 建议的评估:提取学习得到的分子指纹,并评估其在独立下游分析中的效用。
- 建议的评估:针对相关化学终点考察原子/化学键预测或解释方法,并依据领域特定证据核验其效用。
使用方式
- 从 Quickstart 和 Installation 页面开始。选择预期使用的发行版本,并核对该版本文档中的环境要求,不要假定较早的设置说明仍然适用。
- 查看 datapoints tutorial 和 data splitting tutorial。使输入和目标与所选任务相匹配,并规划单独的评估拆分。
- 按照 CLI training tutorial 操作,或选择合适的 notebook example。先进行小规模评估运行,再扩展工作流。
- 查阅 saving and loading models 和 prediction tutorial,以复用已训练的模型并检查其预测结果。
- 如有需要,可进一步了解 hyperparameter optimization 或 uncertainty quantification。记录配置选择,并评估其对任务的影响;这些是建议进行的检查,并非已报告的基准测试结果。