概览
MolGPT 是一个分子生成模型项目,核心是通过下一词元预测训练的小型自定义 GPT。README 描述了使用 MOSES 和 Guacamol 数据集进行训练,并使用训练得到的模型进行无条件和有条件分子生成。其引用的预印本将该方法称为 transformer 解码器模型。在研究工作流中,该仓库可作为探究这种生成方法的入口,而不是一个有完整端到端文档的分子设计服务。
文档中说明的训练输入是经过处理的 CSV 格式数据集文件,必须放在与代码文件相同的目录中。README 链接了这些处理后的数据集、其上游 MOSES 和 Guacamol 仓库,以及单独的训练权重集合。README 列出了针对不同数据集的训练脚本和两个生成脚本。分子生成是明确说明的输出任务,但来源摘录没有说明生成结果的表示形式、输出文件格式或如何提供条件输入。
所述工作还包括可解释性:使用 Ecco 库生成显著性图。README 表示 MolGPT 与此前的方法在两个数据集上进行了比较,但未提供数值结果或评估方案。因此,现有证据支持训练、生成和显著性分析工作流,但无法据此确认模型性能、化学有效性或生成候选分子的实际效用。来源摘录未说明安装要求、硬件需求或详细参数配置。
主要功能
- 使用 MOSES 和 Guacamol 数据集,以下一词元预测目标训练的小型自定义 GPT。
- 按 README 所述,支持无条件和有条件分子生成。
- 提供单独的训练入口 `train_moses.sh` 和 `train_guacamol.sh`。
- 列出生成入口 `generate_guacamol_prop.sh` 和 `generate_moses_prop_scaf.sh`。
- 链接处理后的 CSV 数据集和单独的训练模型权重集合。
- 介绍基于 Ecco 的显著性图,用于模型可解释性分析。
使用场景
- 拟评估用途:使用所链接的数据集和训练权重,研究无条件和有条件分子生成。
- 拟评估用途:研究针对 MOSES 和 Guacamol 的数据集专属训练工作流,并依据独立制定的评估方案评估生成候选分子。
- 拟评估用途:探索基于 Ecco 的显著性分析,以考察模型在分子生成过程中的行为。
使用方式
- 阅读官方 README,区分训练和生成入口。所提供的说明未指定依赖项、硬件要求或配置详情。
- 从所链接的下载文件夹获取处理后的 CSV 数据集。有关数据集背景,请参阅上游 Guacamol 和 MOSES 仓库。
- 按照说明,将所选数据集 CSV 放在与代码文件相同的目录中以进行训练。在仓库中查看
train_moses.sh或train_guacamol.sh,然后再选择相应的工作流。 - 如需基于权重进行评估,请参阅训练权重集合。查看生成脚本,以确定其预期输入和权重加载配置;摘录中未提供这些详情。
- 选择相关的已记录生成入口,并规划对其输出进行独立检查。如需研究可解释性,请查看仓库中与 Ecco 相关的实现;README 提到了显著性图,但未说明具体流程。