概览
GEOM 是一个分子构象数据集,旨在用于性质预测和分子生成研究。项目 README 描述了该数据集包含 3,700 万个构象,覆盖超过 450,000 个分子,并附有能量和统计权重标注。其仓库提供用于访问和分析数据的 Jupyter 教程,而非独立的预测模型。基于构象的模型训练请参见单独的 Neural Force Field 仓库。
数据通过链接的数据存档分发。四个 MessagePack 存档涵盖类药分子和 QM9 分子的原始及特征化表示,支持跨编程语言加载。对于 Python 工作流,rdkit_folder.tar.gz 提供包含坐标和连接关系的 RDKit mol 对象。文档说明的工作流从下载存档开始,依次完成分子记录加载、可视化、派生描述符计算或 PDB 导出。每个分子的轻量级 JSON 摘要允许用户在加载单独的 RDKit pickle 文件之前筛选记录,无须先加载所有构象。
README 还介绍了新增的 16,000 多个 MoleculeNet 物种,其中包括 CREST 系综;对于 BACE 子集,还包含 Hessian 数据和高精度 DFT 结果。专门的教程介绍了如何加载这些记录,以及如何比较不同理论层级生成的系综。一项重要的分发限制是:随着 Python 专用数据中加入新分子,MessagePack 文件不会随之更新。因此,用户应根据覆盖范围需求选择表示形式,并查阅存档 README 以验证校验和。文档所述的依赖环境是来源中报告的配置,并不能证明其与其他环境兼容。
主要功能
- 为涵盖超过 450,000 个分子的 3,700 万个分子构象提供能量和统计权重标注。
- 四个与语言无关的 MessagePack 存档:`drugs_crude.msgpack.tar.gz`、`drugs_featurized.msgpack.tar.gz`、`qm9_crude.msgpack.tar.gz` 和 `qm9_featurized.msgpack.tar.gz`。
- Python 专用的 RDKit `mol` 记录,包含构象坐标和分子连接关系,并附有可视化、描述符生成和 PDB 导出教程。
- 轻量级 `rdkit_folder/{drugs,qm9}_summary.json` 文件,可在加载单独的构象记录之前筛选分子。
- 新增的 MoleculeNet 数据包含 CREST 系综,BACE 子集还提供 Hessian 数据和高精度 DFT 结果。
- 介绍如何加载 MoleculeNet 记录以及比较不同理论层级生成的系综的教程。
使用场景
- 建议的评估:将带标注的构象系综用作分子生成或基于构象的性质预测的训练数据或评估数据,并参阅另行链接的 Neural Force Field 训练工作流。
- 建议的分析:通过摘要 JSON 文件筛选特定性质的分子子集,然后可视化构象或计算 RDKit 描述符,而无须先加载整个数据集。
- 建议的评估:使用系综比较教程比较不同理论层级下可用的 MoleculeNet 系综,并在适用时纳入文档所述的 BACE 专属结果。
使用方式
- 阅读仓库 README,了解数据集表示形式和文档所述的依赖环境。跨语言访问可选择 MessagePack;Python 工作流可选择 RDKit 记录。
- 访问数据存档,选择相关文件,并查阅其中的 README 以验证校验和。评估分子覆盖范围时,需考虑文档所述的 MessagePack 文件不再更新这一情况。
- 按照 MessagePack 加载教程进行提取和加载,或按照 RDKit 教程使用 Python 专用记录。
- 若要开展有针对性的分析,请先查看摘要 JSON 文件,再加载单独的 RDKit pickle 文件。使用 RDKit 教程探索构象、生成描述符或导出 PDB 文件。
- 对于新增物种,请参阅 MoleculeNet 教程和系综比较教程。使用数据时请引用 GEOM 论文。