概览
EquiBind 是一种用于蛋白质–配体结合结构预测的几何深度学习模型。其 SE(3)-等变架构通过直接预测工作流,同时预测受体结合位置(即盲对接)以及配体的结合姿势和朝向。代码库提供模型权重、推理配置和训练说明,因此它是一种用于生成结构预测的资源,而不是经过实验确立的结合姿势数据库。
在标准推理中,每对蛋白质–配体对应一个单独的输入目录。受体以 .pdb 文件形式提供,文件名中包含 protein;配体可使用 .mol2、.sdf、.pdbqt 或 .pdb 格式,文件名中包含 ligand,并且需包含所有氢原子。预测结果以 .sdf 文件和张量形式写出。另有一种工作流可处理单个 .sdf 文件中的多个配体,并将其与单个受体进行预测;该工作流会生成预测构象,并分别列出成功案例和已处理的失败案例。
文档所述的设置提供了独立的 CUDA GPU 和仅使用 CPU 的环境文件。研究人员也可以训练模型、将权重保存到 runs,并通过复现配置评估这些权重。这些工作流可用于在结构预测流程中评估模型,但来源摘录并未证明模型对特定目标或数据集的准确性。
数据集获取是一个实际限制:由于许可不允许再分发,之前托管的预处理 PDBBind 数据已不再提供。对于文档所述的数据集工作流,用户必须直接从 PDBBind 获取数据。README 还建议考虑将 DiffDock 作为较新的方法;本条目不对该比较进行独立评估。
主要功能
- 使用 SE(3)-等变几何模型,直接预测受体结合位置和配体结合姿势。
- 使用提供的权重对蛋白质–配体对进行推理,支持四种有文档说明的配体文件格式及 `.pdb` 受体文件。
- 将预测结果导出为 `.sdf` 结构和张量,输出位置由推理配置控制。
- 针对一个受体进行多配体推理,输出构象,并分别记录成功案例和已处理的失败案例。
- 分别提供有文档说明的 CUDA GPU 和仅使用 CPU 的环境配置。
- 提供训练和测试集评估工作流,包括 EquiBind-U 以及带有配体点云拟合校正的 EquiBind 的复现配置。
使用场景
- 预期评估用途:为准备好的蛋白质–配体对生成候选结合位置和配体姿势,然后根据适当的结构参考进行评估。
- 预期评估用途:针对一个受体处理多配体 `.sdf` 文件,并检查预测构象和记录的推理失败案例。
- 预期评估用途:使用适当获取的 PDBBind 数据进行训练,并通过有文档说明的测试工作流,将生成的预测与使用所提供权重得到的预测进行比较。
使用方式
- 阅读官方 README,并查阅论文以了解方法背景。选择使用所提供权重进行推理,或采用训练或复现工作流。
- 获取代码库,并按照其中的 Anaconda 设置说明操作。文档所述的 CUDA 路径使用
environment.yml,仅使用 CPU 的设置使用environment_cpuonly.yml;请确认其适用于自己的环境。 - 为每个复合物准备一个目录。受体
.pdb文件名中应包含protein,受支持的配体文件名中应包含ligand。配体需包含所有氢原子;README 提到训练蛋白质使用了 reduce。 - 在
configs_clean/inference.yml中设置inference_path并检查output_directory。按照 README 中的推理流程操作,然后检查保存的.sdf结构和张量输出。对于多配体输入,也要检查其成功和失败记录。 - 若要训练或复现,请直接从 PDBBind 获取数据,并将其放在
data/PDBBind。按照文档所述的配置操作,并在后续使用前,根据适当的参考评估预测结果。