概览
DiffDock 是一个研究实现,用于预测小分子与蛋白质结合后的三维结构。它支持分子对接工作流中的构象生成阶段,而非直接估算结合亲和力。项目 README 指出,该仓库默认运行 DiffDock-L;若要使用原始 DiffDock 模型,则引导用户查看仓库历史记录。
输入可以将 .pdb 格式的蛋白质结构与配体结合起来,配体可表示为 SMILES 字符串或 RDKit 可读取的文件,例如 .sdf 或 .mol2。用户也可以提供蛋白质序列,工作流会使用 ESMFold 对其进行折叠。用户可以直接提交单个复合物,也可以使用 CSV 描述多个蛋白质–配体对,以进行批量推理。输出包括预测的结合结构和置信度评分。仓库还介绍了用于单个复合物的本地图形界面,并链接到托管于 Hugging Face Spaces 的界面。
置信度评分表示模型对预测构象的信心,并不代表结合亲和力;README 提醒,不应在不同复合物或蛋白质构象之间直接比较这些评分。其解读指南假定输入与训练场景相似:类药配体和处于近结合构象的中等大小蛋白质。该模型旨在进行小分子与蛋白质的对接,并非用于较大生物分子之间的相互作用。对于下游亲和力估算,作者建议先对预测结构进行松弛,再应用独立的评分或自由能方法。使用提供的 .pdb 结构进行本地推理支持 CPU 执行,不过 README 建议使用 GPU。
主要功能
- 预测蛋白质–小分子复合物结构并提供构象置信度评分;当前仓库默认使用 DiffDock-L。
- 接受 `.pdb` 格式的蛋白质文件,或通过 ESMFold 折叠的蛋白质序列。
- 接受配体 SMILES 字符串和 RDKit 可读取的分子文件,包括 `.sdf` 和 `.mol2`。
- 支持单个复合物推理,以及基于包含蛋白质和配体输入的 CSV 记录进行批量推理。
- 提供本地单复合物图形界面、托管的 Hugging Face Spaces 界面,以及有文档说明的 Conda 和 Docker 设置路径。
- 介绍 PDBBind、DockGen 和 PoseBusters 的基准评估工作流,包括缓存 ESM2 嵌入的准备工作。
使用场景
- 预期评估:为类药配体和蛋白质结构生成候选结合构象,然后检查这些构象及其置信度评分。
- 预期评估:通过基于 CSV 的推理处理一组蛋白质–配体对,以评估其是否适用于研究型分子对接工作流。
- 预期评估:使用 ESMFold 生成的蛋白质结构探索基于序列的对接,同时考虑 README 关于未结合构象的注意事项。
- 预期评估:将预测结构用作独立亲和力评分或自由能工作流的起始输入,并按照作者建议进行结构松弛。
使用方式
- 阅读官方仓库文档,尤其是推理和 FAQ 部分。确定需要默认的 DiffDock-L 模型,还是通过仓库历史记录介绍的原始模型。
- 若要初步试用单个复合物,请使用链接的 Hugging Face Spaces 界面。若要在本地运行,请遵循 README 中的 Conda 或 Docker 设置说明;其中也介绍了本地图形界面。
- 准备一个蛋白质
.pdb文件或用于 ESMFold 的序列,以及配体 SMILES 字符串或 RDKit 可读取的文件。若要处理多个复合物,请遵循文档说明的 CSV 字段,并参考data/protein_ligand_example.csv。 - 参照仓库中的推理示例,选择配置、输入和输出目录。请考虑初始分布表缓存;README 建议在条件允许时使用 GPU 执行。
- 按照 FAQ 中的限定说明检查预测结构和置信度评分。若计划开展下游亲和力工作流,应评估结构松弛和独立评分方法,而不要将置信度视为亲和力。基准评估可参阅仓库中的数据集和复现部分。