跳转到正文

DiffDock

Gabriele Corso, Hannes Stärk, Bowen Jing, Regina Barzilay and Tommi Jaakkola; code maintenance led by Jacob Silterra since 2024

DiffDock 使用基于扩散的模型预测蛋白质–小分子结合构象,支持单个复合物和批量推理、基于序列的蛋白质输入,以及构象置信度评分。

条目更新 ·

概览

DiffDock 是一个研究实现,用于预测小分子与蛋白质结合后的三维结构。它支持分子对接工作流中的构象生成阶段,而非直接估算结合亲和力。项目 README 指出,该仓库默认运行 DiffDock-L;若要使用原始 DiffDock 模型,则引导用户查看仓库历史记录。

输入可以将 .pdb 格式的蛋白质结构与配体结合起来,配体可表示为 SMILES 字符串或 RDKit 可读取的文件,例如 .sdf 或 .mol2。用户也可以提供蛋白质序列,工作流会使用 ESMFold 对其进行折叠。用户可以直接提交单个复合物,也可以使用 CSV 描述多个蛋白质–配体对,以进行批量推理。输出包括预测的结合结构和置信度评分。仓库还介绍了用于单个复合物的本地图形界面,并链接到托管于 Hugging Face Spaces 的界面。

置信度评分表示模型对预测构象的信心,并不代表结合亲和力;README 提醒,不应在不同复合物或蛋白质构象之间直接比较这些评分。其解读指南假定输入与训练场景相似:类药配体和处于近结合构象的中等大小蛋白质。该模型旨在进行小分子与蛋白质的对接,并非用于较大生物分子之间的相互作用。对于下游亲和力估算,作者建议先对预测结构进行松弛,再应用独立的评分或自由能方法。使用提供的 .pdb 结构进行本地推理支持 CPU 执行,不过 README 建议使用 GPU。

主要功能

  • 预测蛋白质–小分子复合物结构并提供构象置信度评分;当前仓库默认使用 DiffDock-L。
  • 接受 `.pdb` 格式的蛋白质文件,或通过 ESMFold 折叠的蛋白质序列。
  • 接受配体 SMILES 字符串和 RDKit 可读取的分子文件,包括 `.sdf` 和 `.mol2`。
  • 支持单个复合物推理,以及基于包含蛋白质和配体输入的 CSV 记录进行批量推理。
  • 提供本地单复合物图形界面、托管的 Hugging Face Spaces 界面,以及有文档说明的 Conda 和 Docker 设置路径。
  • 介绍 PDBBind、DockGen 和 PoseBusters 的基准评估工作流,包括缓存 ESM2 嵌入的准备工作。

使用场景

  • 预期评估:为类药配体和蛋白质结构生成候选结合构象,然后检查这些构象及其置信度评分。
  • 预期评估:通过基于 CSV 的推理处理一组蛋白质–配体对,以评估其是否适用于研究型分子对接工作流。
  • 预期评估:使用 ESMFold 生成的蛋白质结构探索基于序列的对接,同时考虑 README 关于未结合构象的注意事项。
  • 预期评估:将预测结构用作独立亲和力评分或自由能工作流的起始输入,并按照作者建议进行结构松弛。

使用方式

  1. 阅读官方仓库文档,尤其是推理和 FAQ 部分。确定需要默认的 DiffDock-L 模型,还是通过仓库历史记录介绍的原始模型。
  2. 若要初步试用单个复合物,请使用链接的 Hugging Face Spaces 界面。若要在本地运行,请遵循 README 中的 Conda 或 Docker 设置说明;其中也介绍了本地图形界面。
  3. 准备一个蛋白质 .pdb 文件或用于 ESMFold 的序列,以及配体 SMILES 字符串或 RDKit 可读取的文件。若要处理多个复合物,请遵循文档说明的 CSV 字段,并参考 data/protein_ligand_example.csv。
  4. 参照仓库中的推理示例,选择配置、输入和输出目录。请考虑初始分布表缓存;README 建议在条件允许时使用 GPU 执行。
  5. 按照 FAQ 中的限定说明检查预测结构和置信度评分。若计划开展下游亲和力工作流,应评估结构松弛和独立评分方法,而不要将置信度视为亲和力。基准评估可参阅仓库中的数据集和复现部分。

相关资源

AIDDISON Explorer 是一个托管式药物发现平台,可根据目标特性要求、设计约束、预测属性和合成可行性生成并排序分子候选物。

分子生成 · 药物发现

AutoDock Vina

开源工具

AutoDock Vina 是一款开源分子对接与虚拟筛选程序,提供 Vina 和 AutoDock4.2 评分、多配体对接、大环分子支持及 Python 3 绑定。

开源Python

药物发现

Boltz

模型

Boltz 是生物分子相互作用预测模型家族;Boltz-2 提供复合物结构与结合亲和力预测流程。

开源Python

药物发现

ChEMBL MCP (cyanheads) 将 MCP 客户端连接到 ChEMBL 化合物、靶点、生物活性和药物记录,并支持结构搜索以及可选的 DuckDB 大型活性数据集分析。

开源TypeScript

药物发现 · 科学数据

由 ChEMBL 团队维护的官方 Python 客户端,用于查询 ChEMBL 数据和化学信息学服务,提供 QuerySet 风格的筛选器、惰性检索和本地结果缓存。

开源Python

药物发现 · 科学数据

Chemistry42 是一个小分子发现平台,将生成式设计、逆合成、ADMET 与选择性预测以及基于物理学的优先级排序结合起来,用于命中识别和先导化合物优化。

分子生成 · 药物发现

相关指南

智能体

化学 AI Agent 指南:从聊天助手到自主科研工作流

一份实用指南,介绍八个化学与生物医学研究智能体:工具、记忆、规划和多智能体角色如何运作,哪些项目适合不同任务,以及如何在科学监督下评估有界自主性。

工作流

AI 药物发现工具指南:Agent、MCP 与科研平台

按工作流程阶段选择工具:靶点证据、蛋白质结构、已知结合位点、分子生成、性质分析和筛选。比较研究智能体、MCP 集成、托管 API 与平台,并参考一个拟议的端到端示例和实用评估关卡。

工作流

蛋白质与结构生物学 AI 工作流:UniProt + RCSB PDB + Agent

构建以证据为依据的蛋白质工作流:从 UniProt 身份信息和序列,到 RCSB 结构元数据、已观察到的配体接触,以及拟议的下游候选物评估;并明确检查物种、蛋白质亚型、链、缺失数据和实验验证。