跳转到正文

DeepPurpose

Kexin Huang, Tianfan Fu

DeepPurpose 是一个基于 PyTorch 的工具包,用于训练和应用化合物与蛋白质预测模型,提供药物-靶点相互作用、分子性质、药物重定位和虚拟筛选工作流。

条目更新 ·

概览

DeepPurpose 是一个以药物-靶点相互作用预测为核心的分子建模工具包,还包含化合物性质、药物-药物相互作用、蛋白质-蛋白质相互作用和蛋白质功能模块。它提供可配置的训练与推理框架,而非单一预测模型。其文档所述工作流将数据集准备、分子编码、模型配置、训练和候选物排序串联起来,适用于药物重定位和虚拟筛选等研究应用。

对于药物-靶点任务,输入包括化合物 SMILES、蛋白质氨基酸序列以及实测结合值或二元标签。其他模块接受化合物单独输入、蛋白质单独输入,或带有相应标签的配对输入。用户可以选择指纹、描述符、序列或图编码,准备训练集、验证集和测试集划分,并初始化模型或加载预训练检查点。输出包括预测结果、训练指标、评估图表和排序后的药物重定位结果。数据集加载器涵盖 BindingDB、DAVIS、KIBA 和 Broad Repurposing Hub 等来源;这些是上游数据资源,并非由 DeepPurpose 维护的数据库。

README 记录了回归和二元分类、冷药物和冷靶点评估设置、标签尺度转换,以及与具名数据集相关的预训练模型。README 还提醒,教育用途的预训练药物重定位示例覆盖范围有限,且对未见过的蛋白质可能无法泛化。BindingDB 和 DAVIS DTI 检查点使用对数尺度标签,因此解读输出时需要留意转换设置。项目建议在湿实验验证前由专家进行检查,并警告不要直接使用建议的药物。这些有文档说明的工作流可用于制定评估计划,但不构成活性已获实验确认的证据。

主要功能

  • 用于药物-靶点、药物-药物和蛋白质-蛋白质相互作用预测、化合物性质预测及蛋白质功能预测的任务模块。
  • 可选的化合物编码包括 Morgan 指纹、rdkit_2d_normalized 描述符、基于 SMILES 的 CNN、transformer、MPNN 和 DGL 图模型;蛋白质编码包括序列描述符、CNN 和 transformer。
  • 数据集加载器和文本文件读取器支持基准结合数据、生物测定标签、自定义相互作用对、药物重定位库和虚拟筛选输入。
  • 数据准备支持冷药物和冷靶点划分;训练功能提供早停以及分类或回归指标。
  • 预训练检查点加载、从头训练和有文档说明的微调工作流,可用于药物重定位和虚拟筛选并生成排序结果。
  • 标签转换支持在对数尺度和原始结合值尺度之间转换,包括解读预训练 DTI 预测结果。

使用场景

  • 预期评估用途:使用有文档说明的基准数据集以及冷药物或冷靶点划分,比较不同化合物和蛋白质编码对结合亲和力预测的影响。
  • 预期评估用途:当缺少靶蛋白序列时,使用带标签的筛选数据训练化合物性质模型。
  • 预期评估用途:针对目标序列对给定化合物库进行排序,以供专家审查并筛选用于实验验证的候选物。
  • 预期评估用途:使用有文档说明的输入格式和带标签的配对数据,探索药物-药物或蛋白质-蛋白质相互作用分类。

使用方式

  1. 从仓库 README入手,选择任务模块并查看示例。根据问题选择相互作用回归、二元分类或化合物/蛋白质预测任务。
  2. 按照 README 中的说明进行本地软件包安装或配置基于源代码的环境。请将其视为提供的设置指南,而非对其与当前环境兼容性的确认。
  3. 查阅DEMO 文件夹中的数据格式说明和笔记本。按要求准备 SMILES、蛋白质序列和标签;检查结合值单位,并确认是否适合进行对数转换。
  4. 选择有文档说明的编码方式并配置数据划分。若要评估预期的泛化能力,可考虑冷药物或冷靶点划分,而不要只依赖随机划分。在选择检查点之前,先训练模型或查阅预训练模型教程。
  5. 在运行药物重定位或虚拟筛选之前,检查适合任务的指标和预测尺度。实验后续工作前,请由领域专家审查排序结果。相关文档网站被描述为仍在积极开发中。

相关资源

AIDDISON Explorer 是一个托管式药物发现平台,可根据目标特性要求、设计约束、预测属性和合成可行性生成并排序分子候选物。

分子生成 · 药物发现

AutoDock Vina

开源工具

AutoDock Vina 是一款开源分子对接与虚拟筛选程序,提供 Vina 和 AutoDock4.2 评分、多配体对接、大环分子支持及 Python 3 绑定。

开源Python

药物发现

Boltz

模型

Boltz 是生物分子相互作用预测模型家族;Boltz-2 提供复合物结构与结合亲和力预测流程。

开源Python

药物发现

ChEMBL MCP (cyanheads) 将 MCP 客户端连接到 ChEMBL 化合物、靶点、生物活性和药物记录,并支持结构搜索以及可选的 DuckDB 大型活性数据集分析。

开源TypeScript

药物发现 · 科学数据

由 ChEMBL 团队维护的官方 Python 客户端,用于查询 ChEMBL 数据和化学信息学服务,提供 QuerySet 风格的筛选器、惰性检索和本地结果缓存。

开源Python

药物发现 · 科学数据

Chemistry42 是一个小分子发现平台,将生成式设计、逆合成、ADMET 与选择性预测以及基于物理学的优先级排序结合起来,用于命中识别和先导化合物优化。

分子生成 · 药物发现

相关指南

智能体

化学 AI Agent 指南:从聊天助手到自主科研工作流

一份实用指南,介绍八个化学与生物医学研究智能体:工具、记忆、规划和多智能体角色如何运作,哪些项目适合不同任务,以及如何在科学监督下评估有界自主性。

工作流

AI 药物发现工具指南:Agent、MCP 与科研平台

按工作流程阶段选择工具:靶点证据、蛋白质结构、已知结合位点、分子生成、性质分析和筛选。比较研究智能体、MCP 集成、托管 API 与平台,并参考一个拟议的端到端示例和实用评估关卡。

工作流

蛋白质与结构生物学 AI 工作流:UniProt + RCSB PDB + Agent

构建以证据为依据的蛋白质工作流:从 UniProt 身份信息和序列,到 RCSB 结构元数据、已观察到的配体接触,以及拟议的下游候选物评估;并明确检查物种、蛋白质亚型、链、缺失数据和实验验证。