AI 辅助药物发现并不是单一的软件类别。检索蛋白质注释、生成候选结构、运行对接以及编写 ML 训练流程,是不同的任务。实用的工具栈会为每项任务分配合适的工具,并让各环节之间的交接过程可供检查。

本指南将来源描述的能力与拟议的评估步骤区分开来。以下资源涵盖公共数据检索、已知位点初筛、化学信息学接口、托管科学计算、供应商描述的分子生成,以及论文描述的编程智能体。它们并不构成经过测试的集成流程。

从研究决策入手

在选择智能体之前,先明确要做出的决策:哪些靶点值得研究、哪些已观察到的结合位点值得建模、哪些分子符合设计约束,或应评估哪种预测模型?

对于靶点识别,这些资源主要支持蛋白质发现和证据收集,而不是自主确认某个靶点是否致病或具有治疗可行性。对于分子生成,AIDDISON Explorer 描述了依据项目标准创建候选分子的能力。对于分子性质预测,应区分检索到的数据库性质、计算得到的描述符和模型预测,而不要将它们混合成一个不加区分的评分。

拟议的项目简报应说明物种、蛋白质身份或发现查询、药物模态(modality)、可用结构、测量数据、设计约束以及下一步实验决策。建立证据台账,记录标识符、检索日期、设置、原始输出和未解决问题。化学 AI 工具栈指南提供更全面的角色定位;MCP 选择指南有助于缩小集成选项范围。

智能体角色与评估可参阅化学 AI Agent 指南。

让每种资源匹配其实际用途

资源 类型及来源描述的用途 输入与输出 评估关卡
UniProt MCP (cyanheads) 第三方蛋白质数据集成 功能查询、登录号或标识符 → 注释、映射和序列 确认物种和注释来源
RCSB MCP (cnyambura) 第三方结构检索接口 PDB ID 和端点查询 → 元数据、聚合物记录和下载文件 确认相关实体及坐标是否可访问
PocketScout MCP 已知结合位点初筛服务器 靶点标识符和位点残基 → 接触证据、配体历史、保守性和解读 检查位点排序所依据的证据
PubChem PUG REST 托管 HTTP API,而非 MCP 服务器 化学标识符或结构 → 指定记录、性质和测定结果摘要 确认化合物身份和请求的操作
RDKit MCP Server (TandemAI) RDKit 软件接口 客户端选择的已公开工具 → 工具结果和助手响应 检查工具清单及输入/输出模式
AIDDISON Explorer 托管分子设计平台 靶点概况和设计约束 → 生成、评分和排序后的候选分子 审查预测不确定性和可行性
Rowan 托管分子计算平台 分子或蛋白质—配体结构及设置 → 特定工作流程的计算结果 检查方法是否适用及准备是否充分
DrugAgent (Liu et al.) 论文描述的多智能体 ML 编程框架 任务描述、初始文件和评估器 → 实现方案和报告 审计代码、评估设计和实际执行情况

MCP 接口提供对工具的访问;它本身不是科学预测模型。同样,Skill 是指导材料,不能替代运行时依赖或科学引擎。不同宿主的支持情况各异。相关区别见智能体与 Skills。

在解读结构前确认蛋白质身份

UniProt MCP 支持按功能搜索、分节注释、标识符映射、分类信息、蛋白质组,以及规范序列(canonical)及可选的蛋白质亚型(isoform)序列。搜索默认返回经审阅的 Swiss-Prot 条目;注释输出保留人工整理标记以及可用的 PubMed/ECO 证据。

利用这些功能整理靶点档案,然后明确作出身份判定。仅有基因符号不足以作为工作流程的交接信息:应保留物种、已解析的登录号、所选序列,以及相关蛋白质亚型或变体背景。缺失的注释字段应继续保持缺失,而不应被转化为否定性的生物学结论。

映射和检索需要处理状态信息。运行中的映射任务会返回一个用于轮询的票据;已完成的结果可能还有单独的分页续取信息。超大的注释记录可能先返回一个大纲,要求随后按具体章节获取。拟议的编排流程应保留这些状态,并记录每个登录号的失败情况,而不是悄然丢弃未解析的蛋白质。

检索结构,再评估已知位点

RCSB MCP 可检索条目元数据、聚合物详情和结构文件,包括 mmCIF。自定义查询可访问有文档说明的 Data API 端点。其物种搜索工具返回的是说明和示例查询,而非已经检索到的一组结构。因此,结构发现需要明确的路径,例如蛋白质交叉引用或 PocketScout 的相关结构工具。

PocketScout 使用 gemmi 分析共结晶配体周围的接触情况,并依据重复出现的情况汇总不同结构中观察到的口袋。它还会收集生物学背景、配体生物活性历史、文献、保守性和已知变体。其工具在返回原始信息的同时,也会提供 interpretation 字段。

这是已知位点情报,而不是新口袋预测。不要将空的接触结果解读为蛋白质没有可结合位点的证据,也不要把位点重复出现视为设计假设已获实验验证。当前 PocketScout 能力文档中没有说明计算口袋预测或基于构象集合的变构检测。

拟议的位点选择评审应比较结构覆盖范围、配体接触残基、生物学相关性和支持文献。接受解读前先检查原始证据。保守性分析采用与小鼠、大鼠和食蟹猴的局部上下文匹配,而不是完整的多序列比对;残基对应关系不确定时应单独复核。

区分化学检索与化学信息学计算

PubChem PUG REST 接受包括 CID、名称、SMILES、InChI 和 InChIKey 在内的标识符。其操作包括指定记录检索、性质表、测定结果摘要,以及身份或相似性搜索。输出格式取决于具体操作。这是数据库访问,不是新训练的性质模型,也不是对生物活性的实验验证。

RDKit MCP 通过 MCP 客户端公开 RDKit 函数,并包含工具列表实用程序、由 OpenAI 提供支持的 CLI 客户端以及评估套件。不过,全面覆盖 RDKit 函数只是声明的目标,并非已经确认的覆盖范围。提供的摘录没有列出分子输入格式或各个工具输入输出模式。

因此,拟议的化学质量关卡应从检查可用工具开始。只有在发现的模式支持时,才请求身份检查或描述符,并与另行指定的参考流程比较输出。仓库的 LLMJudge 可以评估工具使用和响应,但不能替代科学参考检查。RDKit AI 工作流程指南提供了相关的工作流程框架。

按阶段比较 Rowan 与 AIDDISON Explorer

AIDDISON Explorer 的供应商描述工作流程始于靶点概况和分子设计约束。基于 REINVENT 4.0 的强化学习模型会生成候选分子,并从效力、物理化学性质、成药性和 ADMET 标准等方面进行评分。ADMET 预测包含置信度和可解释性信息。合成可及性评分和 SYNTHIA API 路径补充了可行性考量。排序后的候选分子及其预测性质可导出为 CSV、SDF 和 RD 格式。

Rowan 提供托管计算环境,支持浏览器访问,并提供用于提交、监控和分析任务的 Python API。其列出的工作流程包括构象搜索、pKa 和溶解度预测、描述符、蛋白质准备、对接、批量和类似物对接、分子动力学以及相对结合自由能扰动。

评估受设计约束驱动的分子生成和候选优先级排序时,可选择 Explorer。评估对分子或蛋白质—配体系统执行指定计算时,可选择 Rowan。两者的部分性质相关功能有所重叠,但其文档描述的工作流程角色并不相同,也不能互换。

将 Explorer 导出结果交给 Rowan 是一种方案,而非已证实的互操作能力。尝试之前,应检查可接受的结构格式、准备要求、标识符保留情况,以及转换后导出的预测元数据是否仍然存在。Explorer 的来源材料并未证明其提供不受限制的公共 API 或本地安装方式。

用 DrugAgent 处理范围明确的建模问题

DrugAgent 论文描述了一种 LLM Planner,用于提出和修订 ML 策略;以及一种 LLM Instructor,通过领域专用指导来实现这些策略。Instructor 可以读取和编辑脚本、执行代码,并返回性能或失败报告。指导内容涵盖生物数据获取、表示方法和领域专用模型。

报告中的研究涉及使用 PAMPA、HIV 和 DAVIS 的二元分类工作流程。这并不能证明它是通用分子生成器、对接引擎或生产级发现系统。作者明确提醒不要直接部署,因为存在包括产生幻觉或伪造结果在内的风险。

一种拟议的下游用途是:在整理好合适的实测标签后,研究定义清楚的预测任务。提供初始数据、固定评估器、数据划分规则和迭代预算。要求提供可检查的代码和执行产物。将 DrugAgent 连接到此处讨论的 MCP 资源或平台导出,需要另行开展工程实现和评估;现有资料并未说明这类集成已经完成。

拟议示例:从证据到候选优先级排序

考虑一个明确属于拟议方案的 EGFR 小分子项目,以 PDB 1M17 作为初始结构参考,因为 PocketScout 文档将其用于示例。本文不宣称获得了任何结果。

  1. 定义目标。 输入一份关于人 EGFR 项目的简报、骨架约束和期望的性质标准。输出设计规范。确定哪些标准是硬性排除条件,哪些是排序偏好。
  2. 确认靶点。 使用 UniProt MCP 获取登录号、序列和相关注释。输出与证据关联的档案。如果物种、蛋白质亚型或变体身份仍有歧义,则暂停。
  3. 检查结构证据。 通过 RCSB MCP 检索条目和聚合物元数据及坐标。使用 PocketScout 评估已观察到的配体接触、相关结构、配体历史和变体。输出经过审查的位点依据,而不是宣称发现了新口袋。
  4. 汇集并扩展候选分子。 使用 PubChem 定向检索参考化合物。如可访问,则评估 Explorer 是否能依据设计规范进行以骨架为重点的扩展。输出带有来源标识符、预测元数据,以及可用时的合成路线信息的候选结构。
  5. 设置化学和建模关卡。 检查 RDKit MCP 工具后,再提出其支持的检查。对范围有限的候选集评估 Rowan 的结构准备、对接和指定性质计算。验证每次传递都保留分子身份;此交接仍属拟议方案。
  6. 审查候选短名单。 输出可审计表格,将检索事实、预测、对接结果和未解决的顾虑分开列示。决定哪些内容值得进行实验室后续研究。只有在另一个独立的有标签建模问题足以支持其使用时,才加入 DrugAgent。

处理失败并选择运行方式

对于 PubChem,应对 URL 中的特殊字符进行编码;对于 InChI 或 SDF 输入,按文档说明使用 POST 处理;遵守请求限制和动态限流,并采用有界重试。大型集合不应转化为不受限制的逐记录请求流。

对于 MCP 工具,应保留部分失败、分页和异步状态。RCSB 下载会返回本地路径:应验证下游进程是否确实能够访问该文件。将坐标不可用、标签缺失和计算失败记录为缺口,而不是让助手编造数值。

本地运行也有各自的要求。PocketScout 要求 Python 3.11 或更高版本,并标记为 Alpha。RCSB 项目元数据要求 Python 3.13 或更高版本。UniProt 的 README 前置要求写明 Bun v1.3.0 或更高版本,而包元数据要求 Bun >=1.4.0;部署前应检查所选包的元数据。通用 MCP 支持并不能证明与某个特定宿主兼容。

PocketScout 和 TandemAI RDKit 提供了 MIT 许可文本;UniProt MCP 使用 Apache-2.0。RCSB 的 README 声明使用 MIT 许可,但未提供单独的许可文本。DrugAgent 论文提供了代码链接,但现有仓库摘录未说明如何设置或代码许可。Rowan、Explorer 和 PubChem 服务的访问资料并不能证明存在本地可用的实现代码或仓库许可。软件、上游数据和托管服务条款需要分别考虑。

读者检查清单

  • 在开始编排前明确研究决策和停止条件。
  • 确认物种、蛋白质序列、结构实体和化合物身份。
  • 将检索记录、计算结果和预测分别列出。
  • 检查 PocketScout 证据和 RDKit MCP 工具输入输出模式。
  • 在每个拟议交接环节确认文件访问权限和格式要求。
  • 记录缺失数据、失败任务、设置和预测不确定性。
  • 排序前审查结构假设、测定背景和模型适用性。
  • 活性、安全性和合成相关主张均需实验跟进。

继续阅读相关指南:蛋白质与结构生物学 AI 工作流:UniProt + RCSB PDB + Agent。

来源

主要依据包括 DrugAgent 论文、PocketScout、UniProt MCP、RCSB MCP 和 RDKit MCP 的项目文档、PubChem 规范及操作教程,以及 Rowan 和 AIDDISON Explorer 的官方产品介绍。平台介绍属于供应商主张,并非独立验证。