AI 辅助药物发现并不是单一的软件类别。检索蛋白质注释、生成候选结构、运行对接以及编写 ML 训练流程,是不同的任务。实用的工具栈会为每项任务分配合适的工具,并让各环节之间的交接过程可供检查。
本指南将来源描述的能力与拟议的评估步骤区分开来。以下资源涵盖公共数据检索、已知位点初筛、化学信息学接口、托管科学计算、供应商描述的分子生成,以及论文描述的编程智能体。它们并不构成经过测试的集成流程。
从研究决策入手
在选择智能体之前,先明确要做出的决策:哪些靶点值得研究、哪些已观察到的结合位点值得建模、哪些分子符合设计约束,或应评估哪种预测模型?
对于靶点识别,这些资源主要支持蛋白质发现和证据收集,而不是自主确认某个靶点是否致病或具有治疗可行性。对于分子生成,AIDDISON Explorer 描述了依据项目标准创建候选分子的能力。对于分子性质预测,应区分检索到的数据库性质、计算得到的描述符和模型预测,而不要将它们混合成一个不加区分的评分。
拟议的项目简报应说明物种、蛋白质身份或发现查询、药物模态(modality)、可用结构、测量数据、设计约束以及下一步实验决策。建立证据台账,记录标识符、检索日期、设置、原始输出和未解决问题。化学 AI 工具栈指南提供更全面的角色定位;MCP 选择指南有助于缩小集成选项范围。
智能体角色与评估可参阅化学 AI Agent 指南。
让每种资源匹配其实际用途
| 资源 | 类型及来源描述的用途 | 输入与输出 | 评估关卡 |
|---|---|---|---|
| UniProt MCP (cyanheads) | 第三方蛋白质数据集成 | 功能查询、登录号或标识符 → 注释、映射和序列 | 确认物种和注释来源 |
| RCSB MCP (cnyambura) | 第三方结构检索接口 | PDB ID 和端点查询 → 元数据、聚合物记录和下载文件 | 确认相关实体及坐标是否可访问 |
| PocketScout MCP | 已知结合位点初筛服务器 | 靶点标识符和位点残基 → 接触证据、配体历史、保守性和解读 | 检查位点排序所依据的证据 |
| PubChem PUG REST | 托管 HTTP API,而非 MCP 服务器 | 化学标识符或结构 → 指定记录、性质和测定结果摘要 | 确认化合物身份和请求的操作 |
| RDKit MCP Server (TandemAI) | RDKit 软件接口 | 客户端选择的已公开工具 → 工具结果和助手响应 | 检查工具清单及输入/输出模式 |
| AIDDISON Explorer | 托管分子设计平台 | 靶点概况和设计约束 → 生成、评分和排序后的候选分子 | 审查预测不确定性和可行性 |
| Rowan | 托管分子计算平台 | 分子或蛋白质—配体结构及设置 → 特定工作流程的计算结果 | 检查方法是否适用及准备是否充分 |
| DrugAgent (Liu et al.) | 论文描述的多智能体 ML 编程框架 | 任务描述、初始文件和评估器 → 实现方案和报告 | 审计代码、评估设计和实际执行情况 |
MCP 接口提供对工具的访问;它本身不是科学预测模型。同样,Skill 是指导材料,不能替代运行时依赖或科学引擎。不同宿主的支持情况各异。相关区别见智能体与 Skills。
在解读结构前确认蛋白质身份
UniProt MCP 支持按功能搜索、分节注释、标识符映射、分类信息、蛋白质组,以及规范序列(canonical)及可选的蛋白质亚型(isoform)序列。搜索默认返回经审阅的 Swiss-Prot 条目;注释输出保留人工整理标记以及可用的 PubMed/ECO 证据。
利用这些功能整理靶点档案,然后明确作出身份判定。仅有基因符号不足以作为工作流程的交接信息:应保留物种、已解析的登录号、所选序列,以及相关蛋白质亚型或变体背景。缺失的注释字段应继续保持缺失,而不应被转化为否定性的生物学结论。
映射和检索需要处理状态信息。运行中的映射任务会返回一个用于轮询的票据;已完成的结果可能还有单独的分页续取信息。超大的注释记录可能先返回一个大纲,要求随后按具体章节获取。拟议的编排流程应保留这些状态,并记录每个登录号的失败情况,而不是悄然丢弃未解析的蛋白质。
检索结构,再评估已知位点
RCSB MCP 可检索条目元数据、聚合物详情和结构文件,包括 mmCIF。自定义查询可访问有文档说明的 Data API 端点。其物种搜索工具返回的是说明和示例查询,而非已经检索到的一组结构。因此,结构发现需要明确的路径,例如蛋白质交叉引用或 PocketScout 的相关结构工具。
PocketScout 使用 gemmi 分析共结晶配体周围的接触情况,并依据重复出现的情况汇总不同结构中观察到的口袋。它还会收集生物学背景、配体生物活性历史、文献、保守性和已知变体。其工具在返回原始信息的同时,也会提供 interpretation 字段。
这是已知位点情报,而不是新口袋预测。不要将空的接触结果解读为蛋白质没有可结合位点的证据,也不要把位点重复出现视为设计假设已获实验验证。当前 PocketScout 能力文档中没有说明计算口袋预测或基于构象集合的变构检测。
拟议的位点选择评审应比较结构覆盖范围、配体接触残基、生物学相关性和支持文献。接受解读前先检查原始证据。保守性分析采用与小鼠、大鼠和食蟹猴的局部上下文匹配,而不是完整的多序列比对;残基对应关系不确定时应单独复核。
区分化学检索与化学信息学计算
PubChem PUG REST 接受包括 CID、名称、SMILES、InChI 和 InChIKey 在内的标识符。其操作包括指定记录检索、性质表、测定结果摘要,以及身份或相似性搜索。输出格式取决于具体操作。这是数据库访问,不是新训练的性质模型,也不是对生物活性的实验验证。
RDKit MCP 通过 MCP 客户端公开 RDKit 函数,并包含工具列表实用程序、由 OpenAI 提供支持的 CLI 客户端以及评估套件。不过,全面覆盖 RDKit 函数只是声明的目标,并非已经确认的覆盖范围。提供的摘录没有列出分子输入格式或各个工具输入输出模式。
因此,拟议的化学质量关卡应从检查可用工具开始。只有在发现的模式支持时,才请求身份检查或描述符,并与另行指定的参考流程比较输出。仓库的 LLMJudge 可以评估工具使用和响应,但不能替代科学参考检查。RDKit AI 工作流程指南提供了相关的工作流程框架。
按阶段比较 Rowan 与 AIDDISON Explorer
AIDDISON Explorer 的供应商描述工作流程始于靶点概况和分子设计约束。基于 REINVENT 4.0 的强化学习模型会生成候选分子,并从效力、物理化学性质、成药性和 ADMET 标准等方面进行评分。ADMET 预测包含置信度和可解释性信息。合成可及性评分和 SYNTHIA API 路径补充了可行性考量。排序后的候选分子及其预测性质可导出为 CSV、SDF 和 RD 格式。
Rowan 提供托管计算环境,支持浏览器访问,并提供用于提交、监控和分析任务的 Python API。其列出的工作流程包括构象搜索、pKa 和溶解度预测、描述符、蛋白质准备、对接、批量和类似物对接、分子动力学以及相对结合自由能扰动。
评估受设计约束驱动的分子生成和候选优先级排序时,可选择 Explorer。评估对分子或蛋白质—配体系统执行指定计算时,可选择 Rowan。两者的部分性质相关功能有所重叠,但其文档描述的工作流程角色并不相同,也不能互换。
将 Explorer 导出结果交给 Rowan 是一种方案,而非已证实的互操作能力。尝试之前,应检查可接受的结构格式、准备要求、标识符保留情况,以及转换后导出的预测元数据是否仍然存在。Explorer 的来源材料并未证明其提供不受限制的公共 API 或本地安装方式。
用 DrugAgent 处理范围明确的建模问题
DrugAgent 论文描述了一种 LLM Planner,用于提出和修订 ML 策略;以及一种 LLM Instructor,通过领域专用指导来实现这些策略。Instructor 可以读取和编辑脚本、执行代码,并返回性能或失败报告。指导内容涵盖生物数据获取、表示方法和领域专用模型。
报告中的研究涉及使用 PAMPA、HIV 和 DAVIS 的二元分类工作流程。这并不能证明它是通用分子生成器、对接引擎或生产级发现系统。作者明确提醒不要直接部署,因为存在包括产生幻觉或伪造结果在内的风险。
一种拟议的下游用途是:在整理好合适的实测标签后,研究定义清楚的预测任务。提供初始数据、固定评估器、数据划分规则和迭代预算。要求提供可检查的代码和执行产物。将 DrugAgent 连接到此处讨论的 MCP 资源或平台导出,需要另行开展工程实现和评估;现有资料并未说明这类集成已经完成。
拟议示例:从证据到候选优先级排序
考虑一个明确属于拟议方案的 EGFR 小分子项目,以 PDB 1M17 作为初始结构参考,因为 PocketScout 文档将其用于示例。本文不宣称获得了任何结果。
- 定义目标。 输入一份关于人 EGFR 项目的简报、骨架约束和期望的性质标准。输出设计规范。确定哪些标准是硬性排除条件,哪些是排序偏好。
- 确认靶点。 使用 UniProt MCP 获取登录号、序列和相关注释。输出与证据关联的档案。如果物种、蛋白质亚型或变体身份仍有歧义,则暂停。
- 检查结构证据。 通过 RCSB MCP 检索条目和聚合物元数据及坐标。使用 PocketScout 评估已观察到的配体接触、相关结构、配体历史和变体。输出经过审查的位点依据,而不是宣称发现了新口袋。
- 汇集并扩展候选分子。 使用 PubChem 定向检索参考化合物。如可访问,则评估 Explorer 是否能依据设计规范进行以骨架为重点的扩展。输出带有来源标识符、预测元数据,以及可用时的合成路线信息的候选结构。
- 设置化学和建模关卡。 检查 RDKit MCP 工具后,再提出其支持的检查。对范围有限的候选集评估 Rowan 的结构准备、对接和指定性质计算。验证每次传递都保留分子身份;此交接仍属拟议方案。
- 审查候选短名单。 输出可审计表格,将检索事实、预测、对接结果和未解决的顾虑分开列示。决定哪些内容值得进行实验室后续研究。只有在另一个独立的有标签建模问题足以支持其使用时,才加入 DrugAgent。
处理失败并选择运行方式
对于 PubChem,应对 URL 中的特殊字符进行编码;对于 InChI 或 SDF 输入,按文档说明使用 POST 处理;遵守请求限制和动态限流,并采用有界重试。大型集合不应转化为不受限制的逐记录请求流。
对于 MCP 工具,应保留部分失败、分页和异步状态。RCSB 下载会返回本地路径:应验证下游进程是否确实能够访问该文件。将坐标不可用、标签缺失和计算失败记录为缺口,而不是让助手编造数值。
本地运行也有各自的要求。PocketScout 要求 Python 3.11 或更高版本,并标记为 Alpha。RCSB 项目元数据要求 Python 3.13 或更高版本。UniProt 的 README 前置要求写明 Bun v1.3.0 或更高版本,而包元数据要求 Bun >=1.4.0;部署前应检查所选包的元数据。通用 MCP 支持并不能证明与某个特定宿主兼容。
PocketScout 和 TandemAI RDKit 提供了 MIT 许可文本;UniProt MCP 使用 Apache-2.0。RCSB 的 README 声明使用 MIT 许可,但未提供单独的许可文本。DrugAgent 论文提供了代码链接,但现有仓库摘录未说明如何设置或代码许可。Rowan、Explorer 和 PubChem 服务的访问资料并不能证明存在本地可用的实现代码或仓库许可。软件、上游数据和托管服务条款需要分别考虑。
读者检查清单
- 在开始编排前明确研究决策和停止条件。
- 确认物种、蛋白质序列、结构实体和化合物身份。
- 将检索记录、计算结果和预测分别列出。
- 检查 PocketScout 证据和 RDKit MCP 工具输入输出模式。
- 在每个拟议交接环节确认文件访问权限和格式要求。
- 记录缺失数据、失败任务、设置和预测不确定性。
- 排序前审查结构假设、测定背景和模型适用性。
- 活性、安全性和合成相关主张均需实验跟进。
继续阅读相关指南:蛋白质与结构生物学 AI 工作流:UniProt + RCSB PDB + Agent。
来源
主要依据包括 DrugAgent 论文、PocketScout、UniProt MCP、RCSB MCP 和 RDKit MCP 的项目文档、PubChem 规范及操作教程,以及 Rowan 和 AIDDISON Explorer 的官方产品介绍。平台介绍属于供应商主张,并非独立验证。