从证据问题出发,而非承诺设计结果
有用的蛋白质工作流会提出一个范围明确的问题:哪些结构证据支持进一步研究某个特定靶标或结合区域?建议的步骤为:输入序列或标识符 → 蛋白质身份和注释 → 相关结构 → 已观察到的配体接触 → 候选物评估计划。
本指南将来源描述的检索与初步筛选能力,同一种拟议的编排模式结合起来。它并非对经过测试、可直接使用的集成方案的描述。可将其用于科学数据整理和早期药物发现评估,尤其适用于需要说明某个结构或位点为何值得进一步研究的情形。
交付成果应是一份证据资料包,而不是缺乏支持地声称某种蛋白质可成药或某个候选物会结合。应将检索到的事实、软件解读和拟议研究行动区分开来。有关更广泛的架构背景,请参见化学 AI 技术栈指南和MCP、Skills、智能体与 API 指南。
组件选型可结合化学领域的 MCP、化学 AI Agent 指南与药物发现工作流阅读。
为各阶段选择合适的组件
这些资源处于不同层级。MCP 服务器是第三方接口或分析工具;RCSB PDB Data API 是上游托管的元数据服务;DrugAgent 则是论文中描述的一种研究框架。它们不可互换。
| 组件 | 来源描述的作用 | 适用场景 | 需要保留的边界 |
|---|---|---|---|
| UniProt MCP (cyanheads) | 蛋白质搜索、注释、标识符映射、分类学、蛋白质组和序列 | 确认身份并整理蛋白质资料 | 检索并不等同于蛋白质性质预测 |
| RCSB MCP (cnyambura) | 条目和聚合物元数据、结构下载、自定义 Data API 查询 | 检查已确定的 PDB 条目并获取坐标文件 | 其物种搜索工具返回的是指导信息,而非检索到的匹配结果 |
| RCSB PDB Data API | 结构及其组成部分的 REST 和 GraphQL 元数据 | 检索实体、链、组装体和化学组分之间的精确关系 | 元数据请求不执行对接或模拟 |
| PocketScout MCP | 基于结构、生物活性、保守性、变异和文献证据筛查已知位点 | 评估已观察到的配体接触区域 | 当前不具备计算预测口袋的功能;项目元数据将其标记为 Alpha |
| DrugAgent (Liu et al.) | 用于 ML 工作流编程和评估的规划器–指导者协作 | 考虑开展独立的下游建模研究 | 没有提供证据证明其与这些 MCP 服务器集成 |
窄范围查询应选择明确的工具;整理资料则可使用引导式提示。提示提供工作流指令,但不能替代可执行工具或依赖项。
在解读结构之前确认蛋白质身份
从提交的标识符、科学物种名称和可用序列开始。记录研究对象采用规范序列(canonical)、特定蛋白质亚型(isoform),还是经过修饰的实验构建体。
UniProt MCP 提供 uniprot_search_proteins、uniprot_map_ids、uniprot_get_entry 和 uniprot_get_sequence。搜索默认返回经过审校的条目。应保留审校状态、注释来源、蛋白质存在证据以及可用的 PubMed/ECO 证据,不要将所有注释都简化为同等确定的事实。
若输入为基因符号,可使用物种筛选或基于分类单元的消歧。检索规范序列(canonical)和可选的蛋白质亚型序列,再拟议将其与提交的序列进行比较。所提供的工具说明并未证明其支持任意序列相似性搜索:仅有序列的输入需要另行选择身份识别方法,或由人工确认后再按登录号检索。
该服务器文档说明,条目和序列调用会去除蛋白质亚型后缀。应在证据资料包中保留原始蛋白质亚型标识符;使用基础登录号不得悄然改变生物学研究对象。如果仍有多个可能的蛋白质,或序列关系尚未明确,应暂停。
在实体和链层级映射结构
使用可用的 UniProt 结构交叉引用或 PocketScout 的相关结构检索,确定候选结构标识符。随后检查条目元数据和相关聚合物实体。不要仅因 RCSB MCP 工具默认值为实体 1 就选择它。
RCSB 的层级区分条目、化学上唯一的实体、单个实体实例或链、生物学组装体,以及化学组分。同一实体各副本共有的序列信息属于实体层级;特定实例的结构注释则属于链层级。Data API 使用 label_asym_id 作为聚合物实例标识符,因此应记录链命名约定,不要假定所有显示的链标签都等同。
对于每个候选结构,建议记录:
- 条目 ID、靶标实体 ID、链实例和组装体 ID。
- 来源物种、聚合物序列、参考序列交叉引用,以及与所选蛋白质亚型之间尚未解决的对应关系。
- 结构类别:实验结构、计算模型或整合结构。
- 适用时记录实验方法和分辨率;或记录相关模型质量和输入数据集注释。
- 靶区覆盖范围、坐标可用性和配体标识符。
Data API 文档涵盖部分选定的计算模型和整合结构,但这并不能证明较旧的第三方 RCSB MCP 封装也提供同等支持。若封装文档所述范围不足,应使用上游接口。
从结构转向已观察到的配体接触
RCSB MCP 可以下载坐标文件,包括 mmCIF,并返回下载状态和本地路径。PocketScout 文档说明可使用 gemmi 进行坐标分析,以识别共结晶配体附近的残基、分类位点,并根据不同结构中的重复出现情况汇总已观察到的口袋。
这一区别很重要:化学组分元数据用于识别分子,而坐标分析提供空间接触证据。仅有配体记录并不等于接触图。同样,接触图也不是实测结合亲和力,或功能调节的证据。
PocketScout 还会检索配体生物活性历史、文献、已知变异和结合残基保守性。其详细文档描述的是与小鼠、大鼠和食蟹猕猴的局部上下文比较,而非完整的多序列比对。应将原始信息与各工具的 interpretation 字段分开保留。
在拟议评估中,检查配体及其接触链是否对应预期靶标。应将口袋分类、基于大小的可成药性评估和重复出现排序视为软件生成的筛查证据,而非实验结论。如果没有合适的含配体结构,应报告这一限制;不要捏造接触残基,也不要在未明确改变方法的情况下用预测空腔替代。
通过明确的工作流关卡连接 MCP 工具
拟议的控制器可以在组件间传递经核实的标识符,并在遇到未解决的问题时停止:
身份关卡 → 结构对应关系关卡 → 坐标与配体关卡 → 位点证据评估 → 经人工批准的下游任务。
UniProt MCP 文档说明支持本地 STDIO、自托管 Streamable HTTP 和公共托管端点。PocketScout 文档说明支持托管和本地运行。RCSB MCP 文档说明支持独立执行和 Claude Desktop 配置。这些说明可作为评估客户端的起点,并不能证明当前所有主机或传输组合都能正常工作。
开始本地设置之前,应先厘清实际运行环境差异。UniProt 的 README 先决条件要求 Bun v1.3.0 或更高版本,而其包元数据要求 Bun >=1.4.0;应核对所选包的要求,而不要依赖较低门槛。所提供的 RCSB MCP 项目元数据要求 Python >=3.13,而 PocketScout 要求 Python >=3.11。应分别评估它们的环境,不要假定可以共用同一套安装。
首先建议通过小型检索任务检查工具发现、输入验证、输出数据模式和文件可访问性。下载后的本地路径必须能被预期的分析进程访问。加载 Skill 或提示既不会提供服务器运行时,也不会提供坐标分析依赖项。化学 MCP 选择指南提供了补充的选择标准。
拟议示例:评估 EGFR 结构,但不预设结果
**拟议练习,并非已报告的执行结果:**使用 PocketScout README 中提及的 EGFR/PDB 配对 1M17,整理一份位点评估资料包。首先记录靶标名称、预期物种 Homo sapiens,以及研究团队使用的序列或蛋白质亚型。
- **身份输入:**在限定物种的条件下于 UniProt 中确认靶标。输出所选登录号、规范序列(canonical)及相关蛋白质亚型序列,并记录注释来源。如果无法将提交的序列与记录对应,应停止。
- **结构输入:**检索
1M17的元数据并检查其聚合物实体和链。输出靶标与结构对应关系表。只有在确认相关区域和构建体适合该问题后,才继续。 - **位点输入:**请求基于坐标的结合位点证据。输出检索到的配体身份和接触残基,并保留链及残基编号上下文。如果响应中没有接触信息,应记录缺口,不要凭记忆补充。
- **背景输入:**使用已核实的登录号和映射残基检索配体历史、保守性、变异和文献。输出有证据支持的理由,说明为何应进一步研究或暂缓研究每个已观察到的区域。
- **决策输出:**提出以下三种结果之一:研究已观察到的位点、寻求更多结构证据,或因身份或位点证据仍未明确而暂缓研究该靶标。
此处不预设任何特定配体、接触残基、保守性结果或排序。实用的最终资料包应包括原始响应、对应关系表、尚未解决的问题,以及明确的验证计划。
将检索不完整视为一种工作流状态
UniProt 映射任务可能返回正在运行的任务票据;应继续轮询该任务,而不是重新提交。已完成的映射结果可能有单独的分页续取机制。搜索游标、映射续取信息和分节提纲不能互换。
对于过大的注释记录,应请求指定的分节。分批检查每个登录号的成功和失败情况,并将缺失字段保留为缺失。不得将不完整响应写成听起来完整的蛋白质摘要。
对于 RCSB 请求,应检查 REST 状态和 GraphQL 响应错误:HTTP 成功本身不能证明 GraphQL 查询成功。GraphQL 需要明确的对象标识符;全档案检索则应先单独通过 Holdings 启动,再分批获取。Data API 涵盖常用注释,但并非 mmCIF 字典中的每一项内容。
建议对瞬时故障进行有限次数的重试,然后将相关阶段标记为未完成。区分“未检索到结果”“请求失败”和“在已检查的来源中没有可用证据”。对重复检索进行带时间戳的缓存,并保留查询参数;参见数据集来源与处理记录指南。
评估候选物时避免夸大科学证据
拟议的候选物评估应比较证据完整性、靶区对应关系、已观察位点的重复出现情况、配体历史、变异相关问题、保守性以及相互矛盾的文献。应明确陈述理由,而不要编造通用的数值评分。
独立的 DrugAgent 风格下游任务可以使用经过整理的数据集、目标、约束条件、起始文件和评估器。其论文描述了利用性能报告或失败报告规划和实施 ML 工作流。这种衔接属于拟议集成,并非现有的 UniProt/PDB/PocketScout 连接。所提供的证据并未证明 DrugAgent 有可用的安装说明;论文还警告,由于存在幻觉风险,不应直接部署流水线。
结构置信度不是结合证据;观察到的接触不是选择性证据;保守性检查也不能验证动物模型。在推进候选物之前,建议进行专家检查,并开展适当的结合、功能和选择性实验。本工作流不声称已经完成任何实验验证。
读者核对清单
- 分别记录身份、物种、蛋白质亚型和提交的序列。
- 明确条目、实体、链、组装体和残基编号。
- 区分实验结构、计算模型和整合结构。
- 检索配体身份和接触证据,不作预设。
- 区分原始结果、软件解读和研究建议。
- 妥善处理分页、部分失败、缺失字段和 GraphQL 错误。
- 在本地评估客户端支持、运行时、依赖项和文件访问。
- 候选物决策应纳入尚未解决的证据问题和实验后续步骤。
继续阅读相关指南:化学 AI 应用中的科学 API:PubChem 与 RCSB PDB 入门。
来源
UniProt MCP README和包元数据支持其检索功能和运行时注意事项。RCSB MCP README和项目元数据描述了该封装。RCSB PDB Data API 文档支持相关层级、接口和错误处理说明。PocketScout README和项目元数据描述了已知位点分析及 Alpha 状态。DrugAgent 论文支持其下游编程作用及相关限制。