区分数据源与集成接口
化学数据智能体需要的不只是可搜索的数据库:它还需要在源记录、检索记录的接口以及生成的说明之间建立可靠边界。本合集从不同层面比较四种候选资源。这是规划参考,不是兼容性矩阵,也不能证明这些资源曾被共同执行。
对于每个拟议连接,记录上游服务、仓库维护者、所选源版本和部署方案。cyanheads 服务器是社区集成;其名称并不能证明它们由 PubChem 或 ChEMBL 所有,也不代表服务提供方作出服务保证。软件许可应与底层数据库的访问和署名条款分开考虑。
先明确决策问题:任务需要的是化合物识别、实测生物活性、材料数据访问,还是操作指南? 选择能够回答问题的最小接口集合,而不要默认全部连接。
根据资源角色进行匹配
- PubChem MCP (cyanheads) 封装了 PubChem 的 PUG REST 和 PUG View API。其文档所述范围包括标识符和结构搜索、理化性质、带署名信息的 GHS 记录、生物活性、交叉引用和 3D 构象。大多数记录检索使用化合物标识符,即 CID。基于性质计算的 Lipinski 和 Veber 评估是对检索字段进行的计算,并非由训练模型给出的预测。
- ChEMBL MCP (cyanheads) 将分子和靶点搜索与实测活性记录、测定来源、药物作用机制和适应症相连。生物活性查询可接受分子、靶点或化合物—靶点对。可选的 DuckDB 支持 DataCanvas 功能,可用于分析较大的活性数据集。
- Materials Project API client 是以
mp-api发布的客户端项目。整理好的资源参考记录了一个可选的 MCP 依赖组和mpmcp入口点。这只能确认存在集成入口,不能说明其暴露的工具或已验证的配置。参考摘录未说明查询字段、身份验证方式和响应约定;在设计流水线前需要确认这些信息。 - Scientific Agent Skills 提供操作指南和配套资源,而非独立数据库或独立运行的研究智能体。其 Database Lookup 指南涵盖端点选择、分页、访问要求和来源与处理记录,其中包括 PubChem 和 ChEMBL。个别 skill 可能包含辅助工具或模板;依赖项和凭证需另行配置。
MCP 服务器文档列出了 STDIO 和 Streamable HTTP 部署选项。仅支持相同传输方式,并不能证明特定宿主能正确提供每个工具或资源。
明确输入和输出约定
在允许自主调用之前,为每项任务写明简要约定:
- **输入:**允许的标识符类型、结构表示、物种或靶点限制、所需性质和结果数量上限。
- **输出:**源标识符、选定字段、适用时的单位、查询筛选条件、检索时间、完整性指标和来源署名。
- **继续处理:**如何继续分页、何时停止检索,以及如何标记不完整的数据集。
- **恢复处理:**哪些故障允许修正查询,哪些情况需要人工澄清。
对于 PubChem,要区分无法解析的输入、不存在的 CID,以及存在但没有所请求测量值的化合物。对于 ChEMBL,要将缺失的数值保留为 null,而不是零。排名视图和 null_potency 视图应保持区分。
思考:智能体能否判断收到的是完整数据集、预览,还是经过筛选后没有结果? ChEMBL 的内联预览和暂存表有各自的数量上限。PubChem 会提供分页和截断信息,部分富集字段也有批次限制。应要求智能体在最终答复中保留这些说明。
规划示例:假设的化合物—靶点查询
假设一位研究人员想为三个公开化合物名称和一个蛋白质靶点建立证据表。这是一个假设的计划,并非已报告的测试或科学结果。
**拟议输入:**三个名称、由研究人员提供的 UniProt 登录号、物种限制,以及一种活性测量类型,例如 IC50。
拟议流程:
- 使用
pubchem_search_compounds解析这些名称。如果仍有多个候选记录,则暂停并请求澄清;不要默默选取第一个结果。 - 检索选定的性质,并保留 CID 和结构标识符作为身份识别证据。
- 使用受支持的标识符或结构输入,独立解析 ChEMBL 分子。将 PubChem 到 ChEMBL 的映射视为需要进行身份核验的拟议集成边界,而非自动等同关系。
- 使用登录号和物种限制调用
chembl_search_targets,然后针对每个已解析的化合物—靶点对查询chembl_get_bioactivities。 - 在提出比较之前,使用
chembl_get_assay检查相关测定。
**计划输出:**一张表将原始输入与解析出的记录关联起来;另一张表保留活性类型、数值、单位、测定和靶点标识符、筛选条件及完整性状态。未解析的映射和缺失的测量值都应明确标出。
需要考虑的问题包括:不同来源中的结构是否一致?靶点是否属于预期物种且类型正确?这些测定是否可比较?ChEMBL 文档将效力比较限定为同一种 standard_type;但仅匹配该字段,并不足以构成将所有测定放在一起排序的科学依据。
评估权限和故障处理
以下内容是建议的评估步骤,并非已完成的检查。
针对所选配置,梳理网络目的地、凭证、日志记录、存储和本地写入。PubChem 和 ChEMBL 集成说明其上游访问无需密钥,但部署身份验证和宿主权限是另外的问题。只读检索并不意味着日志记录或数据集暂存不会留下本地文件。
只检查完成任务所需的 Scientific Agent Skills 子集。Skills 可能会指示安装软件包、执行代码、发起网络请求和修改文件。授予这些权限前,应先检查其说明和辅助工具。
使用非敏感输入测试名称歧义、格式错误的结构、缺失记录、服务提供方故障和分页。使用 ChEMBL canvas 时,还应评估暂存限制和禁用服务提供方时的行为。如果之后开展测试,请保存确切配置和源版本;对未经支持的组合仍保持未知。
保留来源与处理记录并说明局限性
将智能体的最终文字与检索记录进行核对。流畅的摘要不得把缺失的 GHS 数据说成“无危害”,不得把 null 效力说成无活性,也不得把截断的预览说成完整搜索。
数据覆盖范围取决于上游记录。PubChem 可能缺少分类或计算得到的 3D 坐标;ChEMBL 活性结果的解释取决于测定背景。Materials Project 参考资料并未说明其性质覆盖范围或身份验证行为。Skill 说明不能证明科学有效性或在线服务可靠性。
本合集仍是未发布的草稿,尚待来源审查和编辑遴选。
简明行动清单
- 选择任务和最小资源集合。
- 记录上游提供方、维护者、版本和部署方式。
- 明确标识符、字段、单位和停止规则。
- 保留缺失数据、错误和截断之间的区别。
- 检查权限、日志、存储和 skill 辅助工具。
- 使用公开示例评估身份映射和测定可比性。
- 将源记录与智能体摘要一并保留;只记录实际执行过的检查。