概览
PubChem MCP (PhelanShao) 将支持 MCP 的 AI 客户端连接到 PubChem 数据库中的化合物信息。它是一个独立的访问层实现,并非上游数据库本身,也不是化学性质预测模型。文档所述用途是通过 MCP 工具提供化合物属性、二维结构和三维分子坐标。
主要检索工具 get_pubchem_data 接受化合物名称或 PubChem CID。文档列出的属性字段包括 IUPAC 名称、分子式、分子量、SMILES、InChI 和 InChIKey。结果可请求为 JSON、CSV 或 XYZ 格式。include_3d 选项仅适用于 XYZ 输出。另一个工具 download_structure 接受 CID 并下载 SDF、MOL 或 SMI 文件,还可选择自定义文件名。这些接口支持从 AI 辅助查询过渡到结构化数据或本地结构文件的工作流。
README 描述了内存中的 API 响应缓存、用于 3D 数据的磁盘缓存、自动重试,以及 PubChem 坐标不可用时的备用 3D 生成方式。README 将 Python 3.8+ 和 Requests 列为依赖项,RDKit 则是用于增强 3D 处理的可选依赖。现有证据无法确定检索准确性、运行性能或生成坐标的科学适用性。其安装示例还包含占位用的仓库 URL,因此应根据链接的仓库核实安装方式,而不要未经调整直接照搬。
主要功能
- 通过 `get_pubchem_data` 按名称或 PubChem CID 查询化合物。
- 检索 IUPAC 名称、分子式、分子量、SMILES、InChI 和 InChIKey。
- 提供 JSON、CSV 和 XYZ 检索输出;`include_3d` 仅适用于 XYZ。
- 通过 `download_structure` 下载 SDF、MOL 或 SMI 结构文件,并可选择自定义文件名。
- 在内存中缓存 API 响应,在 `~/.pubchem-mcp/cache/` 中缓存 3D 结构数据,并包含自动重试机制。
- 说明了 PubChem 3D 数据不可用时的备用 3D 结构生成方式,并支持使用可选的 RDKit 增强 3D 处理。
使用场景
- 建议的评估:将支持 MCP 的助手连接到化合物查询,并针对有代表性的名称和 CID 比较返回的标识符与属性。
- 建议的评估:检索 CSV 化合物数据或 SDF、MOL 和 SMI 文件,以便在下游化学信息学工作流中检查。
- 建议的评估:请求 XYZ 坐标,并评估 PubChem 3D 数据不可用及备用生成方式会如何影响结构处理工作流。
使用方式
- 阅读官方 README,了解依赖项、工具参数和配置。确认你的工作流需要的是数据库检索,而非性质预测。
- 安装前检查仓库。README 列出了 Python 3.8+、Requests 和可选的 RDKit,但其克隆示例包含占位的所有者名称;不要将该 URL 视为项目地址。
- 按照文档中的 MCP 配置模式操作,并替换为
python_version/mcp_server.py的本地路径。请检查示例中的自动工具批准设置是否符合你的客户端权限偏好。 - 使用有代表性的名称(例如
aspirin)或已知 CID 评估get_pubchem_data。属性可选择 JSON 或 CSV,坐标可选择 XYZ;仅在使用 XYZ 时设置include_3d。将返回的标识符与目标化合物进行比较。 - 使用 CID 和 SDF、MOL 或 SMI 输出评估
download_structure。在用于下游科学工作前,检查下载的文件以及任何备用生成的坐标;这些是建议的评估步骤,并非已报告的测试结果。