科学 Skill 能做什么,不能做什么

科学 Skill 为助手提供程序性指引:需要收集哪些输入、使用哪些软件、执行哪些检查,以及何时停止。有些资源还附带辅助工具。加载这些指引并不会安装依赖项、提供实验数据或确立科学有效性。不同宿主对 Skills 的支持各异,因此需要分别检查指令发现机制和执行权限。

这十种资源涵盖三种化学信息学选择、一种光谱工作流、三种材料资源、两种热力学/动力学工作流,以及一种反应分子动力学分析资源。它们的用途不能互换:ASE 路由器用于准备任务委派,而 Cantera 辅助工具则通过单独安装的软件执行范围明确的计算。

如需了解更广泛的区别,请阅读智能体与 Skills、MCP、Skills、智能体与 API以及化学 AI 技术栈。化学智能体 Skills 评述提供了互补的评估视角。

相关指南:化学 AI Skills · 材料科学 AI 工作流。

按用途和数据契约比较这十种资源

在表格中,K-Dense 指 scientific-agent-skills 集合;CCAS 指 computational-chemistry-agent-skills。许可声明针对 Skill 或所提供的集合代码,不会自动涵盖其依赖项、数据库或输出。

Skill 与集合 指令/辅助工具用途;上游软件与依赖项 输入 → 预期输出 许可范围或未解决状态
RDKit Skill,K-Dense 详尽的分子指引和三个 Python 辅助工具;需要已安装的 rdkit SMILES/SDF/MOL/InChI → 描述符、指纹、匹配结果、转换、坐标 Skill 声明 BSD-3-Clause;集合声明 MIT;适用范围未解决
Datamol Skill,K-Dense 工作流指引和参考资料;Datamol 封装 RDKit 并返回原生分子对象 分子字符串/文件 → 处理后的分子、描述符表、聚类、骨架、构象 Skill 声明 Apache-2.0;集合声明 MIT;适用范围未解决
rdkit-agent Skill,scottmreed/rdkit-agent 用于独立 RDKit WASM CLI 的工具使用指引,并记录了 MCP 和 Node.js 接口 化学表示法/JSON 集合 → 验证、转换、描述符、搜索 未提供许可证据
nmrglue Skill,K-Dense 指引和经过校准的 1D 处理辅助工具;nmrglue、NumPy 和 SciPy 复数 FID 及采集参数/设置 → spectrum.csv、report.json Skill/集合代码采用 MIT;采集数据另行处理
Pymatgen Skill,K-Dense 材料指引和本地辅助工具;pymatgen;可选 mp-api 客户端 结构、组分、能量条目或查询条件 → 验证、转换、凸包分析、查询计划 Skill 采用 MIT;外部软件和数据条款另行处理
ASE Skill,CCAS 仅为顶层路由器;Python 和 ASE,可选 GPAW/MACE 适配器 任务意图/上下文 → 分支、理由、缺失输入、下一步委派 Skill 声明 MIT;集合提供 LGPL v3 文本;适用范围未解决
Phonopy Skill,CCAS 位移/分析指引;phonopy 及单独的力提供程序 结构/设置和位移晶胞的力或力常数 → 组装状态、声子色散/DOS/热学文件 Skill 声明 LGPL-3.0-or-later;力提供程序另行处理
Cantera Skill,K-Dense 指引和均相着火辅助工具;Cantera 和 NumPy 机理、初始状态、反应器约束、数值设置 → JSON、四组时间历程、机理快照 Skill/集合代码采用 MIT;机理权利另行处理
pycalphad Skill,K-Dense 指引和本地平衡辅助工具;pycalphad 和 NumPy TDB 以及组分/相/条件设置 → report.json、phase-equilibria.csv Skill/集合代码采用 MIT;TDB 权利另行处理
ReacNetGenerator Skill,CCAS 反应分子动力学工具选择指引;ReacNetGenerator 和独立的 reacnet-md-tools 封装程序;uv/python3 轨迹、原子映射、晶胞上下文 → 化学物种/反应分析文件、报告、日志 Skill 声明 LGPL-3.0-or-later;软件包和轨迹另行处理

应该选择哪种化学信息学方案?

日常分子准备、描述符计算、骨架分组和多样性选择可选 Datamol 指引。若任务需要明确的sanitization(化学合理性检查)决策、精细分子操作或专用算法,可选 RDKit 指引。两者区别在于接口和控制方式,并不意味着有证据表明其中一种能产生更好的科学结果。

如果结构化 CLI 交换适合宿主,可选 rdkit-agent 指引。其指引强调检查 overall_pass、查看修复建议,并限制返回字段或匹配结果的范围。可执行操作和 MCP 服务由底层软件包提供,而不是由 Skill 提供。文档所述的 MCP 模式并不能证明它兼容所有当前宿主。标准 WASM 不支持立体异构体枚举。

这三种方案都需要明确化学意义处理策略。在去除盐、进行中和或改变立体化学之前,应保留原始结构和标识符。Canonical SMILES 不会协调互变异构体,也不能确定依赖 pH 的质子化状态。指纹相似度不等同于分子身份,描述符阈值也不是效力或安全性预测。RDKit 中名为 pains 的辅助工具选项包含的是示例性基团,而非已发表的 PAINS 目录。

建议的分子库评估

**建议示例,并非经过测试的集成:**使用包含 source_id 和 smiles 的小型 CSV,评估 Datamol 的常规数据导入和 RDKit 的异常诊断。样例包括乙醇(CCO)、苯(c1ccccc1)、带电盐([Na+].[Cl-])、未指定立体化学的分子,以及有意给出的不完整环字符串(C1CC)。

  1. **导入:**保留每一行源数据。生成已接受和已拒绝记录表,不要静默删除失败记录。
  2. **策略决策:**判断盐和电荷是否代表预期实体。在本次评估中,除非明确说明转换理由,否则予以保留。
  3. **分析:**计算选定描述符,并记录一种指纹方案。导出标识符、如有的转换后表示、设置和失败原因。
  4. **检查:**确认拒绝记录后标识符仍保持对应关系;检查任何修复,不要将修复结果视为原始化合物。
  5. **规模决策:**在完整两两聚类前评估内存需求。Datamol 指引提醒,两两距离计算可能超过可用内存;适当时可改为评估有界多样性选择。

将这些产物交给下游模型或 DrugAgent 属于建议的消费方式,并非已确立的互操作性。应先定义其模式和来源记录要求。若添加标签,应在学习式预处理前评估按骨架/组别划分;这些 Skills 本身不提供预测模型。另请参阅RDKit AI 工作流。

将光谱处理与化合物鉴定分开

nmrglue 辅助工具面向均匀采样的复数 1D FID。其可接受输入为 .npz 中的单个复数 fid 数组,或规范的复数时域 NMRPipe 文件,并需提供明确的采集参数和手动相位设置。

决策关口在于采集证据:必须确认谱宽、观测频率、载波位置和复数符号约定,而不能猜测。NMRPipe 校准元数据若相互冲突,应停止导入。实验仪器数据的解码需要单独检查;成功打开转换后的文件并不能验证原始解码是否正确。

选择无信号基线区域和积分窗口前,应检查实部与虚部谱图。输出是正峰候选和带符号积分值,不是结构归属或化合物身份。负面积仍是诊断信息。零填充可改善插值,但不会提高采集分辨率;面积仍是任意信号×ppm 量值,不是浓度。

建议的材料工作流:验证、路由、力计算、分析

一种实用的建议评估组合是 Pymatgen → ASE 路由 → 独立力提供程序工作流 → Phonopy。这是架构建议,不是经过测试的集成。

首先使用 Pymatgen 指引检查周期性、坐标模式、占有率、警告和对称性敏感性。转换前应识别表示形式的损失,并在往返转换后比较与科学问题相关的性质。

接下来使用 ASE 顶层 Skill 区分工作流准备与计算器设置。混合请求先路由到 ase/ase-workflows,并将 ase/ase-calculators 作为依赖项。其输出是委派契约,而不是能量或力。GPAW 和 MACE 是指明的适配器,但所提供的路由器并未确立其详细行为。请求的执行通过 dpdisp-submit 委派。

对于 Phonopy,应指定晶胞上下文、超胞、位移幅度和分析目标。力必须由独立提供程序计算。保留位移与力文件的对应关系;若数据不完整或单位不一致,应停止。声子色散路径、网格和相关长程修正需要明确决策。应结合收敛性和设置选择调查虚频,而不是自动判定体系不稳定。

热力学与动力学回答的是不同问题

Pymatgen 本地凸包分析使用兼容的计算能量条目及提供的竞争相。pycalphad 则使用热力学 TDB 计算有限温度下的平衡相分数和组分。Cantera 辅助工具使用动力学机理演化封闭、绝热、均相的理想气体反应器。这三者不能互相替代。

对于 pycalphad,应提供恰好 N-1 个独立元素摩尔分数,并指定一个非空位的依赖元素。记录所选相和排除相,并检查摩尔分数、质量平衡和采样敏感性。随附的 Cu-Ni 数据库是用于教学的假设数据库,并非经过评估的合金数据库。平衡计算不会预测析出速率或保留的微观结构。

对于 Cantera,应确定采用恒容还是恒压条件,并保留机理来源记录。其着火延迟为均匀输出网格上温度导数达到全局最大值的时刻。若升温不足或最大值出现在边界,则延迟值为 null。比较之前应检查网格细化和守恒检查;数值一致性并不能验证机理或实验观测量。这些输出可为建议的工艺研究提供参考,但这两个辅助工具都不是通用工艺优化器。

反应分子动力学分析与故障恢复

ReacNetGenerator 指引区分常规轨迹分析、底层控制和现有输出检查。对于常规 LAMMPS dump 工作流,建议使用 rng-pipeline;需要更底层的选项时使用原生 reacnetgenerator;检查现有物种/反应文件时使用 rng-query。

解释反应网络前,应确认原子类型映射、缩放坐标与笛卡尔坐标的区别,以及周期性晶胞语义。独立的 reacnet-md-tools 封装程序处理坐标转换,包括三斜晶胞。映射存在歧义时应请求澄清,而不是猜测元素。记录是否使用了 HMM 处理;快速初步分析不构成科学验证。

在各类工作流中,应区分三种故障:输入无效、缺少执行依赖项,以及科学/数值检查未通过。保留每种状态及其日志和原始产物。不要用看似合理的结果替代缺失的力、未解决的着火延迟或未通过的平衡计算。

许可边界与读者检查清单

RDKit、Datamol 和 ASE 的单个文件与集合级许可声明存在冲突。复用或再分发前,应确认具体产物的适用范围;仓库公开可见本身不能得出任何许可结论。其他所列 Skill 的许可声明同样不会授予使用力提供程序软件、动力学机理、热力学数据库或服务数据的权利。Materials Project 是通过 mp-api 访问的外部数据服务,并非 Pymatgen Skill 提供的 API。

评估 Skill 前:

  • 明确科学问题和所需输出。
  • 区分指令、辅助工具、封装程序、引擎和外部服务。
  • 分别确认宿主权限和执行依赖项。
  • 记录单位、约定、转换和源标识符。
  • 从包含特意设置的失败输入的有界案例开始。
  • 除数值检查外,也检查科学假设。
  • 保留设置、哈希、版本、警告和未解决决策。
  • 分别检查软件和数据的许可范围。

来源

以下主要指令文件支持本文所述用途和边界:K-Dense 的 RDKit、Datamol、nmrglue、Pymatgen、Cantera 和 pycalphad;CCAS 的 ASE 路由器、Phonopy 和 ReacNetGenerator;以及 rdkit-agent Skill。解决适用范围时,请对照集合声明:K-Dense 许可和 CCAS 许可。