将 Skill 视为工作流设计,而非能力证明

Skill 会影响智能体的决策、命令、文件更改和外部请求。应将其作为拟议的操作流程来审查,而不只是添加到提示词中的文档。核心问题是:它的指令、工具和证据处理方式,是否适合你准备授权的化学任务?

Scientific Agent Skills repository 为科学软件包、数据库和研究工作流提供指导。其文档所述的化学领域覆盖包括 RDKit、PyTDC、分子对接、ADMET 分析、校准的 1D NMR 处理和晶体结构分析。这些是来源中描述的工作流,并不能证明每项流程都能在你的环境中正常运行。

本指南提出一种审查与评估流程。它不报告对该集合进行过安装、执行或第一手科学测试。

选择一项任务并检查其完整指令

从范围明确的任务开始,例如计算指定的分子描述符,或检索给定化合物列表对应的数据库记录。不要仅仅因为今后可能需要多个工作流,就启用整个集合。

仓库说明,每个 skill 都有一个 SKILL.md,其中包含用途、工作流和版本元数据。辅助材料可能包括示例、参考资料、可执行辅助程序或模板。应同时检查这些资源和主要指令。

  1. 写明预期输入、所需输出和禁止执行的操作。
  2. 从头到尾阅读所选 skill 的指令。
  3. 查看智能体可能使用的脚本和模板的相关引用。
  4. 标记会安装软件包、写入文件、联系服务或需要凭据的操作。
  5. 找出流程中需要科学判断或人工批准的环节。

**决策问题:**该工作流是否直接适用于你的任务?能否排除无关操作?缺少先决条件时,它会停止,还是会鼓励智能体自行变通?

区分 skill 文件、依赖项与访问权限

安装指令并不会一并提供底层科学软件、数据集或服务访问权限。仓库明确区分 skill 安装和依赖项安装,并建议为需求不兼容的工作流使用单独的环境。

为所选流程建立先决条件清单:

  • 科学软件包及其文档中列出的兼容性限制。
  • 系统工具和计算资源。
  • 输入数据集、格式和必需元数据。
  • 外部端点、访问条件和凭据。
  • 可写目录和预期输出文件。

来源中描述的 Database Lookup 指南涵盖端点选择、分页、访问要求和来源与处理记录,包括 PubChem 和 ChEMBL。这些数据库仍是独立资源;skill 中提到它们,并不意味着你可以访问所有记录或服务。

宿主支持也是另一个需要确认的问题。仓库介绍了 Agent Skills 打包方式,以及使用 plugin.json 和 skills/ 的 Agent Plugins 布局,但发现路径和可选元数据处理取决于宿主。文档提及某个宿主名称或格式,并不等于已成功进行兼容性测试。

继续之前,请分别确认软件、权重和数据的许可权限。不要仅凭指令集合推断上游许可权限。

定义保留证据的输出约定

化学工作流应在每次转换过程中保留分子的身份、来源记录和观测结果。评估智能体前先定义输出,避免精炼的叙述掩盖证据缺失。

对于分子记录工作流,拟议的输出约定可以包括原始输入标识符、提交的结构、解析状态、检索到的来源标识符、转换说明和任何计算值。适用时记录单位和计算定义。对于文献研究,保留来源链接或标识符,并区分检索到的陈述与智能体的解读。

明确规定失败时的行为。无效结构、匹配不明确、记录不可用和缺失值都应清晰呈现,而不是被静默丢弃或用猜测填补。如果结构经过标准化,应保留原始表示,并说明所采用的策略。

**决策问题:**每项结果都能追溯到其输入吗?计算量与来源报告的观测值是否分开呈现?工作流能否保留不确定性,而不是把不完整证据变成自信的结论?

限制命令、文件和网络服务

首次评估时使用权限有限且不含敏感信息的环境。只允许访问所选任务所需的文件位置、服务和凭据。对超出该范围的操作要求批准,尤其是安装变更、破坏性操作或上传。

执行辅助程序前,应查看其实际来源。检查其输入假设、输出位置和错误处理方式,不要只依据文件名或示例说明作出判断。

仓库介绍了安全扫描和审查实践,但也提醒,不能保证进行穷尽的风险审查。扫描结果只是辅助证据,不能替代对 skill 要求智能体执行哪些操作的理解。将下载的记录和文档视为数据,而不是扩大工作流权限的依据。

规划示例:描述符计算与记录查询

**假设情景:**某化学团队希望智能体为 12 条不含敏感信息的 SMILES 记录计算指定的 RDKit 描述符,然后检索相关 PubChem 记录。这是对已记录的软件包与数据库指南的一种拟议组合,并非经过测试的集成。

**输入:**一张表格,其中每行包含本地化合物 ID 和原始 SMILES。加入一条重复记录、一个无效字符串和一个带电结构,以暴露潜在假设。

**拟议输出:**每项输入对应一行状态记录,保留原始 ID 和 SMILES,并包含解析状态、任何转换后的表示、指定描述符、来源标识符、检索来源与处理记录以及错误说明。缺失结果应明确标记为缺失。

分阶段规划评估:

  1. 检查相关的 RDKit 和 Database Lookup 指令及其引用资源。
  2. 明确描述符定义和结构处理策略。
  3. 分开评估本地计算和网络检索。
  4. 在相同定义和环境下,将计算结果与人工控制的直接基线进行比较。
  5. 在允许智能体总结数据库匹配结果前先进行检查。

一种合适的拟议验收规则是:每项输入都有对应记录,无效输入会被标记,且不会强行接受缺乏依据的身份匹配。仅凭描述符值或数据库匹配结果,不应得出生物活性或安全性结论。

评估流程并记录其局限

记录智能体宿主、模型、skill 修订版本、软件包版本、输入来源与处理记录、权限以及人工修正。遵循保持化学 AI 工作流可复现中的原则。

仓库区分结构检查、科学依赖项测试和在线服务检查。这些检查提供的证据各不相同:结构有效的 skill 不一定科学正确,本地测试也不能证明远程服务可靠。一个成功案例只能支持其所评估的配置和情况;更广泛的科学主张需要单独研究。

简要审查清单

  • 明确任务、输入、输出和禁止操作。
  • 检查 SKILL.md 以及所有相关辅助资源。
  • 确认依赖项、访问条件和宿主发现行为。
  • 限制权限,并从非敏感数据开始。
  • 要求输出可追溯,并明确呈现失败情况。
  • 与基线进行比较,并检查边缘情况。
  • 在授权更广泛使用前记录局限。