区分指令与执行

科学工作流包含多个可分别审查的层次:指令描述流程,智能体协调步骤,而工具执行文档检索或分子计算等操作。技能可以为智能体提供指导,但并不因此提供执行这些指导所需的软件、凭据或科学验证。

选择资源之前,先梳理这些层次各自承担的职责。哪个组件选择下一步操作?哪个执行计算?哪个写入文件?谁来审批可能产生重大影响的变更?让工具实现、工作流指令和模型配置保持可分别检查。以下建议是拟议的设计与评估步骤,不是第一手测试报告。

按工作流角色匹配资源

链接的资源参考资料描述了四种不同的切入点:

  • ChemCrow 通过基于 Langchain 的 Python 智能体,将自然语言化学问题与工具连接起来。其所述集成包括 RDKit、paper-qa、化学信息源以及由 RXN4Chem 支持的反应工具。公开仓库省略了论文中的部分工具,并明确警告称无法复现论文结果。
  • PaperQA 支持科学文档检索和带文内引文的问答。其所述工作流会搜索本地文档集、检索段落并生成证据摘要。Docs 接口支持文档选择与查询,无需智能体编排。
  • Coscientist 提供了一个简单实现和用于研究支持的数据。README 将各目录对应到合成规划、库选择、重复运行和优化。链接的参考资料并未证实其执行流程或仪器就绪状态。
  • Scientific Agent Skills 提供工作流指令和配套资源,而非独立的研究智能体。其 README 描述了化学、数据库、模拟和分析方面的指导;是否能够执行取决于宿主环境及各项技能的依赖项。

这些角色可以为工作流设计提供参考,但不足以证明这四种资源能够互操作。

定义边界明确的输入与输出约定

从结果易于检查、无需授予广泛自主权的任务开始。文献提取是一个值得考虑的选择:智能体接收指定的文档集,并返回与证据关联的记录,而不是自行决定接下来要开展什么研究。

选择智能体之前,先写明约定:

  1. **输入:**明确允许使用的文件、科学问题、可接受的标识符和任何排除标准。
  2. **输出:**定义必需字段、来源引用、不确定性标签,以及供审核者检查的格式。
  3. **权限:**规定允许读取和写入的内容,以及允许访问的网络目的地。
  4. **审批关卡:**指出哪些操作需要人工参与,包括扩展语料库或更改解释。
  5. **停止条件:**证据、权限或必需输入缺失时,要求停止或升级处理。

考虑确定性工具或人工控制的检索工作流是否已经足够。只有在能够评估智能体编排增加的额外选择时,编排才有意义。

通过假设性规划示例梳理流程

**假设情景:**研究人员希望比较一小批获准使用的 PDF 中所报告的反应条件。这是一个规划示例,不代表经过测试的集成,也不是进行这些反应的建议。

输入应包括 PDF、措辞范围明确的提取问题,以及涵盖底物标识符、报告的条件、产率、来源位置和注意事项的字段定义。拟议的输出应为一张表格和一份异常记录。缺失信息应继续标记为缺失;相互矛盾的报告应分别记录,不应在不说明的情况下擅自调和。

PaperQA 是文档检索和带引文回答的候选工具,因为参考资料描述了这些能力。选定的技能可以提供流程指导,但仍需单独评估其宿主环境。只有在新增的化学工具步骤有明确依据时,才应考虑使用 ChemCrow;基本文档提取并不需要它。

拟议流程是:人工选择文档、检索支持性段落、起草记录、逐条对照来源检查记录,并取得审核者批准。进行任何计算之前,先问:这个字段是来源中报告的,还是推断得出的?分子标识符是否明确无歧义?这项计算是否回答了已提出的问题?Coscientist 的研究目录可以为单独研究规划方法提供参考,但不能替代这份提取约定。

限制工具,并将检索内容视为数据

只开放完成边界明确的任务所必需的能力。使用专用输出位置,限制网络访问,并确保凭据不出现在检索到的文档或生成的记录中。不要允许论文、README 或技能指令自行授予新权限或覆盖工作流控制措施。

启用技能之前,应先检查其中范围明确的一部分。Scientific Agent Skills 可能包含辅助程序以及直接操作文件或代码的功能;仅有指令并不能构成执行沙箱。同样,ChemCrow 的外部反应工具以及 PaperQA 对模型、嵌入和元数据的依赖,都需要单独配置和评估。应记录这些边界,而不是将上游服务视为内置能力。

让每项结果都附带证据

要求科学结论同时提供来源标识符和位置。记录每个数值是提取、转换还是计算所得,并在适用时注明所用工具。经许可的情况下,保留中间证据。

PaperQA 的引文提供了追溯证据的途径,但不能保证答案正确。应检查引文段落是否支持具体主张、限定条件是否得到保留,以及表格或图形是否得到了恰当解读。如果无法检查某个来源,应标出这一限制,而不是用看似合理的文本填补空缺。

评估失败情形并做好变更控制

围绕文件缺失、标识符含糊、文档相互矛盾、不受支持的问题和工具错误设计评估案例。纳入试图改变工作流方向的检索文本。检查系统是否遵守审批关卡并报告不确定性;行文流畅并不能证明内容正确。

使用明确的字段级验收标准,将提取记录与人工准备的参考集进行比较。不要根据仓库描述或其他地方取得的研究结果推断性能。对指令、启用的工具和模型配置进行版本管理,并在变更后重复具有代表性的评估。明确保留人类对科学解释和重大影响操作的责任。

使用简短的启动清单

  • 定义可检查的输入、输出和停止条件。
  • 只选择任务所需的资源角色。
  • 检查技能、依赖项和外部服务要求。
  • 限制权限,并要求审批范围变更。
  • 在扩大使用范围前核验证据并测试失败处理。
  • 记录配置变更和未解决的限制。

继续浏览 浏览资源 和 浏览科学任务。请通过来源链接调查相关要求;本指南不认证科学性能、可重复性或兼容性。