聊天机器人变成智能体后,有什么变化?

一个实用的区分方式是:系统只是提出答案,还是能够针对任务采取行动、检查结果并决定下一步做什么。解释分子动力学方案属于对话式辅助。选择准备工具、启动模拟并请求分析,则属于智能体工作流。

在本文中,自主研究意味着一系列可委派的能力,而不是无人值守的科学发现承诺。研究人员可以委派信息检索、规划、计算或实施,同时保留对假设、执行权限和结论的决定权。更高的自主性应意味着更明确的任务约定,而不是更少的科学检查。

本指南聚焦于八个化学与生物医学研究项目。若要了解模型与基础设施的更广泛区别,请参阅化学 AI 技术栈指南和MCP、Skills、智能体与 API 指南。另请参阅单独的智能体与 Skills 指南,了解跨科学工作流和权限评估。

工作组成部分:模型、工具、记忆、规划与执行

理解智能体架构时,可以将其视为职责划分:

  • **LLM:**理解目标、提出步骤并解释结果。其文本本身并非计算或测量结果。
  • **工具:**检索记录、构建结构、预测性质、运行模拟或操作文件。工具的科学适用范围取决于其底层方法。
  • **记忆:**保留可复用信息,例如先前任务的解决方案或工作流模板。重新使用前需要检查其来源与处理记录并进行审查。
  • **规划:**将目标转化为工具选择、参数和依赖关系;某些框架还会探索备选计划。
  • **执行:**采取相应行动,并返回产物、错误或报告,以供下一步决策参考。

这些组成部分不是可以互换的产品。编排框架不是独立的性质模型。封装器或工具接口用于开放另一个程序的能力,并不能取代该程序。托管模型 API 提供的是模型访问,而不是本地科学环境。

官方 Agent Skills 格式将指令打包在 SKILL.md 中,并可选配支持资源或脚本。不同宿主对其支持情况各异,加载指令并不会安装执行依赖。因此,应将 ChemGraph 的 Skills 和 STELLA 的工作流模板理解为辅助流程,而不是额外的自主研究者。

MCP 定义了宿主、客户端和服务器之间的上下文交换。ChemGraph 说明了如何提供和使用 MCP 工具。当前的协议概览并不能证明每个旧版项目实现都兼容当前宿主。

工具访问层的原理与评估可参阅化学领域的 MCP。

按研究角色比较八个项目

表格描述的是有来源支持的角色,并非排名或经过测试的互操作性矩阵。入口建议仅供评估时参考。

项目 来源所述的角色与输出 建议的评估起点与主要边界
ChemGraph 编排分子构建、ASE 计算、分析和报告;产物可包括结构、轨迹、光谱和结果 从 single_agent 开始;可用计算器取决于环境,EMT 适用于设置检查,而非一般的高精度化学计算
MDCrow 协调分子动力学准备、OpenMM 执行、分析和科学信息检索 检查一个小型模拟与 RMSD 工作流;所提供的证据不能证明其涵盖全面的设置或输出格式
ChatMOF 将 MOF 请求路由至检索、性质预测和结构生成工具 从搜索开始;本地预测需要模块设置,生成还需要 GRIDAY
SciAgents 使用图上下文和专门化智能体生成结构化假设与扩展研究提案 检查抽样图路径及其生成的提案;输出仍是假设,需要后续跟进
ChemAgent (Gerstein Lab) 拆解化学推理问题,并检索可复用的 Plan、Execution 和 Knowledge 记忆 构建记忆后,复现一项有文档说明的 SciBench 衍生任务;安装指导不完整
ChemAgent (AI4Chem) 与 CheMatAgent 论文相关联的框架,研究化学/材料工具学习和树搜索规划 研究工具选择和参数填写;部署要求与检查点是否可用尚未明确
STELLA 使用管理、开发和评论角色、可复用模板以及可选工具创建功能,协调生物医学文献、数据库和分析 检查有证据支持的排序或分析任务;本地执行需要 OpenRouter 访问权限以及依任务而定的资源
DrugAgent (Liu et al.) 论文所述的 Planner–Instructor 协作,用于实现和评估药物发现机器学习工作流 将其方法作为复现起点;所提供的仓库证据不能证明其具有可运行的设置或代码许可证

两个名称相似的条目需要仔细区分:Gerstein Lab ChemAgent 研究的是记忆辅助化学推理;而 AI4Chem 仓库将 ChemAgent 框架与 CheMatAgent 论文关联起来。名称相似并不能证明功能等同。

让智能体匹配科学任务

对于计算化学,应区分编排工作与实际执行计算的引擎。ChemGraph 提供更广泛的构建—计算—报告层,而 MDCrow 专门面向分子动力学。根据所需计算和产物进行选择,然后确认所需引擎和设置是否可用。

对于材料发现,ChatMOF 面向 MOF 检索、预测和生成。SciAgents 则根据图关系提出受生物启发的材料假设。生成的结构和研究提案回答的是不同问题:前者提供计算候选项,后者提供待研究方向。

对于分子设计,应先明确交付内容是构建出的结构、预测的性质,还是针对目标性质提出的候选项。ChatMOF 明确描述了面向目标性质的 MOF 生成。不能将 ChemGraph 的分子构建能力悄然扩展为通用逆向设计能力。

对于文献研究,STELLA 提供生物医学搜索和注重证据的工作流;SciAgents 在形成假设时使用检索到的信息。ChemGraph 也说明了 PDF/文本检索工作流,MDCrow 的论文则描述了文献与数据库检索。应要求提供可追溯的支持来源,而不能只接受流畅的摘要。

对于药物发现,DrugAgent 的角色是机器学习编程,而非实验室发现。其论文研究了 PAMPA、HIV 和 DAVIS 分类任务。STELLA 描述了生物医学优先级排序和虚拟筛选工具,而 ChemGraph 具有特定依赖项的对接工作流。这些阶段不能互相替代,也不能替代实验验证。

多智能体何时有用,以及角色意味着什么

当职责可以拆分且交接过程可审查时,多智能体就有用。SciAgents 将概念澄清、提案开发、完善和批评分配给不同角色;其自动化工作流还增加了规划和新颖性检查。STELLA 将管理、开发和批评角色分开,并可选择创建工具。DrugAgent 则将策略探索与领域指导下的实施分开。

关键不在于有多少个智能体,而在于每个边界传递了什么证据。规划器应移交明确的输入和约束。执行器应返回产物和失败信息。评论者应指出缺乏支持的假设,而不只是以更肯定的语气改写答案。

评估时,如果一组工具步骤已经足够,最好从单智能体开始。只有当专门角色带来可检查的益处时才增加,例如独立检查参数或比较不同实现方案。不能将智能体之间意见一致视为独立的科学确认。

拟议示例:有界的分子动力学评估

**这是一个拟议的评估方案,并非已完成的测试。**以 MDCrow 文档中的蛋白质模拟与 RMSD 示例为起点,但要求提供可检查的工作流,而不只是最终答案。

**输入:**经研究人员批准的蛋白质标识符或结构、温度、刻意设定为较短的运行时长、所需的 RMSD 分析、隔离的软件环境和计算资源上限。对于示例未明确的准备与模拟选项,应由研究人员指定。

  1. **规划:**要求列出准备、执行和分析步骤。决策点:所需设置是否明确,还是智能体给出了未经审查的默认值?
  2. **批准:**执行前检查结构和拟定的设置。如果参数有歧义或缺乏支持,应停止并解决问题,而不是允许其自行替换。
  3. **执行:**只授权有界运行。保存生成的输入、执行日志和可用的模拟产物;在本地确认这些产物的实际格式。
  4. **分析:**要求按时间计算 RMSD,并说明原子选择和参考结构。决策点:分析选择是否符合科学问题?
  5. **审计:**将摘要与保存的证据进行比较。分别归类缺失产物、执行错误和缺乏支持的结论。

**要求的输出:**参数记录、执行状态、产物清单、RMSD 分析,以及对未解决假设的简要说明。这是评估约定,并非声称 MDCrow 会自动生成所有这些内容。

在这些条件下,成功完成短程运行只能证明工作流已完成,并不能证明采样充分或得出了生物学结论。若后续拟将 DrugAgent 用于机器学习工作流开发,这将属于拟议集成,需要分别定义数据、标签、评估规则和交接方式;本文并未证明存在此类互操作性。

故障处理与科学边界

应利用故障缩小任务范围,而不是鼓励越来越不受限制的重试。

  • **缺少引擎或依赖项:**停止受影响的阶段,并指出缺少什么。未经批准,不要用科学作用不同的计算器替代。
  • **参数或结构格式错误:**重试前检查工具调用和输入产物;保留失败的尝试。
  • **缺少引文或证据矛盾:**将其作为尚未解决的证据问题返回,而不是编造调和说法。
  • **计算或分析失败:**区分执行失败和不利的科学结果。再精致的报告也无法弥补缺失的计算。
  • **不安全的文件或代码操作:**要求审查并隔离。ChemGraph 明确指出,工作区 shell 访问并未被限制在工作区内。

科学审查应检查标识、单位、计算设置、收敛性、分析定义,以及所用方法是否足以支持结论。对于拟议的机器学习评估,还应检查数据来源与处理记录、数据集划分和标签处理;可复现化学 AI 指南提供了更广泛的框架。

记忆和模板还引出另一个决策:这项结果是否应成为可复用指导?建议只有在经过审查、记录来源与处理过程且适用范围明确的记录才予以纳入。STELLA 指出,排序结果可能随模型随机性和文献索引变化而变化。SciAgents 的新颖性评估仍是依赖检索结果的判断。DrugAgent 的作者明确警告,不要将其直接部署到药物发现流程中,因为捏造的结果可能误导后续工作。

选择清单与尚未解决的设置问题

选择项目之前,请检查:

  • 预期输出是答案、假设、结构、模拟产物,还是已实现的机器学习解决方案?
  • 所需引擎、模型、资源和凭据是否有文档说明?
  • 是否可以单独检查工具参数与输出,而不依赖叙述性摘要?
  • 执行权限和停止条件是否明确?
  • 是否能保留失败尝试,而不覆盖有用证据?
  • 谁负责批准科学假设和下游用途?
  • 代码、权重、数据和服务条款是否分别评估?

文档缺口会直接影响项目选择。ChatMOF 的在线演示侧重搜索,并非通用的预测与生成试用。复现前,应对照代码解决 Gerstein Lab ChemAgent 中 image/img 设置和 Xagent/XAgent 路径不一致的问题。AI4Chem 在所提供的 README 中没有提供部署说明。STELLA 当前的 README 与链接的 arXiv 论文呈现方式不同,因此复现时应明确采用哪个版本。

SciAgents 还存在许可证元数据冲突:其许可证文件包含 Apache License 2.0,而包元数据声明 MIT。重复使用或再分发前应先解决这一问题。仓库公开可见并不能证明其许可证情况;有关不同层面的许可,请参阅软件、权重与数据许可证指南。

继续阅读相关指南:化学 AI Agent 对比:能力、代码可用性与研究边界。

来源

主要能力信息来源包括 ChemGraph README、MDCrow README和论文、ChatMOF README,以及 SciAgents README。

有关记忆和工具学习的说法依据 Gerstein Lab ChemAgent README及论文,以及 AI4Chem README和 CheMatAgent 论文。生物医学编排信息依据 STELLA README;DrugAgent 的架构和部署警示依据其论文。

基础设施区别依据官方 MCP 架构概览和 Agent Skills 概览。SciAgents 的许可证冲突见其许可证文件和包元数据。