比较科学角色,而非智能体标签

选择化学智能体,应从所需产出开始:模拟轨迹、MOF 结构、经过推演的化学推理答案、假设,还是已实现的机器学习实验。这些产出各不相同,因此单一排名只会掩盖问题,而非帮助解释。

以下八个项目的证据详尽程度也不相同。有些提供软件和设置指南;另一些公开了研究代码,但部署说明并不完整。DrugAgent 在一篇论文中附有代码链接,但所提供的仓库页面并未证明其中包含可用的实现内容。仅凭仓库可见性,不能证明存在适用的开源许可证。

本指南比较来源所描述的能力,并提出评估步骤;不报告一手运行或科学测试结果。更广泛的概览请见化学 AI 智能体;有关架构差异,请参阅智能体与 Skills。

按协调的任务为系统分类

来源中可以归纳出四个实用类别:

  • **计算流程编排:**ChemGraph 将请求连接到分子构建、计算器、分析和报告;MDCrow 专注于分子动力学。
  • **领域专用材料工具:**ChatMOF 通过专用模块处理 MOF 检索、预测和生成任务。
  • **推理与方案构思:**SciAgents 生成由知识图谱引导的假设;ChemAgent (Gerstein Lab) 研究记忆支持的化学推理。
  • **工具学习与计算研究:**ChemAgent (AI4Chem) 研究规划与工具使用训练;STELLA 协调生物医学研究工具;DrugAgent 开发药物发现机器学习实现。

这些是框架,并非可以互换的独立预测模型。其科学产出取决于底层引擎、模型、数据库和任务定义。

Skills 和模板属于另一层:ChemGraph Skills 提供指令,STELLA 模板则编码可复用工作流。两者都不应被算作额外的自主科学家。加载指令并不会安装执行依赖,而且不同宿主的支持情况也不相同。同样,托管界面并不能证明所有本地功能都可在线使用。化学 AI 技术栈解释了这些层次如何衔接。

八种智能体:输入、输出与工具范围

本文比较采用 2026-10-06(UTC)取得的来源资料。下表描述各自角色,而非准确性对比。项目的具体背景请参阅各资源链接。

资源 科学角色与输入 来源描述的输出 重要工具与依赖
ChemGraph 化学请求和计算设置;专用工作流接受文档或配体/受体信息 结构、计算结果、轨迹、光谱和报告 LangGraph、ASE、RDKit 和 MCP;可用计算器取决于已安装的引擎
MDCrow 自然语言 MD 任务,包括蛋白质标识符和所需条件 执行模拟并进行所需分析,例如计算 RMSD 随时间的变化;完整文件格式未明确说明 LangChain 编排、OpenMM 模拟、已配置的环境和 LLM 提供商密钥
ChatMOF 文本形式的 MOF 查询和所需性质 检索到的信息、性质预测或生成的结构 任务模块设置;生成还需要 GRIDAY;在线演示侧重搜索
SciAgents 关键词或采样的知识图谱路径 结构化假设 JSON 和附带评议的扩展方案 GraphReasoning、图与嵌入文件、OpenAI 和 Semantic Scholar API;自动化工作流使用 AG2
ChemAgent (Gerstein Lab) 多步化学推理问题 记忆支持的解答和已存储的任务经验 记忆构建和模型配置;缺少完整的安装指南
ChemAgent (AI4Chem) 化学/材料任务和工具调用参数 工具支持的答案或预测;具体模式未明确说明 ChemToolBench 和化学/材料工具池;部署要求尚未确定
STELLA 生物医学目标;案例研究还使用先前筛选反馈 有证据支持的基因排序或酶变体方案;案例脚本保存 CSV 和文本 本地 OpenRouter 密钥;可选的文献/搜索服务和单独分发的生物医学资源
DrugAgent (Liu et al.) 任务描述、起始文件和评估器 已实现的机器学习方案、性能或失败报告,以及实验提交文件 使用领域文档的 Planner/Instructor 工作流;实现内容可访问性和设置情况尚未确认

ChemGraph 明确记录了提供和使用 MCP 工具的方式。这并不证明其他七个项目都支持相同的协议接口或当前客户端。任何跨项目连接方案都需要检查接口并单独测试。

代码、许可证与复现障碍

应将论文对应的版本快照与仓库修订版分别记录。当前 README 可能描述原始论文中没有的功能;论文中的代码可用性声明也不能证明运行环境完整。

项目 此处有来源依据的论文或研究快照 代码/许可证证据 主要复现障碍
ChemGraph README 引用一篇发表于 Communications Chemistry 的文章,第 9 卷,文章 33 (2026) 仓库代码与文档说明的运行入口;Apache-2.0 使计算器依赖与特定工作流基础设施相匹配
MDCrow arXiv:2502.09565v1 仓库代码和安装指南;MIT OpenMM 环境、提供商集成和任务设置
ChatMOF README 引用 Nature Communications 15, 4705 (2024) 软件包配置和 CLI;MIT 本地预测/生成模块和 GRIDAY,而不只是演示访问权限
SciAgents README 引用 Advanced Materials,文章 2413523 (2024) Notebook 代码;Apache-2.0 许可证文本与 MIT 软件包分类器冲突 外部知识图谱资源、API 和尚未解决的许可证元数据问题
ChemAgent (Gerstein Lab) arXiv:2501.06590v1 已发布研究代码;仅有 Apache-2.0 徽标,不能确认许可证文本 安装部分仍为占位内容,且需要先构建记忆
ChemAgent (AI4Chem) ChemistryAgent 中的 CheMatAgent,arXiv:2506.07551v2 有仓库框架及数据集位置的说明;许可证未知 缺少部署说明,检查点也未确认
STELLA arXiv:2507.02004v1;当前 README 还链接到扩展版 bioRxiv 展示 有代码与运行入口的描述;Apache-2.0 资源需另行分发,且文献与模型输出会变化
DrugAgent arXiv:2411.15692v2 论文链接到匿名仓库;所提供的页面没有公开实现文件或代码许可证 确认代码访问权限、环境和评估器复现方式

在重新分发或改编之前,SciAgents 的许可证冲突需要认真处理:应检查目标代码快照并寻求澄清,而非挑选对自己最方便的标签。STELLA 的 README 与软件包元数据也使用不同的版本标签,因此不要把其中任一标签当作统一的发行版本标识。

代码许可证不会自动涵盖模型权重、数据集、API 或托管访问权限。例如,ChemGraph 的 README 单独说明了 MACE-Polar 权重适用的 ASL 条款。有关这一差异,请参阅软件、权重与数据许可证。

区分两个 ChemAgent 项目

ChemAgent (Gerstein Lab) 研究化学问题求解中的可复用记忆。任务拆分、执行、关联和反思与 Plan Memory、Execution Memory 和 Knowledge Memory 协同工作。其有文档记载的实验使用源自 SciBench 的 atkins、chemmc、matter 和 quan 数据集。论文将药物发现和材料科学列为未来可能的方向,并未将其确立为端到端工作流。

复现工作应从记忆的来源追溯和构建开始。README 对 Knowledge Memory 的称呼在 image 与 img 之间交替,路径中的 Xagent 与 XAgent 也不一致;运行实验之前,应对照所选代码版本确认正确名称。失败后的优化和启用评估是两个独立的控制项。

ChemAgent (AI4Chem) 是 ChemistryAgent 仓库中的 ChemAgent 框架,对应题为 CheMatAgent 的论文。其研究重点是外部工具选择、参数填写和执行。HE-MCTS 将规划优化与执行分开,而 ChemToolBench 支持训练和评估。它并非 Gerstein Lab 的记忆系统,简略的 README 也不足以证明它可以直接部署运行。

在笔记、依赖记录和引用中,应同时注明仓库与论文标识符;仅凭相同名称无法区分项目。

根据研究阶段与预期用途进行选择

对于计算化学,首先确定需要通用的分子/计算器编排,还是专用 MD 工作流。ChemGraph 和 MDCrow 分别是相关候选,但都不能替代方法选择。

对于材料发现,ChatMOF 适用于 MOF 专用检索、预测和生成;SciAgents 则适用于仿生材料假设的构建。ChemAgent (AI4Chem) 适合研究化学/材料工具学习,但部署路径的成熟度较低。

对于文献研究,STELLA 提供生物医学搜索和注重证据的工作流;SciAgents 使用检索来评议假设。检索范围并不保证覆盖全面。

对于药物发现,应区分靶点或变体优先级排序与机器学习编程。STELLA 描述了生物医学优先级排序工作流;DrugAgent 则研究了在 PAMPA、HIV 和 DAVIS 二元分类案例中实现和评估机器学习。其作者明确提醒,不应直接将其部署为流水线。药物发现中的 AI提供了更广泛的工作流背景。

学习时,可检查架构和规模较小且有文档说明的示例。开展复现实验时,应选择固定任务并保留产物。用于实际研究时,在推进任何输出前,应要求方法审查、证据可追溯性和独立核查。这些是建议的适用性标准,并非就绪认证。

材料研究的阶段选型可参阅材料科学 AI 工作流。

建议示例:评估 MD 助手而不过度声称

一个具体的试点方案是依据 README 中涉及蛋白质 1ZNI、300 K、0.1 ps 模拟和随时间计算 RMSD 的任务评估 MDCrow。这是工作流检查,不是科学上充分的采样研究。

  1. **定义输入:**记录蛋白质标识符、预期结构、温度、持续时间和 RMSD 请求。在执行前,由研究人员指定可接受的准备、力场和分析选择。
  2. **检查前置条件:**遵循有文档说明的环境和提供商设置。确认所需模拟工具可用,而不要假定语言接口已经提供这些工具。
  3. **检查决策:**在接受执行前,检查结构准备、模拟配置、原子选择和对齐选择。
  4. **收集输出:**索取可用的配置记录、执行日志和 RMSD 结果。若缺少这些产物,应将试点视为失败;所提供的 README 并未完整说明其格式。
  5. **决定是否继续:**将记录的设置和分析与研究人员准备的参考工作流进行比较。区分执行成功与动力学结果具有科学意义。

后续可考虑使用单独整理的数据集、起始文件和评估器,开展 DrugAgent 机器学习实现研究。目前没有依据证明 MDCrow 到 DrugAgent 之间存在自动交接或经过测试的互操作性。应先确认代码访问权限并定义数据契约。可复现的化学 AI介绍了此类评估所需的记录工作。

处理失败与科学局限

重试前先对失败分类。缺少引擎、无法访问资源或提供商凭据属于环境故障;工具参数格式错误属于编排故障;计算未收敛或方法不适用则属于科学失败。保留失败输入和日志,再修正相关层的问题。不要让智能体悄悄换用其他方法,只为得到一个看似成功的答案。

设置项目专属的把关要求。ChemGraph 的 EMT 示例是设置检查,并非适用于一般高精度化学的验证。尽管会审查操作,ChemGraph 的工作区 shell 并未被限制在工作区内。ChatMOF 的在线搜索演示不能代替本地预测或生成。SciAgents 提出的机制仍是假设。STELLA 提醒,基因排序可能因模型随机性和文献索引更新而变化。应根据实际评估器产物检查 DrugAgent 的性能报告,尤其要注意论文对结果造假的担忧。

开展对比实验时,应使用等效输入、记录明确的方法、固定数据快照和明晰的失败类别。不要把推理基准、检索任务和模拟完成情况合并为一个分数。智能体更多、工具更多或方案更长,都不能证明科学结论更好。

读者核对清单

  • 明确所需产物和研究阶段。
  • 记录仓库修订版和论文版本。
  • 确认代码内容、安装指南和所需资源。
  • 分别厘清代码、权重和数据的许可证问题。
  • 规定输入、单位、方法选择和验收标准。
  • 保留工具调用、配置、日志和原始输出。
  • 为证据缺失或科学失败设定停止条件。
  • 尝试交接前先审查集成方案。

来源

主要能力信息来源为以下官方 README:ChemGraph、MDCrow、ChatMOF、SciAgents 和 STELLA。

ChemAgent 项目之间的区别依据 Gerstein Lab README 和论文,以及 AI4Chem README 和 CheMatAgent 论文。DrugAgent 的架构与部署限制来自论文 v2。SciAgents 的许可证差异可见于其许可证文件和软件包元数据。