比较科学角色,而非智能体标签
选择化学智能体,应从所需产出开始:模拟轨迹、MOF 结构、经过推演的化学推理答案、假设,还是已实现的机器学习实验。这些产出各不相同,因此单一排名只会掩盖问题,而非帮助解释。
以下八个项目的证据详尽程度也不相同。有些提供软件和设置指南;另一些公开了研究代码,但部署说明并不完整。DrugAgent 在一篇论文中附有代码链接,但所提供的仓库页面并未证明其中包含可用的实现内容。仅凭仓库可见性,不能证明存在适用的开源许可证。
本指南比较来源所描述的能力,并提出评估步骤;不报告一手运行或科学测试结果。更广泛的概览请见化学 AI 智能体;有关架构差异,请参阅智能体与 Skills。
按协调的任务为系统分类
来源中可以归纳出四个实用类别:
- **计算流程编排:**ChemGraph 将请求连接到分子构建、计算器、分析和报告;MDCrow 专注于分子动力学。
- **领域专用材料工具:**ChatMOF 通过专用模块处理 MOF 检索、预测和生成任务。
- **推理与方案构思:**SciAgents 生成由知识图谱引导的假设;ChemAgent (Gerstein Lab) 研究记忆支持的化学推理。
- **工具学习与计算研究:**ChemAgent (AI4Chem) 研究规划与工具使用训练;STELLA 协调生物医学研究工具;DrugAgent 开发药物发现机器学习实现。
这些是框架,并非可以互换的独立预测模型。其科学产出取决于底层引擎、模型、数据库和任务定义。
Skills 和模板属于另一层:ChemGraph Skills 提供指令,STELLA 模板则编码可复用工作流。两者都不应被算作额外的自主科学家。加载指令并不会安装执行依赖,而且不同宿主的支持情况也不相同。同样,托管界面并不能证明所有本地功能都可在线使用。化学 AI 技术栈解释了这些层次如何衔接。
八种智能体:输入、输出与工具范围
本文比较采用 2026-10-06(UTC)取得的来源资料。下表描述各自角色,而非准确性对比。项目的具体背景请参阅各资源链接。
| 资源 | 科学角色与输入 | 来源描述的输出 | 重要工具与依赖 |
|---|---|---|---|
| ChemGraph | 化学请求和计算设置;专用工作流接受文档或配体/受体信息 | 结构、计算结果、轨迹、光谱和报告 | LangGraph、ASE、RDKit 和 MCP;可用计算器取决于已安装的引擎 |
| MDCrow | 自然语言 MD 任务,包括蛋白质标识符和所需条件 | 执行模拟并进行所需分析,例如计算 RMSD 随时间的变化;完整文件格式未明确说明 | LangChain 编排、OpenMM 模拟、已配置的环境和 LLM 提供商密钥 |
| ChatMOF | 文本形式的 MOF 查询和所需性质 | 检索到的信息、性质预测或生成的结构 | 任务模块设置;生成还需要 GRIDAY;在线演示侧重搜索 |
| SciAgents | 关键词或采样的知识图谱路径 | 结构化假设 JSON 和附带评议的扩展方案 | GraphReasoning、图与嵌入文件、OpenAI 和 Semantic Scholar API;自动化工作流使用 AG2 |
| ChemAgent (Gerstein Lab) | 多步化学推理问题 | 记忆支持的解答和已存储的任务经验 | 记忆构建和模型配置;缺少完整的安装指南 |
| ChemAgent (AI4Chem) | 化学/材料任务和工具调用参数 | 工具支持的答案或预测;具体模式未明确说明 | ChemToolBench 和化学/材料工具池;部署要求尚未确定 |
| STELLA | 生物医学目标;案例研究还使用先前筛选反馈 | 有证据支持的基因排序或酶变体方案;案例脚本保存 CSV 和文本 | 本地 OpenRouter 密钥;可选的文献/搜索服务和单独分发的生物医学资源 |
| DrugAgent (Liu et al.) | 任务描述、起始文件和评估器 | 已实现的机器学习方案、性能或失败报告,以及实验提交文件 | 使用领域文档的 Planner/Instructor 工作流;实现内容可访问性和设置情况尚未确认 |
ChemGraph 明确记录了提供和使用 MCP 工具的方式。这并不证明其他七个项目都支持相同的协议接口或当前客户端。任何跨项目连接方案都需要检查接口并单独测试。
代码、许可证与复现障碍
应将论文对应的版本快照与仓库修订版分别记录。当前 README 可能描述原始论文中没有的功能;论文中的代码可用性声明也不能证明运行环境完整。
| 项目 | 此处有来源依据的论文或研究快照 | 代码/许可证证据 | 主要复现障碍 |
|---|---|---|---|
| ChemGraph | README 引用一篇发表于 Communications Chemistry 的文章,第 9 卷,文章 33 (2026) | 仓库代码与文档说明的运行入口;Apache-2.0 | 使计算器依赖与特定工作流基础设施相匹配 |
| MDCrow | arXiv:2502.09565v1 | 仓库代码和安装指南;MIT | OpenMM 环境、提供商集成和任务设置 |
| ChatMOF | README 引用 Nature Communications 15, 4705 (2024) | 软件包配置和 CLI;MIT | 本地预测/生成模块和 GRIDAY,而不只是演示访问权限 |
| SciAgents | README 引用 Advanced Materials,文章 2413523 (2024) | Notebook 代码;Apache-2.0 许可证文本与 MIT 软件包分类器冲突 | 外部知识图谱资源、API 和尚未解决的许可证元数据问题 |
| ChemAgent (Gerstein Lab) | arXiv:2501.06590v1 | 已发布研究代码;仅有 Apache-2.0 徽标,不能确认许可证文本 | 安装部分仍为占位内容,且需要先构建记忆 |
| ChemAgent (AI4Chem) | ChemistryAgent 中的 CheMatAgent,arXiv:2506.07551v2 | 有仓库框架及数据集位置的说明;许可证未知 | 缺少部署说明,检查点也未确认 |
| STELLA | arXiv:2507.02004v1;当前 README 还链接到扩展版 bioRxiv 展示 | 有代码与运行入口的描述;Apache-2.0 | 资源需另行分发,且文献与模型输出会变化 |
| DrugAgent | arXiv:2411.15692v2 | 论文链接到匿名仓库;所提供的页面没有公开实现文件或代码许可证 | 确认代码访问权限、环境和评估器复现方式 |
在重新分发或改编之前,SciAgents 的许可证冲突需要认真处理:应检查目标代码快照并寻求澄清,而非挑选对自己最方便的标签。STELLA 的 README 与软件包元数据也使用不同的版本标签,因此不要把其中任一标签当作统一的发行版本标识。
代码许可证不会自动涵盖模型权重、数据集、API 或托管访问权限。例如,ChemGraph 的 README 单独说明了 MACE-Polar 权重适用的 ASL 条款。有关这一差异,请参阅软件、权重与数据许可证。
区分两个 ChemAgent 项目
ChemAgent (Gerstein Lab) 研究化学问题求解中的可复用记忆。任务拆分、执行、关联和反思与 Plan Memory、Execution Memory 和 Knowledge Memory 协同工作。其有文档记载的实验使用源自 SciBench 的 atkins、chemmc、matter 和 quan 数据集。论文将药物发现和材料科学列为未来可能的方向,并未将其确立为端到端工作流。
复现工作应从记忆的来源追溯和构建开始。README 对 Knowledge Memory 的称呼在 image 与 img 之间交替,路径中的 Xagent 与 XAgent 也不一致;运行实验之前,应对照所选代码版本确认正确名称。失败后的优化和启用评估是两个独立的控制项。
ChemAgent (AI4Chem) 是 ChemistryAgent 仓库中的 ChemAgent 框架,对应题为 CheMatAgent 的论文。其研究重点是外部工具选择、参数填写和执行。HE-MCTS 将规划优化与执行分开,而 ChemToolBench 支持训练和评估。它并非 Gerstein Lab 的记忆系统,简略的 README 也不足以证明它可以直接部署运行。
在笔记、依赖记录和引用中,应同时注明仓库与论文标识符;仅凭相同名称无法区分项目。
根据研究阶段与预期用途进行选择
对于计算化学,首先确定需要通用的分子/计算器编排,还是专用 MD 工作流。ChemGraph 和 MDCrow 分别是相关候选,但都不能替代方法选择。
对于材料发现,ChatMOF 适用于 MOF 专用检索、预测和生成;SciAgents 则适用于仿生材料假设的构建。ChemAgent (AI4Chem) 适合研究化学/材料工具学习,但部署路径的成熟度较低。
对于文献研究,STELLA 提供生物医学搜索和注重证据的工作流;SciAgents 使用检索来评议假设。检索范围并不保证覆盖全面。
对于药物发现,应区分靶点或变体优先级排序与机器学习编程。STELLA 描述了生物医学优先级排序工作流;DrugAgent 则研究了在 PAMPA、HIV 和 DAVIS 二元分类案例中实现和评估机器学习。其作者明确提醒,不应直接将其部署为流水线。药物发现中的 AI提供了更广泛的工作流背景。
学习时,可检查架构和规模较小且有文档说明的示例。开展复现实验时,应选择固定任务并保留产物。用于实际研究时,在推进任何输出前,应要求方法审查、证据可追溯性和独立核查。这些是建议的适用性标准,并非就绪认证。
材料研究的阶段选型可参阅材料科学 AI 工作流。
建议示例:评估 MD 助手而不过度声称
一个具体的试点方案是依据 README 中涉及蛋白质 1ZNI、300 K、0.1 ps 模拟和随时间计算 RMSD 的任务评估 MDCrow。这是工作流检查,不是科学上充分的采样研究。
- **定义输入:**记录蛋白质标识符、预期结构、温度、持续时间和 RMSD 请求。在执行前,由研究人员指定可接受的准备、力场和分析选择。
- **检查前置条件:**遵循有文档说明的环境和提供商设置。确认所需模拟工具可用,而不要假定语言接口已经提供这些工具。
- **检查决策:**在接受执行前,检查结构准备、模拟配置、原子选择和对齐选择。
- **收集输出:**索取可用的配置记录、执行日志和 RMSD 结果。若缺少这些产物,应将试点视为失败;所提供的 README 并未完整说明其格式。
- **决定是否继续:**将记录的设置和分析与研究人员准备的参考工作流进行比较。区分执行成功与动力学结果具有科学意义。
后续可考虑使用单独整理的数据集、起始文件和评估器,开展 DrugAgent 机器学习实现研究。目前没有依据证明 MDCrow 到 DrugAgent 之间存在自动交接或经过测试的互操作性。应先确认代码访问权限并定义数据契约。可复现的化学 AI介绍了此类评估所需的记录工作。
处理失败与科学局限
重试前先对失败分类。缺少引擎、无法访问资源或提供商凭据属于环境故障;工具参数格式错误属于编排故障;计算未收敛或方法不适用则属于科学失败。保留失败输入和日志,再修正相关层的问题。不要让智能体悄悄换用其他方法,只为得到一个看似成功的答案。
设置项目专属的把关要求。ChemGraph 的 EMT 示例是设置检查,并非适用于一般高精度化学的验证。尽管会审查操作,ChemGraph 的工作区 shell 并未被限制在工作区内。ChatMOF 的在线搜索演示不能代替本地预测或生成。SciAgents 提出的机制仍是假设。STELLA 提醒,基因排序可能因模型随机性和文献索引更新而变化。应根据实际评估器产物检查 DrugAgent 的性能报告,尤其要注意论文对结果造假的担忧。
开展对比实验时,应使用等效输入、记录明确的方法、固定数据快照和明晰的失败类别。不要把推理基准、检索任务和模拟完成情况合并为一个分数。智能体更多、工具更多或方案更长,都不能证明科学结论更好。
读者核对清单
- 明确所需产物和研究阶段。
- 记录仓库修订版和论文版本。
- 确认代码内容、安装指南和所需资源。
- 分别厘清代码、权重和数据的许可证问题。
- 规定输入、单位、方法选择和验收标准。
- 保留工具调用、配置、日志和原始输出。
- 为证据缺失或科学失败设定停止条件。
- 尝试交接前先审查集成方案。
来源
主要能力信息来源为以下官方 README:ChemGraph、MDCrow、ChatMOF、SciAgents 和 STELLA。
ChemAgent 项目之间的区别依据 Gerstein Lab README 和论文,以及 AI4Chem README 和 CheMatAgent 论文。DrugAgent 的架构与部署限制来自论文 v2。SciAgents 的许可证差异可见于其许可证文件和软件包元数据。