材料 AI 最有用的方式,是让每个组成部分承担边界明确的任务:检索记录、准备计算、分析产物或提出假设。对话界面并不会让这些任务在科学上变得可以互换。应先明确研究问题及回答问题所需的证据,再选择能够支持相关工作的最小资源组合。
本指南涵盖材料发现、计算化学和科学数据工作流。下文列出的组合是建议评估的设计,并非经过测试的互操作性主张。
1. 选择工具前先了解各层
Materials Project 是上游数据服务;mp-api 是用于访问该服务的客户端。第三方 Materials Project MCP server 向助手客户端提供数据库操作。它既不是新的材料数据库,也不是预测模型。
ChatMOF 和 SciAgents 等智能体在特定研究系统中协调推理与工具。Skills 是程序性指令,有时会附带辅助工具。本文所述的 Pymatgen、ASE、Phonopy 和 pycalphad Skills 与其上游科学软件包相互独立。加载 Skill 并不会安装计算器、获取热力学数据库或配置计算资源。不同宿主对 Skills 的支持也有所不同。
有关架构区别,请参阅 MCP、Skills、智能体与 API。化学领域的 MCP 指南提供协议背景,而化学领域的 AI Skills介绍基于指令的工作流。当前协议背景并不能证明旧项目的客户端配置兼容。
编排层的角色与边界可参阅化学 AI Agent 指南。
2. 将各项资源与研究职责相匹配
下表列出的角色依据所提供的文档整理,并非要求将所有资源都接入同一条流水线。
| 资源 | 文档所述角色 | 主要输入与输出 | 重要边界 |
|---|---|---|---|
| Materials Project MCP | 通过 mp_api 访问数据库 |
元素/属性筛选条件或标识符 → 记录、结构和选定的属性数据 | 第三方封装;需要 Materials Project 身份验证 |
| Pymatgen Skill | 结构验证、转换规划、对称性敏感性检查和本地凸包分析 | 结构或兼容的能量条目 → 报告、转换后的产物和相图分析 | 计算出的凸包取决于所提供的能量和竞争相 |
| ASE Skill | 将工作流准备与计算器配置分开路由 | 任务意图 → 分支、理由、缺失输入和下一步委派 | 顶层路由器不会执行计算 |
| Phonopy Skill | 整理位移/力数据集和声子分析 | 结构、设置和力 → 组装状态以及声子色散/DOS/热学文件 | 需要独立的力计算提供方和提交工作流 |
| pycalphad Skill | 指导本地有限温度 TDB 平衡计算 | 数据库及成分/条件设置 → 数值报告和相平衡 CSV | 平衡与数值一致性并不等于动力学或实验验证 |
| ChatMOF | 面向 MOF 的检索、预测和生成 | 自然语言请求 → 依任务而定的信息、预测或结构 | 本地预测/生成需要额外模块;生成需要 GRIDAY |
| SciAgents | 基于知识图谱的假设开发与评议 | 关键词或图谱探索 → 结构化假设和研究草稿 | 提案和新颖性评估需要独立评价 |
3. 从边界明确的数据库问题开始
Materials Project MCP README 记载了按元素、带隙范围和稳定性进行搜索的 search_materials,以及通过 get_structure_by_id 获取结构的功能。其他工具涵盖电子和声子数据、弹性、介电性质及其他材料记录。某项工具虽有相关说明,并不保证特定候选材料具备所需数据。
检索前,建议明确查询约定:化学体系、允许的元素、请求字段、结果数量上限,以及缺失值的表示方式。应区分“未返回”与“计算结果显示不存在”。保留标识符、检索时间、查询条件和可用的计算来源信息。
Pymatgen Skill 提供另一种边界明确的检索方式:其 Materials Project 辅助工具默认采用离线规划,网络执行则需要明确批准和身份验证。初期应选择一种检索路径,而不是通过两个接口重复请求,却没有数据协调方案。
**决策点:**如果现有记录不足以支持预期比较,就缩小问题范围或规划新的计算。不要把助手生成的估算值填入缺失属性,并将其当作数据库值呈现。
4. 建议示例:筛选晶体,再研究选定候选材料
设想一个建议开展的 Li–Fe–O 晶体筛选练习。目标是整理出可追溯的候选短名单以供后续计算,而不是宣布一种新近获得验证的材料。
**输入:**明确的化学体系范围、用户选定的筛选标准、有限检索的许可,以及所关注计算属性的说明。此处不假定任何候选结果或性能结果。
- **检索范围明确的候选集。**使用 MCP server 或 Pymatgen 查询辅助工具,获取标识符、结构和可用的热力学元数据。将返回记录原样保存,并另存一份用于分析的副本。
- **验证结构。**使用 Pymatgen Skill 的数据接收工作流,检查晶格、周期性、坐标约定、占位率、解析器警告和氧化态处理。生成对称性敏感性报告,而不是依赖一个未加说明的容差。
- **审查短名单。**区分因既定标准而排除的候选材料,以及因数据缺失或含糊而暂缓处理的记录。保留每项决定的理由。
- **准备可选的新计算。**对于需要弛豫或静态计算的候选材料,使用 ASE 路由器确定工作流分支及计算器配置依赖项。研究人员仍须选择合适的后端和执行环境。
- **分析与问题相匹配的证据。**只有在能量兼容且竞争相充分时,才构建本地凸包。若研究声子问题,则应先确定位移超胞的力数据或预先计算的力常数,并制定可追溯的组装计划,再开始分析。
**输出:**候选材料表、验证报告、计算准备交接内容、可选分析产物,以及将每项产物与其来源关联起来的清单。
**停止/继续决策:**未解决的无序问题可能阻止转换;不兼容的能量约定会阻止凸包比较;缺少位移力数据会阻止声子组装。证据不完整时,可以暂缓处理候选材料,而非接受或排除。
5. 明确计算与分析之间的交接
建议的架构为:范围明确的检索 → 结构接收 → 经人工批准的计算计划 → 单独执行的计算 → 分析 → 证据报告。每个箭头都是待评估的交接环节,而非已验证的连接器。
ASE Skill 会将静态、弛豫、分子动力学和 NEB 请求路由到 ase/ase-workflows,并将后端配置路由到 ase/ase-calculators。混合请求从工作流分支开始。其要求的响应会指出所选分支、理由、缺失输入和下一步委派。需要执行的任务通过 dpdisp-submit 委派;所提供的顶层文件并未说明下游行为的具体细节。
Phonopy Skill 将力评估与位移生成及分析分开。收集超胞、位移振幅、原胞背景和对称性选择等信息。声子色散计算需要定义路径和采样;DOS 与热学输出需要网格设置,热学分析还需要温度。组装 FORCE_SETS 或力常数前,应保留位移与力文件之间的对应关系。
因此,建议在 ASE 到 Phonopy 的交接中核实晶胞约定、物种顺序、力的单位和文件对应关系。仅仅研究对象相同,并不能证明两个指令资源可以互操作。
6. 区分稳定性的四种含义
**凸包筛选:**Pymatgen Skill 的本地相图分析会比较所提供的计算条目。是否位于凸包上,取决于竞争相、兼容的总能量和校正方案。这并不直接说明实验稳定性。
**有限温度平衡:**pycalphad Skill 使用本地 TDB、选定的组元/相、整体元素摩尔分数、压力和温度。其辅助工具要求恰好提供 N-1 个独立元素分数,并指定一个非空位元素作为从属元素。它会导出摩尔相分数和组成,并保留同名相的不同组成集。
**声子评估:**结果解读取决于力数据质量、超胞和收敛性选择、单位以及相关长程修正。Phonopy 来源明确指出,虚频可能源于收敛不足或设置选择;应将这类输出视为需要诊断的问题,而非自动得出实验结论。
**实验稳定性:**上述任何工作流都不能确立实验稳定性。CALPHAD 平衡不能预测析出速率或保留下来的亚稳微观结构,数值检查也不能证明数据库准确。
当合适的热力学数据库能够支持相关问题时,可将 pycalphad 用作独立分支。其附带的 ideal-cu-ni.tdb 是假设性的教学模型,并非经过评估的 Cu–Ni 数据库,也不能在晶体筛选示例中替代此类数据库。
7. 在专业领域匹配时使用智能体
当问题涉及 MOF 和自然语言检索、预测或结构生成时,可考虑评估 ChatMOF。其架构由智能体负责规划/工具选择,由工具包执行任务工作,再由评估器汇总响应。评估器并不代表科学验证。在线演示以搜索为主;README 警告,除提供的示例外,预测和生成通常无法在该演示中正常工作。
SciAgents 处于不同阶段:根据科学知识图谱开发仿生研究假设。Ontologist 负责澄清概念,Scientist 角色负责提出方案,Critic 则审视薄弱之处。自动化方法还增加了规划和新颖性检查。运行它需要 GraphReasoning、API、图文件和嵌入,而不只是与 LLM 对话。
建议的组合刻意保持精简:检索加 Pymatgen 用于数据库初筛;结构接收加 ASE 准备用于新计算;力提供方工作流加 Phonopy 用于声子分析;pycalphad 加合适的 TDB 用于平衡问题。MOF 专项任务使用 ChatMOF,假设探索使用 SciAgents;它们并非无机晶体筛选的必经环节。
8. 明确呈现故障与部署方面的不确定性
若遇到访问失败,应先检查身份验证和部署方式,再调整科学筛选条件。MCP 来源记载了 Docker 和本地 Python 两种路径;本地设置需要 Python 3.12 或更高版本以及 uv,并提供 Claude Desktop 和 VS Code Copilot 的客户端示例。应在目标宿主环境中评估这些配置;文档说明不等于兼容性测试。
对于格式错误的结构或有损转换,应保留原始内容并报告警告。Pymatgen 验证器的距离检查无法完整处理跨越极短晶格矢量的接触。力数据集不完整时,应停止组装。若 pycalphad 的质量守恒或采样敏感性检查失败,应在报告中保留这些失败,而不是将结果重新标记为已收敛。检查端点附近由求解器施加的成分调整。
还需要针对具体产物审查权利条款。SciAgents 对代码许可存在相互冲突的 Apache/MIT 声明,而 ASE Skill 的 MIT 声明与其所属集合中的 LGPL 文本不同。重新分发前应明确适用条款。仓库可访问并不能解决这些冲突,也不能确立对外部数据库、图谱或模型资产的权利。
9. 读者检查清单
- 选工具前先定义研究问题和所需证据。
- 区分数据库值、预测、假设和新计算。
- 限定检索范围,并记录标识符、来源和缺失字段。
- 验证结构并记录转换造成的信息损失。
- 分别审批计算器、资源限制和执行方式。
- 分析前检查能量是否兼容,或位移力数据是否完整。
- 根据各自不同的假设报告凸包、平衡和声子结论。
- 保留清单、数值失败记录和未决决策。
- 实验主张应以适当的实验性证据为依据。
继续阅读相关指南:计算化学 AI 工作流:从结构到模拟与结果分析。
来源
Materials Project MCP README支持其工具清单和部署要求。ChatMOF README和SciAgents README支持有关智能体角色、依赖项和范围的说明。
具名的 Pymatgen Skill、ASE Skill、Phonopy Skill和pycalphad Skill支持其工作流约定和科学局限性。
许可差异可对照 SciAgents 许可文件、包元数据与 ASE 合集许可。