首先定义参考问题

原子间势评估应从科学规格说明开始,而不是从仓库排名开始。本集合汇集了四个面向计算化学和材料发现的候选项目。它们的工作流、检查点和模拟接口不应被视为可以互换。

撰写一页规格说明,涵盖元素、相关情况下的电荷与自旋、分子或周期性结构、几何范围以及预期用途。区分单点预测、几何优化和分子动力学:每项任务都需要各自的验收标准。

记录参考计算流程,包括能量单位、坐标单位、力的约定、边界条件以及任何能量修正。确定所需的是总能量、相对能量、力、应力还是其他性质。将这一适用范围附在每次比较中,避免把一个领域的结果当作另一个领域的证据。

分别检查四个项目

以下能力由项目来源资料描述;它们不是 ChemAI Atlas 测试得出的结论。

  • MACE 提供高阶等变原子间势、训练和基于 XYZ 的评估工作流、预训练模型推理以及微调。其 ASE 示例展示了计算器的使用。来源资料区分了面向材料的 MACE-MP 与面向有机化学的 MACE-OFF 模型,因此选择模型系列本身就是评估的一部分。
  • NequIP 是一个用于 E(3) 等变原子间势的框架。其文档介绍了基础势、编译、微调以及 ASE 和 LAMMPS 接口。Allegro 是单独的扩展软件包,并非核心框架的别称。具体数据格式和预测接口仍需查阅相关指南确认。
  • SchNetPack 支持使用 SchNet 和 PaiNN 表征构建并训练原子网络。其示例涵盖量子化学性质和带有力与应力导数的能量面。它还介绍了分子动力学组件和 LAMMPS 接口。应选择具体的模型配置,而不要把这一工具箱视为单一预训练势。
  • TorchANI 支持在 PyTorch 中开发、训练和使用 ANI 风格的势,并可选用 C++ 和 CUDA 扩展。其 README 指向一个独立的 TorchANI-Amber 接口,用于完整的机器学习和 ML/MM 模拟。参考摘录并未确立各个模型的覆盖范围、输入格式或输出结构。

对每个候选项目都应询问:具体模型是否适用于目标化学体系,还是该项目仅提供训练模型的基础设施?

建立比较工作表

每个选定的发布版本和模型资产各占一行,而不仅仅是每个仓库一行。使用以下字段,明确显示缺失的证据:

字段 记录内容
身份信息 发布版本或提交、模型标识符和资产来源
化学覆盖范围 元素、体系、电荷/自旋条件以及文档说明的排除项
参考数据 训练来源、理论水平和能量约定
输入 几何结构格式、标签、单位、晶胞和预处理
输出 性质名称、形状、单位和导数约定
训练 数据划分文件、随机种子、损失函数、设置和参考能处理方式
部署 计算器或模拟接口、编译和依赖项
证据状态 来源资料所述、拟评估、已在本地验证或未知

只有团队实际执行并记录了相关检查后,才应将状态标为“已在本地验证”。未记录的条件应保持为未知,而不是被当作默认值。

通过决策问题缩小候选范围:所需标签是否可用?是否有文档说明存在匹配的预训练资产?能否通过选定接口获得预期输出?调整模型是否会改变比较的范围或预算?

评分前对齐输入与输出

以下步骤是拟议的评估流程,并非经过测试的跨项目集成方案。

  1. 固定一小组带有稳定构型标识符的参考数据,并保留原始计算记录。
  2. 分别准备每个项目所需的输入。转换后检查元素编码、原子顺序、坐标、晶胞信息和性质标签。
  3. 将输出映射到统一的比较表并记录:构型标识符、预测与参考能量,以及按原子索引的力分量。仅在所需且所选配置支持时纳入应力。
  4. 计算误差前检查单位、力的符号、能量偏移以及报告的是总量还是每原子数值。
  5. 将转换失败、不支持的输入和非有限预测单独记录在失败日志中;不要在分母中悄然删去这些情况。

MACE 文档说明了如何从 XYZ 文件和已保存模型进行评估,并输出 XYZ 文件。这并不能证明其他项目具有相同的文件约定。同样,文档中介绍了模拟接口,也不代表它与您的已安装环境兼容。

规划示例:中性分子构象

**假设示例:**一个团队希望预测含碳、氢、氮和氧的中性分子的相对构象能量与力。这是一个规划情景,并非性能结果。

团队首先应规定统一的参考电子结构计算流程,并汇集带标签的构型清单。与仅依赖随机帧划分相比,可以将不同构象系列分别分配到训练集、验证集和测试集。另行标注的挑战集可以包含超出预期适用范围、畸变程度更高的几何结构。

对于 MACE,团队应考察有机模型资产或训练工作流,并核对其参考化学体系。对于 NequIP,应确认文档所述的预训练资产是否符合规格,或是否需要训练。对于 SchNetPack,应选择表征方式以及能量/力输出配置。对于 TorchANI,则应先在文档中确认所选模型覆盖的元素和分子领域。

拟定的输出包括覆盖范围工作表、对齐后的预测表和失败报告。如果某项资产的能量参考与团队的参考方法不同,团队应解决这一差异,或将其作为单独问题进行评估;不应根据原始绝对能量差异就判定其表现较差。

审查可复现性、资产和局限性

保留软件版本、配置文件、数据集划分、预处理选择以及检查点标识符,并与之后可能产生的结果一同归档。分别审查代码、预训练权重和训练数据的来源以及适用权限;不能仅凭仓库元数据决定资产使用方式。

迁移与平台限制也很重要。MACE 说明其重写版本需要关注代码和检查点迁移,而 NequIP 和 TorchANI 则说明现有用户可能面临兼容性变化。TorchANI 明确指出,来源资料中未测试 AMD GPU 和 Apple MPS 支持。应将这些记录为来源资料所述的条件,而不是本集合得出的兼容性结论。

MACE 还提醒,原始 MACE-MP DFT 能量不能直接与带有兼容性修正的 Materials Project 能量比较。更广泛地说,安装成功、仓库流行度以及架构相似都不能证明科学上的可迁移性。平均误差应与构型级失败情况及对分布外行为的单独检查一并报告。

简要评估清单

  • 定义化学体系、目标输出和验收标准。
  • 选择可明确识别的发布版本和模型资产。
  • 将缺失的覆盖范围或接口证据标为未知。
  • 固定参考计算、数据划分和转换记录。
  • 评分前核实单位和约定。
  • 保存失败情况、来源信息和可复现性细节。

本集合尚待编辑审查。它不提供性能排名、一手科学测试或经测试的集成声明。