跳转到正文

Matbench Discovery

Janosh Riebesell

Matbench Discovery 对机器学习模型在晶体稳定性和原子模拟任务中的表现进行基准评估,并通过交互式排行榜比较准确性、稳健性和计算成本。

条目更新 ·

概览

Matbench Discovery 是一项基准评估和交互式排行榜,用于评估机器学习模型在无机晶体发现和原子模拟中的表现。其文档所述范围不止于稳定性预测,还包括几何优化、声子与热导率、分子动力学以及双原子势能曲线。它支持模型比较,而不是单一的预测模型或通用材料数据库。

排行榜收录了图神经网络原子间势、图神经网络单次预测模型、迭代贝叶斯优化器,以及使用浅层学习结构指纹的随机森林。在研究工作流程中,它可以帮助判断哪些方法值得在静态或有限温度模拟中进一步评估。该基准将预测的材料性质(包括热力学稳定性、热导率和原子位置)与各任务对应的参考数据进行比较。其输出包括模型排名,以及准确性、稳健性和计算成本方面的比较;来源摘录未说明完整的输入模式或提交产物格式。

一项重要的解读限制是:晶体稳定性评估采用由 DFT 参考能量构建的凸包,而非模型预测的能量。用户在解读结果或与其他基准进行比较时应考虑这一选择。项目还提醒,排行榜位置不能全面体现模型推动材料研究进展的能力,也不代表 Materials Project 的背书。贡献指南说明了提交新模型的文档化流程,仓库还包含 Python 包配置。

主要功能

  • 交互式排行榜,对晶体稳定性、几何优化、声子与热导率、分子动力学以及双原子势能曲线相关任务中的模型进行排名。
  • 涵盖多种模型类别,包括 GNN 原子间势、GNN 单次预测模型、迭代贝叶斯优化器,以及基于指纹的随机森林。
  • 按任务进行比较,以呈现准确性、稳健性和计算成本之间的权衡。
  • 稳定性评估依据由 DFT 参考能量而非模型预测构建的凸包。
  • 提供模型贡献流程,并附有指南链接和针对特定分支的拉取请求说明。

使用场景

  • 建议的评估方式:筛选晶体稳定性模型,再评估其是否适用于预期的发现工作流程。
  • 建议的评估方式:利用相关排行榜任务,比较适用于几何优化或有限温度模拟的候选原子间势。
  • 建议的评估方式:在规划针对目标材料体系的独立验证前,查看声子和热导率结果。
  • 建议的评估方式:按照贡献指南准备新模型提交,以便在该基准的参考数据框架内进行比较。

使用方式

  1. 打开交互式排行榜,并确定与你的工作相关的任务,例如晶体稳定性、几何优化或热导率。
  2. 解读发现任务的排名前,查阅稳定性基准说明。请注意,评估所用凸包基于 DFT 参考能量,而非模型预测。
  3. 比较相关模型类别,以及现有的准确性、稳健性和计算成本信息。将其视为后续评估的候选清单,而非模型适用于你的材料或模拟条件的证明。
  4. 如果要在本地开展基准工作,请检查仓库配置中声明的依赖项和 Python 要求。请在项目文档中确认特定任务的输入和流程;来源摘录未给出执行步骤。
  5. 如需提交新模型,请遵循贡献指南,包括其中针对特定分支的说明。支持问题可在GitHub 讨论区提出。

相关资源

ALIGNN

模型

ALIGNN 提供用于材料性质预测的原子图神经网络,并包含训练工作流、预训练预测器和用于结构优化的 ALIGNN-FF 力场。

开源Python

材料发现

Allegro

模型

Allegro 在 NequIP 框架中作为扩展实现 E(3)-等变原子间势,并提供文档说明的 GPU 加速选项,以及用于 LAMMPS 模拟的独立插件。

开源Python

计算化学 · 材料发现

computational-chemistry-agent-skills 集合中的 ASE 路由 Skill,将工作流准备与计算器配置分开,并将执行委托给其他环节。

计算化学 · 材料发现

CGCNN

模型

CGCNN 实现了晶体图卷积神经网络,可根据晶体结构学习材料性质,并支持使用自定义数据训练模型以及使用预训练模型进行预测。

开源Python

材料发现

ChatMOF

智能体

ChatMOF 是一个代码可用的研究系统,利用语言模型引导的工具,根据自然语言请求检索 MOF 数据、预测性质并生成结构。

开源Python

材料发现

ChemAgent (AI4Chem) 是一个面向化学与材料领域工具使用的研究框架,与 CheMatAgent 论文相关;该论文介绍了基于树搜索的规划、工具执行以及基于 ChemToolBench 的训练。

计算化学 · 材料发现

相关指南

智能体

化学 AI Agent 指南:从聊天助手到自主科研工作流

一份实用指南,介绍八个化学与生物医学研究智能体:工具、记忆、规划和多智能体角色如何运作,哪些项目适合不同任务,以及如何在科学监督下评估有界自主性。